WHY NOW
端侧 LLM 的瓶颈,
不是峰值算力。
逐 token 生成受到容量与带宽约束,模型结构又在持续演进。端侧需要围绕真实数据流重新组织计算、存储和软件调度。
算力与访存协同
从大模型推理的数据流出发,通过计算、加载与写回重叠,提升有效带宽利用率。
多精度与 MoE
支持面向端侧的低位宽格式,并针对稀疏 MoE 的专家调度与权重搬运优化。
不更换原有平台
通过加速卡为已有工控机、算力盒和终端补充本地推理能力,减少平台重做成本。
BUSINESS LINES
从可授权 IP,
走向标准加速卡。
两条业务线共享同一套计算、互连和软件体系:一条服务芯片与子系统客户,一条面向设备厂商提供标准产品。
GPNPU 芯片与加速卡
从 IP 和子系统走向 VLX 产品家族。VLX-64 面向端侧推理,提供 M.2 加速卡与 USB 工程模组形态。
- VLX-64:M.2 8 / 16 / 32GB
- USB 工程模组:16GB
- VLX-512:后续高容量产品路线
AI 计算与互联 IP
面向芯片设计公司提供 FusionCore 计算 IP、ScaleNoC 互连 IP,以及子系统与定制设计服务。
- 可独立授权或组合交付
- 按模型、精度、接口和系统规模配置
- TileFlow 提供编译与运行时支持
USE CASES
让存量设备,
获得本地大模型能力。
从工控机、算力盒到智能终端和机器人,在保留原有 CPU、系统与业务软件的前提下扩展 AI。
工控机
知识库问答、文档检索和语音交互同时在线。
算力盒
为行业设备增加可部署的本地模型推理能力。
智能终端
在功耗和成本约束下提供实时交互体验。
机器人
并行运行视觉、语言理解、规划与控制模型。
