本站点使用Cookies,继续浏览表示您同意我们使用Cookies。
Cookies和隐私政策>
模型能力的突破,并不意味着这些能力就能直接被使用。只有计算系统能够跟上前沿智能的发展——让更大的模型承载得住、更低的时延支撑得起、更长的任务稳定运行,模型能力才能真正转化为可用的智能。



基于本土AI芯片,单机承载运行2.8万亿参数的Kimi K3大模型,Token生成时延首次突破5.85毫秒。以开放系统设计紧耦合128芯本土AI芯片,实现统一内存寻址超低延迟通信,支持10万亿参数规模前沿模型,打造面向Agent 时代的能力型智算标杆。
这一性能突破,来自于对系统架构、通信机制、算子等全方位优化。相当于单用户速度 170 Tokens/s,达到业界平均水平的 5 倍——突破了基于本土 AI 芯片超节点对超大规模前沿模型的单机承载能力,加速释放前沿模型的应用价值。
3D Hyper Mesh 架构以开放系统设计紧耦合 128 芯本土 AI 芯片,提供 8TB 统一编址显存和 64TB 内存,支持 10 万亿参数规模前沿模型单机运行。原生内存语义通信减少跨芯片访问的中转和数据搬移,通信时延低至 0.69 微秒;短距铜缆互连减少光电转换环节,降低链路故障引发任务中断的风险。
通过全局统一编址、虚拟影子设备映射、跨域地址翻译与路由,实现 GPU 跨主机域的统一寻址访问,构建百纳秒级低时延的内存语义互连域。远端资源访问从传统的“消息通信与数据搬移”转变为统一地址空间下的直接访问,降低通信开销,为超节点扩展提供基础。
在统一寻址基础上,通过对称内存技术首次在基于本土 AI 芯片超节点上实现 GPU 显存直连,使 GPU 能够像访问本地显存一样直接访问远端 GPU 显存数据。GPU 直接发起通信,减少地址转换、避免缓冲区中转,AllReduce 通信时间降低 3.5 倍,达到国际领先水平。
针对 Kimi K3 的推理特点,通过使用 Kimi K3 构建超级算子智能体,率先实现通算融合、Tile 级流水的超级算子:将 KDA、Gated MLA、MoE 中的众多基础算子融合为计算与通信协同执行的大算子,算子数量降低 10 倍。通过“K3 优化 K3”,Kimi K3 推理性能提升 3 倍以上。
前沿模型正在多个维度持续扩展,元脑 SD200 Ultra 以 8TB 统一编址显存与 64TB 内存,支持 10 万亿参数规模前沿模型单机运行。
访问 AIStoreAIStore是基于元脑生态打造的商业协作线上平台,作为知识资源平台、交流服务平台和商机孵化平台,赋能“百模”与“千行”的对接,目前已上架200+产品和方案,在智能票据识别、AI工业质检、代码生成、视觉智能标注、AI健康助手等领域实现成功牵手和落地应用,助力千行百业加速AI产业创新,高效释放生产力。

扫码访问AIStore