本站点使用Cookies,继续浏览表示您同意我们使用Cookies。 Cookies和隐私政策>

简体中文

承载2.8万亿模型 首破5.85毫秒

元脑AI超节点SD200 Ultra

元脑 SD200 Ultra 超节点 AI 服务器机柜
前沿模型不断演进

AI计算系统的挑战

模型能力的突破,并不意味着这些能力就能直接被使用。只有计算系统能够跟上前沿智能的发展——让更大的模型承载得住、更低的时延支撑得起、更长的任务稳定运行,模型能力才能真正转化为可用的智能。

模型前沿
01

模型前沿

  • 前沿智能持续Scaling,模型参数量从671B迈向2.8T乃至10T级,上下文从128K扩展至1M+,Agent从单体走向成百上千协同
  • 模型权重、KV Cache与并发任务规模的持续增长,对计算系统的显存容量、高速互连提出极限挑战
极低时延
02

极低时延

  • Agent任务包含上百轮“推理—工具调用—反馈”循环,计算开销和跨卡通信延迟会持续累积
  • 当AI从离线分析走向实时决策,时延开始决定任务能否完成
长程稳定
03

长程稳定

  • 复杂的Agent任务需要连续运行几小时甚至几天时间,任何一次故障,都可能中断整个任务
  • 计算系统需要支撑Agent周级任务的稳定运行
元脑 SD200 Ultra 超节点 AI 服务器
产品亮相

元脑 SD200 Ultra
超节点 AI 服务器

基于本土AI芯片,单机承载运行2.8万亿参数的Kimi K3大模型,Token生成时延首次突破5.85毫秒。以开放系统设计紧耦合128芯本土AI芯片,实现统一内存寻址超低延迟通信,支持10万亿参数规模前沿模型,打造面向Agent 时代的能力型智算标杆。

128 芯
本土 AI 芯片 · 开放系统紧耦合
8 TB
统一编址显存(另有 64TB 内存)
0.69 μs
原生内存语义通信时延
10 万亿
支持前沿模型参数规模
性能突破

5.85msToken生成时延支撑前沿模型突破智能上限

这一性能突破,来自于对系统架构、通信机制、算子等全方位优化。相当于单用户速度 170 Tokens/s,达到业界平均水平的 5 倍——突破了基于本土 AI 芯片超节点对超大规模前沿模型的单机承载能力,加速释放前沿模型的应用价值。

紧致扩展

8TB 统一编址显存

3D Hyper Mesh 架构以开放系统设计紧耦合 128 芯本土 AI 芯片,提供 8TB 统一编址显存和 64TB 内存,支持 10 万亿参数规模前沿模型单机运行。原生内存语义通信减少跨芯片访问的中转和数据搬移,通信时延低至 0.69 微秒;短距铜缆互连减少光电转换环节,降低链路故障引发任务中断的风险。

统一寻址

百纳秒级互连域

通过全局统一编址、虚拟影子设备映射、跨域地址翻译与路由,实现 GPU 跨主机域的统一寻址访问,构建百纳秒级低时延的内存语义互连域。远端资源访问从传统的“消息通信与数据搬移”转变为统一地址空间下的直接访问,降低通信开销,为超节点扩展提供基础。

对称直连

AllReduce 降低 3.5 倍

在统一寻址基础上,通过对称内存技术首次在基于本土 AI 芯片超节点上实现 GPU 显存直连,使 GPU 能够像访问本地显存一样直接访问远端 GPU 显存数据。GPU 直接发起通信,减少地址转换、避免缓冲区中转,AllReduce 通信时间降低 3.5 倍,达到国际领先水平。

超级算子

推理性能提升 3 倍+

针对 Kimi K3 的推理特点,通过使用 Kimi K3 构建超级算子智能体,率先实现通算融合、Tile 级流水的超级算子:将 KDA、Gated MLA、MoE 中的众多基础算子融合为计算与通信协同执行的大算子,算子数量降低 10 倍。通过“K3 优化 K3”,Kimi K3 推理性能提升 3 倍以上。

前沿模型持续扩展

从 6710 亿到 10 万亿级

前沿模型正在多个维度持续扩展,元脑 SD200 Ultra 以 8TB 统一编址显存与 64TB 内存,支持 10 万亿参数规模前沿模型单机运行。

6710 亿
DeepSeek R1
上一代前沿模型
2.8 万亿
Kimi K3 · 单机承载运行
SD200 Ultra 已实现
10 万亿级
下一代前沿模型规模
单机运行已就绪
从“提供算力”走向“生产智能”

打造面向 Agent 时代的能力型智算标杆

SD200系列—面向全行业、商用交付超节点

售前咨询

售后服务

意见反馈

回到顶部

回到顶部

收起
回到顶部 回到顶部
请选择服务项目
售前咨询
售后服务
访问 AIStore

扫码访问AIStore