本站点使用Cookies,继续浏览表示您同意我们使用Cookies。
Cookies和隐私政策>
在近日举行的2026人工智能计算大会(AICC2026)上,浪潮信息首席AI战略官刘军现场发表了主题演讲《从提供算力到生产智能 Agent时代的AI计算系统挑战和创新》。
刘军指出,随着Agent从回答问题走向持续执行复杂任务,智能正在成为可以规模化生产和供给的资源,AI计算也由此形成两个重要的发展方向:以Capability AI Compute能力型智算突破智能上限,支撑前沿模型与复杂智能任务;以Capacity AI Compute容量型智算实现智能充分供给,让更多个人和企业能够以可负担的成本使用高水平智能。计算系统的价值,也进一步体现为能够支撑多强的智能、能够以多低的成本生产多少智能。
以下为刘军在2026人工智能计算大会(AICC2026)的演讲实录:
大家好。非常高兴今天有机会和大家交流,我们对Agent(智能体)时代AI计算系统的一些思考。
我们看到,从2022年ChatGPT横空出世,到今天快速发展的Agent,AI正在发生一个非常重要的变化,就是从“回答问题”走向“解决问题”。
今天,一个Agent接到任务以后,可以理解目标、制定计划、调用工具、读取数据、编写程序、执行任务、检查结果;发现问题以后,还可以重新规划、再次执行。多个Agent还可以组成Agent Swarm(智能体集群),分工协同,共同完成更加复杂的任务。
当前,面对一个复杂任务,背后已经不再是一次模型调用,而可能是几十次、几百次的模型推理,也可能是多个Agent连续几个小时、甚至多天的协同工作。
回顾人类社会的发展,几乎每一次生产力的巨大跃迁,背后都伴随着一种关键能力的突破。比如,机械化扩展了人的体力;电气化让能源实现了规模化供给;计算机扩展了人的计算能力。今天,人工智能正在对“智能”做类似的事情。
智能一直是人类社会最重要、同时也是最稀缺的资源之一。不管是科学家、工程师还是医生,一个人的精力和一生能够深入研究的问题总归是有限的。人的知识、经验、判断和时间,决定了高水平智能天生就是一种稀缺资源。
但今天,Agent让我们第一次看到:智能有可能像计算和电力一样,成为一种可以被大规模生产和供给的资源。知识、推理、判断、创造、规划,这些过去高度依赖于人的个体能力,今天第一次开始能够被计算、被复制、被调用,甚至被规模化生产。
这意味着,智能正在成为一种新的生产要素。

我们认为,AI计算正在向两个方向发展。一是不断向上,支撑突破智能上限,解决过去解决不了的问题。我们叫Capability AI Compute,即能力型智算;另外一个是不断向广,实现智能充分供给,让智能越来越便宜、越来越丰富,让更多人、更多企业、更多行业都能够获取智能。我们叫Capacity AI Compute,即容量型智算。
今天,我想围绕这两个主题,介绍我们的思考和实践。

向上:Capability AI Compute能力型智算 支撑突破智能上限
我们先来看Capability AI Compute,也就是能力型智算。
当前,我们已经看到,前沿AI正在不断突破智能上限。比如,今天的人工智能已经能够完成从靶点发现到新的药物分子筛选和设计,并且进入临床试验;能够解决困扰学术界几十年的纳维-斯托克斯方程(Navier-Stokes equations,简称NS方程)、孪生素数问题;能够自主设计AI芯片,并且不断迭代计算性能;能够自己读论文、提假设、做实验,并持续进行修正。
总的来说,AI已经在改变人类发现新知识、理解新规律、创造新技术的方式。
AI正在不断突破人类认知和任务能力的边界。但是,模型能力的突破,并不意味着这些能力就能够直接被使用。要把前沿模型真正转化为可用的智能,支撑它的计算系统必须同时满足三个核心要求。
首先,是跟得上前沿模型的发展速度。
前沿模型今天的进步正在多个维度持续Scaling。2025年全球开源模型的前沿代表是DeepSeek R1,参数量是671B,增长到Kimi K3的2.8万亿。预计今年、明年模型参数量将进一步走向10万亿级。
上下文长度也在快速增长,从去年的128K,到今年1M,百万上下文已经成为大家的标配,我们预计2M、5M会成为接下来上下文长度的发展方向。Agent也从单体工作走向成百上千甚至上万个Agent协同。
模型权重、KV Cache和并发任务规模同步增长,对任务的显存容量、高速互连以及并行扩展效率提出了极限挑战。只有把足够多的计算、存储和通信资源组成一个整体,前沿模型的能力才能真正运行起来。
第二,是满足极低时延的推理要求。
复杂Agent任务往往包含上百轮“推理、工具调用、结果反馈和重新规划”的循环。每一轮增加几秒钟,最终都会在整条任务链路上累积成数分钟甚至更长的延迟。
而我们的一些任务需要在尽可能短的时间内完成。比如,在生产系统发生故障时,Agent需要在故障仍在扩散的过程中,快速读取日志、定位根因并验证修复方案;在人类面对公共卫生事件,比如全球性传染病时,我们需要智能更快速地找到适合的疫苗和药物,帮助我们应对全球性的卫生事件挑战。
所以,时延不仅影响使用体验,也开始决定一个任务能否成功完成。
第三,是支撑长程任务的稳定运行。
复杂Agent任务需要连续运行几小时,甚至几天,经历大量模型调用、工具调用和数据交互。任何一次计算、通信或者软件故障,都可能中断整个任务,使之前的推理和执行失去价值。
因此,计算系统不仅要关注单次推理是否成功,还要支撑Agent长时间、持续稳定地运行。
今天,我们正式发布元脑SD200 Ultra超节点AI服务器。元脑SD200 Ultra基于本土AI芯片,单机承载运行2.8万亿参数的Kimi K3大模型,Token生成时延首次突破5.85毫秒,相当于单用户速度170 Tokens/s,达到业界平均水平的5倍。元脑SD200 Ultra以开放系统设计紧耦合128芯本土AI芯片,实现统一内存寻址超低延迟通信,支持10万亿参数规模前沿模型,打造面向Agent时代的能力型智算标杆。

SD200 Ultra之所以能够实现这样的突破,来自于我们围绕前沿模型和长程Agent任务,在系统架构、通信机制和互连可靠性上的持续创新。
■ 在架构层面,我们采用3D Hyper Mesh架构,将128颗AI芯片组织成协同计算的整体,提供8TB统一编址显存,并配合64TB内存,为模型权重和不断增长的KV Cache提供承载空间。这样,前沿模型就能够充分利用多颗芯片的计算和显存资源,支持10万亿参数模型在单机上部署和运行。
■ 在通信层面,我们采用原生内存语义通信,减少跨芯片访问中的中转和数据搬移,通信时延低至0.69微秒,RTT时延1.4微秒,相比国内外同类超节点产品具有明显优势。
■ 在互连可靠性上,我们采用铜互连,减少光电转换环节,链路失效率为光互连的百分之一。面对持续数小时、甚至数天的复杂任务,可以降低链路故障引发任务中断的风险,支撑Agent持续推进推理和执行。

在传统的集群系统中,各主机地址空间彼此独立,跨主机访问需要依赖软件显式通信、搬移数据,制约了超节点GPU资源的统一编址与高效协同。
我们在SD200 Ultra中,通过全局统一编址、虚拟影子设备映射、跨域地址翻译与路由,实现了GPU跨主机域的统一寻址访问,构建了百纳秒级低时延的内存语义互连域。这种全局统一寻址能力,使远端资源访问从传统的“消息通信+数据搬移”模式,转变为“统一地址空间下的直接访问”模式,降低了通信开销,为超节点扩展提供了基础。

统一寻址解决了跨主机GPU资源“看得见、访问得到”的问题。但在超节点大模型推理过程中,跨GPU数据交换高达每秒数十万次。如果仍然依赖传统的逐卡寻址、软件调度和缓冲区中转这样的通信方式,延迟开销依然是不可接受的。所以,要进一步降低通信延迟,我们还需要解决GPU间数据“访问快、交换高效”的问题。
为了解决这个问题,我们率先在本土算力超节点上,基于全局统一寻址能力,通过对称内存技术实现GPU显存直连,使GPU能够像访问本地显存一样,直接访问远端GPU显存数据。该技术直接由GPU发起通信,减少地址转换,减少数据中转,缩短通信路径,AllReduce(全局归约)通信时间降低了3.5倍,达到国际顶尖水平,可以有效支撑大模型低延迟推理。

除了通信,我们对计算本身也做了深度优化。
比如,Kimi K3单步推理会涉及数千个算子调用,运行时存在大量Kernel Launch(内核启动)、数据搬移和同步开销,导致大量时间消耗在“启动、搬运和等待”上。
针对这一问题,我们使用K3大模型构建了超级算子智能体,率先在本土算力超节点上实现了基于通信计算融合、Tile(数据块)级流水的超级算子,将K3中的KDA(Kimi Delta Attention,一种线性注意力机制)、Gated MLA(带门控的多头潜在注意力)、MoE(混合专家模型)中的众多基础算子融合成计算与通信的大算子。
我们把算子数量降低了10倍,大幅减少Kernel启动次数和HBM访问开销,隐藏通信延迟,提升GPU整体执行效率。通过超级算子技术,我们在SD200 Ultra上实现了“K3优化K3”,取得了3倍以上的性能提升。

总结一下,面向能力型智算需求,我们要让计算系统与前沿智能共同Scaling,面向更大参数量、更长上下文的前沿模型,以及更大规模的Agent协同和更长周期的复杂任务,构建规模可扩展、物理紧耦合的超节点AI服务器。
在此基础上,我们要以真实模型负载为牵引,通过贯穿式创新,统筹算子、内存、互联和整机系统,推动计算系统从局部优化走向端到端协同。
我们认为,支持Kimi K3不是终点,而是能力型智算面向下一代前沿智能的起点。
向广:Capacity AI Compute 容量型智算 实现智能充分供给
接下来,我们再来看Capacity AI Compute,也就是容量型智算。
我们认为,智能的价值不仅取决于最高点有多高,更取决于有多少人能够获得它。
历史告诉我们,一项技术的最高水平决定它能够做到什么,而一项技术的普及程度,往往决定它最终能够改变什么。第一台计算机ENIAC非常重要,但真正改变几十亿人工作和生活的,是个人电脑和智能手机。最先进的发电技术非常重要,但真正改变工业社会的,是稳定、廉价的电力进入千家万户。
AI也正在经历同样的过程。前沿智能的首次突破固然很重要,但真正改变社会的,不只是存在一个最聪明的AI,而是每个人都能拥有大量智能。
我们今天看到,以Kimi K3、GLM 5.3、Qwen 3.8为代表的一系列中国大模型,在不断突破智能的上限;另一方面,我们也看到了像DeepSeek v4 Flash、GLM 5.3 Flash、Qwen 27B等一系列模型,通过效率提升和成本下降,快速走向更广泛的用户。所以,容量型智算的社会意义,就是让智能从一种稀缺资源逐步成为整个社会都能够获得的基础能力。
生产足够多、足够便宜的智能并不容易。
Capacity的扩展并不是简单地增加服务器。
重新认识负载:把“大模型推理”真正拆开就会看到,它不是一种单一的计算负载。Prefill具有高并行、高计算密度的特点;Decode是逐Token串行执行,更依赖内存带宽;Attention需要频繁访问不断增长的KV Cache;MoE包含稀疏计算和大规模All-to-All通信。除此之外,多模态模型还有独立的Encoder模块,MTP等多Token预测技术引入了独立的草稿模型。这些模块和模型,都有自己独特的计算特征。
重新配置算力:更大的困难还在于,这些负载还会随着上下文长度、输出长度和并发规模动态变化。比如,在Agent任务中,首轮对话的上下文长度大概在10~20K Token,但是经过100轮对话之后,上下文长度会扩展到300~400K Token。Prefill、Decode的计算量和计算特征也会随着对话轮次发生变化。这意味着,系统瓶颈可能在计算、显存容量、带宽和网络通信之间不断转移。
重新组织系统:简单增加更多的服务器,不仅无法带来线性的容量增长,还可能因为资源配比失衡、跨节点通信和任务排队,使部分算力长期闲置,另一部分资源持续拥塞。这意味着,只用同一种芯片和同一种服务器形态,并不是最高效的算力组织方式。
所以,我们需要按照不同的计算负载,重新配置算力,不要求一种芯片什么都做,而是让不同算力承担最适合自己的负载;然后,再通过统一的软件栈,把多种芯片按照推理阶段动态组织成一个高效协同的整体。
今天,我们正式发布元脑HC2000多元算力机组。元脑HC2000是采用DirectCom 2.0极速架构,基于高密液冷AI整机柜、搭配MCIS推理软件栈,实现计算负载按需匹配、动态优化的多元算力AI服务器机组。同等投资Token产能提升10倍,为容量型智算扩产。

HC2000多元算力机组的核心组件,是我们创新设计的高密液冷AI整机柜。
首先,我们采用全液冷设计和高通流供电,突破传统风冷机柜的散热与供电瓶颈,实现单柜300kW以上供电能力,最大承载256张AIPU,算力密度实现4倍跃升。同时,支持成熟工业标准加速模组,适配多元本土算力芯片,通过架构创新解决单芯算力受限问题。
我们全新升级DirectCom 2.0架构,让通信能力与算力密度同步扩展,实现计算与通信1:1均衡配比。柜内聚合带宽可达200Tbps,跨柜支持多平面无损扩展,AllReduce与AllToAll等典型通信性能提升50%以上。

有了这样的系统基础,我们进一步把不同算力和计算负载精准匹配。在Prefill阶段,可以选择大算力芯片搭配供应和成本更优的LPDDR、GDDR颗粒,结合DirectCom 2.0架构无损扩展优势,完全匹配Prefill高并行、计算密集的计算特征。对于Decode阶段,可以选择具有大容量HBM、兼顾显存容量和带宽的AI芯片。
在此基础上,在FFN计算环节,可以选择3D DRAM堆叠芯片,进一步缩短数据搬运路径,可实现数十TB/s的超高访存带宽,充分契合FFN计算特征。
通过这样的分工,可以让多元芯片充分发挥各自的能力优势,再通过软件栈把它们组织起来,共同完成推理任务,协同提升整个算力机组的Token产出效率。

为了充分释放HC2000多元算力机组的性能,我们打造了MCIS多元算力协同推理软件栈。MCIS覆盖从请求路由,到P/D分离推理和算力动态调整,再到KV Cache管理等关键环节,重点构建了三方面核心能力。
为了把不同类型的算力协同起来,我们构建了多元算力P/D分离计算框架,支持不同类型算力灵活组合、协同计算,兼容主流本土AI芯片,以及SGLang、vLLM等推理框架。
为了让算力配置随业务需求动态调整,我们构建了“测量、分配、监控、调整”的闭环优化机制,重点解决多元算力“选型难、部署难、定位难、优化难”的问题。
为了让KV Cache的存储和流转更加高效,我们构建了面向多元算力的KV Cache管理框架,降低存储与传输开销。

在推理业务实际部署和运行中,往往面临诸多问题和挑战,比如芯片怎么选?Prefill和Decode的算力怎么配置?方案确定后,如何在多元算力上快速部署?系统上线后,性能瓶颈在哪里?业务负载变化后,算力配置又该如何调整?
针对这些问题,MCIS构建了包含“测量、分配、监控、调整”四个环节的优化闭环。
■ 测量:我们可以在部署之前,通过性能仿真,评估不同芯片、并行方式以及P/D组合,提前找到更合适的配置方案。
■ 分配:方案确定后,系统根据现有资源,自动完成资源分配、环境配置、P/D实例部署等,减少大规模异构环境下繁杂的人工操作。
■ 监控:系统上线后,贯通请求、计算、缓存和传输的全链路监控,可以及时识别性能瓶颈,发现实际运行与模型预测之间的偏差,为后续优化提供依据。
■ 调整:当业务负载发生变化时,系统会重新评估并调整P/D配比、实例数量和负载分配,再通过实际运行验证调整效果。
通过这一闭环,MCIS将部署前的方案设计与部署后的优化贯通起来,实现芯片选型有据、模型部署有方、运行瓶颈可知、算力释放高效。

为了让KV Cache的存储和流转更加高效,我们构建了面向多元算力的KV Cache管理框架。
算力规模越大,KV Cache流动的效率就越重要。通过打通不同类型算力之间的点对点数据直传,避免CPU中转和重复拷贝,把数据传输性能最高提升约5倍。
根据KV Cache数据的冷热程度,我们构建了分级存储体系。在此基础上,结合KV Cache的数据结构特点,通过多级流水、并行聚合,将节点内本地磁盘IO性能提升32倍。

通过突破KV Cache的存储与传输瓶颈,我们让数据更高效地流动,让多元算力的潜能充分转化为大模型推理的实际效能。
我们来看一组数据。在HC2000多元算力机组上,通过MCIS部署DeepSeek v4的推理服务,在典型Agent任务场景中,同样的SLO约束下,相比使用单一算力AI服务器,我们实现了同等投资Token产能10倍提升。
这个10倍的Token产能提升,不仅来自多元算力各司其职、协同工作带来的计算效率提升,也来自对计算模式、并行策略进行动态优化调整所带来的收益。此外,通过把KV Cache命中率从业界普遍的80%~90%提升到95%以上,也带来了Token产能的较大提升。

整体来看,面向容量型智算,我们需要构建一个开放的计算系统,兼容不同厂商、不同架构的AI芯片;然后按照负载特点,让不同芯片承担最适合的任务;再通过统一软件栈,把多元芯片、计算流程和数据通路组织起来,并根据业务变化持续动态优化。
总的来说,容量型智算的核心不是追求用一种算力解决所有问题,而是以开放汇聚多元,以协同实现全局最优,让每一份算力都能够转化为更多可交付的智能。
从提供算力到生产智能
Agent时代,我们要以能力型智算突破智能上限,以容量型智算推动智能规模化供给。
我们用贯穿式系统创新,通过全栈规划与跨层协同,持续提升整个计算系统的效率。
我们以开放协同的产业生态,实现多元算力的高效协同和计算产业生态的健康、可持续发展,实现从提供算力到生产智能的产业目标。
谢谢大家!
访问 AIStoreAIStore是基于元脑生态打造的商业协作线上平台,作为知识资源平台、交流服务平台和商机孵化平台,赋能“百模”与“千行”的对接,目前已上架200+产品和方案,在智能票据识别、AI工业质检、代码生成、视觉智能标注、AI健康助手等领域实现成功牵手和落地应用,助力千行百业加速AI产业创新,高效释放生产力。

扫码访问AIStore