本站点使用Cookies,继续浏览表示您同意我们使用Cookies。
Cookies和隐私政策>
随着“AI+”不断深入,很多企业的推理平台逐渐出现了性能不足的问题,作业排队越来越长,终端响应越来越慢。面对这种情况,企业的第一反应是增加GPU,但更好的办法是升级平台KV Cache能力,建立分层缓存机制,将温、冷数据向内存和硬盘卸载,因为智能化应用发展带来的并发量提高、上下文长度增加更多是对HBM的消耗,有限的HBM成为推理平台的瓶颈。
国内某厨电企业的推理平台就面临同样的问题:推理请求量激增,每秒请求数涨到原来的5倍,文档处理这类简单任务的响应时间经常超过10秒。
浪潮信息服务团队为客户做了系统的诊断,诊断结论出乎意料:不是GPU算力不够,是HBM不足。KV Cache体量持续增加,使得业务高峰期出现严重的HBM争用现象,成为制约推理效率的主要瓶颈。
浪潮信息通过焕新服务,为其扩展内存与SSD、建立分层缓存机制,增加KV检索,并将KV Cache命中率优化至80%以上,首Token输出时间成倍降低,简单任务响应压到3秒以内,系统任务排队和响应延迟现象得到了有效控制。

该企业是中国最大的厨电企业之一,也是“AI+”的先行者,已经将AI融入主要业务,上线各类AI系统400多个,还有大量应用正在开发和部署。
在产品侧,该企业持续探索AI与智能厨电的融合,形成覆盖创新硬件、垂类大模型和具身智能等方向的完整产品布局,让AI更快进入家庭厨房场景。
在经营侧,AI已覆盖研发、生产、供应、营销和服务等核心业务环节,在提升经营效率的同时,也成为该企业高端化、精品化业务战略落地的重要支撑。
“AI+”的全面展开让该企业部署的模型数量、推理并发和数据规模持续增长,2025年初,该企业实施了训推分离,采购20台浪潮信息AI服务器,建设了专门的推理算力平台,基于vLLM推理框架部署了DeepSeek、Qwen、GLM等多个LLM推理模型。进入2026年以来,推理请求量快速增长,每秒请求数提高至此前的5倍,推理算力平台开始出现资源瓶颈,不同推理系统的任务排队现象日益加剧,文档处理等相对简单的推理任务,响应时间经常超过10秒,影响了业务部门的使用体验。
平台监控显示,GPU利用率通常约为30%,在部分高负载时段可达到90%。这意味着平台整体仍有计算资源尚未充分利用,但局部任务已经出现资源拥塞。仅增加GPU数量,未必能够消除请求排队现象。浪潮信息AI技术专家结合模型负载、显存占用、任务排队和数据访问情况对平台进行诊断,诊断结果显示,问题并非GPU算力不足,而是平台缓存能力难以适应业务负载增长。
●一方面,长上下文和高并发LLM推理持续扩大KV Cache规模,增加对HBM的占用,而且该企业在2026年新部署了3D生成等多模态模型,这些模型对HBM的需求呈现明显的“尖峰效应”,在处理体素、点云或三角面片等高维3D数据时,HBM占用量会瞬间飙升;
●另一方面,原有平台缺少系统化的分层缓存与数据迁移机制,不同类型、不同访问频率的数据集中占用有限的HBM空间,导致许多请求需要等待缓存空间和数据调度,GPU计算能力难以得到充分发挥。
针对诊断结果,浪潮信息为该企业制定了软硬件协同的分层缓存升级方案,对原有20台AI服务器进行内存和SSD扩展,同时用LM Cache升级了平台推理框架,并增加了KV Cache检索能力。
算力层面,每台AI服务器增加500GB DDR5内存和25TB NVMe SSD硬盘,为建立“HBM一内存一SSD”分层缓存机制提供容量基础。
算法层面,项目团队针对现有模型和业务负载,为客户部署了LM Cache。
●建立和优化缓存管理策略,让频繁操作的热数据放在HBM中,随时取用,低频操作的温数据存储在内存中,海量冷数据则存入SSD中,不同层级的缓存池可以跨节点访问。同时配置预取、逐出与回写机制,并结合实际模型采用数据压缩和量化,扩大可用缓存空间,提高各级缓存间的数据输送能力,降低不同任务对HBM资源的争用。
●改变请求处理架构,增加了KV检索。此前平台缺少多级缓存能力,缓存空间有限,所有的请求都直接进入Prefill环节。浪潮信息为该平台增加了KV检索能力,平台收到请求后,首先在缓存池中检索可复用的前缀KV Cache。对于已经命中的前缀KV直接复用,仅对未命中的Token执行Prefill计算,再进入Decode阶段。经过持续的优化,KV Cache检索的命中率达到80%以上,可大幅减少推理算力消耗,降低首Token输出延迟。
平台升级完成后,任务排队和响应延迟明显缓解,可以更好地承接不断增长的推理负载。文档处理等简单推理任务的响应时间降至3秒以内,95%以上任务的推理延迟控制在5秒以内。
该项目投资小,收益高,总支出在百万级别,让现价值数千万的设备重新焕发生机。而且,项目采用浪潮信息原厂物料,由原厂认证工程师实施,从系统诊断、方案设计、兼容性验证到部署验收,整体周期约1个月,远小于新设备采购。
AI是一个高度复杂的系统,决定系统性能的不是GPU,而是不同硬件模块之间、算法和算力之间能否高效协同。AI技术的高速创新和应用的快速普及,带来了持续增长的模型数量和业务负载,让越来越多企业的AI基础设施在通信、缓存等方面出现瓶颈。浪潮信息的焕新服务针对系统瓶颈进行精准补强,能够以极低的投资激活算力设备,为企业盘活既有AI算力资产提供了一个合理的选择。
访问 AIStoreAIStore是基于元脑生态打造的商业协作线上平台,作为知识资源平台、交流服务平台和商机孵化平台,赋能“百模”与“千行”的对接,目前已上架200+产品和方案,在智能票据识别、AI工业质检、代码生成、视觉智能标注、AI健康助手等领域实现成功牵手和落地应用,助力千行百业加速AI产业创新,高效释放生产力。

扫码访问AIStore