本站点使用Cookies,继续浏览表示您同意我们使用Cookies。
Cookies和隐私政策>
医疗是最早拥抱“AI+"的行业之一。从深度学习时代到大模型时代,AI技术几经迭代,对算力的需求持续升级。为训练影像大模型、DLR(深度学习图像重建)等医疗行业专用模型与算法,医疗设备企业随每一轮技术演进持续采购GPU服务器,积累起规模可观、却横跨多个代际的算力资产。但是矛盾也随之而来,早期采购的旧GPU服务器仍停留在10Gb网络,巨大的网络瓶颈制约了最新模型的开发与训练。
整机换代,代价高昂;将就使用,算力浪费。浪潮信息为某医学影像诊断与治疗设备提供商提供了第三种选择——焕新服务。该客户拥有横跨三代技术平台的近400台GPU服务器,其中百余台仍是多年前的10Gb网络,服务团队通过网卡部件焕新,将相关旧服务器的网络全面升级为百Gb级别的最新网络,并协助客户优化训练平台的资源分组与任务配置。项目整体投入不足100万元,使一批资产价值接近4000万元的GPU服务器,重新具备承担相关AI训练和验证任务的条件。

该客户在中国医学影像设备领域处于领先地位,产品线覆盖磁共振、CT、PET/CT、DR及放射治疗等,在售产品超过120款,年营收过百亿。作为“AI+医疗”的先行者,该客户已自主开发医疗文本大模型、影像大模型和医疗行业大模型,并形成100多款AI应用方案。
但客户的AI能力不是一次性投入。影像大模型、DLR等专用模型与算法要持续训练、持续迭代,才能不断提升诊断精度、适配更多设备与病种。这背后,是长期、稳定、且规模不断扩大的算力需求。因而,伴随AI技术创新的不断深入,客户GPU服务器数量不断增长,当前存量已经接近400台。
这些GPU服务器采购时间从2019年延续至2025年,横跨三代技术平台。多代设备并存,抬高了资源调度与运维管理的复杂度,带来了一系列问题,其中最突出的是网络。最早部署的百余台GPU服务器仍采用10Gb网络,而新设备已普遍配置百Gb级别的网络。面对跨节点梯度通信、远端共享存储访问等高带宽负载,10Gb网络逐渐成为制约旧服务器参与训练任务的瓶颈。以DLR训练为例,当服务器从远端共享存储并发读取大规模3D影像数据时,网络I/O瓶颈尤为明显,导致新设备持续高负载运行,而部分旧设备的利用率较低。
这类问题,通常只剩“将就”或“换机”两个结局。而焕新服务的价值,恰恰在于第三条路。浪潮信息掌握不同代际服务器的结构设计、接口配置和部件兼容信息,能够针对旧设备的内部空间与接口条件制定适配方案。
工程师深入解构旧服务器结构,对既有转接卡进行适配改造,在不改变原有设备架构的前提下,让旧服务器支持了百Gb级别的网卡。同时,高速网络对接口、空间与信号的稳定传输高度敏感,团队进一步开展兼容性、稳定性和压力测试,验证转接卡、网卡与整机系统的协同运行,确保焕新方案不仅能够完成适配,也能够满足后续稳定运行要求。
焕新之后,浪潮信息进一步协助客户重构AI训练平台:按技术平台、性能与配置对服务器分类,将能力相近的设备编入同一算力集群,再结合不同训练任务做资源匹配。通过减少跨代设备之间不必要的通信与调度,降低平台差异对训练作业的拖累,让每一台被焕新的设备都用在最合适的负载上。

这次焕新服务总支出不到100万元,却让接近4000万元的存量设备重新回到可用状态——客户以约四十分之一的投入,唤醒了一大批原本闲置的算力资产。焕新完成后,这些旧设备重新组建为分布式集群,承载AI算法验证与训练负载,资源利用率快速回升,客户的AI研究与训练进度明显加快。
原厂焕新的底气,来自长期积累的服务能力。在持续积累的设备数据、服务经验和技术档案,也为此次跨代设备焕新提供了支撑。每一次服务,团队都会沉淀完整的故障分析(FA)报告,把问题原因、处置过程与改进建议固化下来;每一次焕新,也都有可查询的原厂焕新记录,让设备的每一次变更都清晰可溯——这些,都是焕新能“敢保、可续”的基础。
多数AI先行企业都积累了相当规模的算力资源。在GPU供给紧张、AI算力投入持续走高的背景下,改造利用既有存量算力资源,已经成为许多企业的理性选择。面向这一需求,浪潮信息将原厂服务从设备运行保障延伸至存量基础设施焕新,延长设备有效生命周期,为客户提供更好的投资回报,让每一代算力都能在适合的业务场景中持续发挥价值。
访问 AIStoreAIStore是基于元脑生态打造的商业协作线上平台,作为知识资源平台、交流服务平台和商机孵化平台,赋能“百模”与“千行”的对接,目前已上架200+产品和方案,在智能票据识别、AI工业质检、代码生成、视觉智能标注、AI健康助手等领域实现成功牵手和落地应用,助力千行百业加速AI产业创新,高效释放生产力。

扫码访问AIStore