您现在的位置:首页  >  新闻资讯

国产存储杀入大模型推理核心

2026/9/30 15:50:09 标签:中国传动网


9月29日消息,中科曙光分布式存储ParaStor近日成为业界首家接入Mooncake社区的商用分布式存储,首次完成商用分布式存储后端的生产环境落地,相关技术能力已全部合入Mooncake社区主干。


大模型推理中,Agent、高并发对话、代码生成等场景会产生大量KV Cache中间数据。高效保存并复用这些数据,能大幅减少重复计算,降低算力消耗和AI运行成本。


内存方案成本高,本地SSD方案受单机容量和故障限制,外置分布式存储成为破解痛点的关键路径。但Mooncake原有外置存储接入能力在容量弹性扩展、数据恢复、异常场景稳定性等方面仍存短板。


曙光ParaStor团队对Mooncake DFS存储分配逻辑进行模块化改造,围绕标准化接入、动态扩容和IO链路持续优化。商用分布式存储由此首次进入大模型推理核心业务链路,承接长尾KV Cache卸载工作。


生产环境实测数据极具说服力。曙光联合SGLang,基于国产加速卡与ParaStor F9000搭建端到端测试环境。在64K上下文、单卡7并发下,KV Cache卸载实现16倍吞吐提升,达到DRAM池吞吐值的80%;平均首Token延迟和P90首Token延迟均保持在10秒以内。


接口标准化方面,曙光完成Mooncake接口标准化改造,无需修改上层程序,满足通用文件访问即可快速适配。复杂架构改造变为轻量化开发,为更多商用存储接入大模型缓存场景铺平了道路。


改造后的DFS接口支持缓存空间随业务负载按需扩容,实现以完整存储段为单元完成冷数据回收,系统重启后缓存数据仍可恢复使用。

这套方案可为用户提供更低的AI运行成本、更高的GPU利用率,并以完整可复制的商业化落地方案,为国产全栈AI基础设施补上关键一环。



供稿:电子技术应用

本文链接:http://www.cmcia.cn/content.aspx?url=rew&id=9469

成员中心

《伺服与运动控制》

《伺服与运动控制》

创刊于2005年,秉承面向市场、面向科技、面向应用、面向行业,集实用性、信息性、...

《机器人与智能系统》

《机器人与智能系统》

是深圳市机器人协会、中国传动网共同主办的聚焦机器人、智能系统领域的高端产经...

《直驱与传动》

《直驱与传动》

聚焦直驱产业,整合资源,为直驱企业与用户搭建桥梁。