精华速览

9月1日,全球权威AI性能评测组织MLCommons发布MLPerf Storage v3.0榜单,焱融全闪AI存储F9000X在3D U-Net训练和Checkpoint 70B测试中均位列第一,三节点集群实现544GiB/s聚合带宽,刷新历届公开测试最高水平。与此同时,焱融推出面向推理场景的YRCache ContextBox一体机,补上G3.5共享缓存层,支持KV Cache跨节点共享与复用。从训练数据供给到推理上下文管理,焱融已构建覆盖AI全流程的全栈存储方案,试图以更高存储效率降低企业算力基础设施投入。

要点透视

  • MLPerf Storage v3.0于9月1日发布,焱融F9000X在3D U-Net训练测试中以三节点集群实现544GiB/s聚合带宽,位列第一,超过v2.0测试的478GiB/s。
  • 在Checkpoint 70B测试中,焱融存储集群实现539GiB/s读带宽和314GiB/s写带宽,读写性能均居第一,刷新历届MLPerf Storage公开测试成绩。
  • 焱融推出YRCache ContextBox一体机,面向G3.5共享缓存层设计,单台实测带宽达120GB/s,可支持8个推理节点并发接入,缓存容量可扩展至PB级。
  • 在某头部AI企业测试中,8张NVIDIA H20-3e GPU运行SGLang和GLM-5.1,输入上下文31K至129K时,接入ContextBox后首Token时延降低89%至94%,Token吞吐提升3至6倍。
  • YRCache多级缓存架构分为G1 GPU HBM、G2主机DRAM、G3本地SSD、G3.5共享缓存层和G4传统共享分布式存储,ContextBox兼容YRCache、LMCache、Mooncake等管理软件。
  • 焱融科技称其单位性能硬件成本较行业市场平均水平降低约35%,Token效能提升120%。

文章拆解

AI产业正从模型训练走向规模化推理,存储系统承担的任务随之分化。训练阶段,存储需要持续向GPU供给海量数据,并快速保存和恢复Checkpoint;推理阶段,长文本、多轮对话和Agent应用产生大量KV Cache,若无法保存和复用,模型将反复计算相同上下文。单一高性能存储产品已难以覆盖AI全流程需求,这是焱融构建全栈AI存储方案的底层逻辑。

焱融F9000X在MLPerf Storage v3.0中的表现验证了训练侧能力。三节点集群544GiB/s聚合带宽和Checkpoint 70B读写双第一,意味着存储系统能更高效地向GPU供数,并缩短模型存档与恢复耗时,减少训练中断造成的算力浪费。对企业而言,同等训练需求下或可减少存储节点投入,从而控制硬件成本。

推理侧的挑战在于KV Cache的跨节点共享与复用。焱融YRCache将缓存分为GPU HBM、主机DRAM、本地SSD和共享分布式存储等层级,并参考英伟达CMX架构引入G3.5共享缓存层,推出ContextBox一体机。其价值在于:请求被调度到另一台服务器时,已生成的KV Cache可被共享,不必重新计算;缓存空间不再受单机显存、内存和SSD容量限制,可独立扩展;计算节点增减时,已保存缓存不会丢失。头部AI企业测试中首Token时延降低89%至94%、Token吞吐提升3至6倍,若数据可复现,则说明共享缓存层对长上下文推理效率有显著影响。

值得关注的变量包括:MLPerf测试成绩基于特定硬件和网络环境,实际部署效果可能因集群规模、网络配置和模型类型而异;ContextBox的客户测试数据由焱融科技提供,尚待确认是否有第三方独立验证;G3.5共享缓存层的引入是否会对现有推理框架的调度逻辑提出新要求,也需观察。潜在风险在于,全栈方案虽能提升存储效率,但企业是否愿意为跨节点缓存共享改造现有推理架构,仍取决于成本收益比和运维复杂度。随着模型规模和上下文长度继续增加,AI存储竞争将从单一峰值性能转向对不同数据、不同层级和不同使用周期的协同管理,焱融的布局方向与此吻合,但市场验证仍需时间。

查看原文