精华速览

随着大模型参数迈向十万亿级,算力集群从万卡走向10万卡,但卡间通信消耗大量训练时间,MFU常低于30%。华为在HC2026大会上提出超节点是AI基础设施必然选择,并发布昇腾960超节点方案。该方案基于灵衢与Hi-ONE,将4096颗算力卡逻辑融合为一台超级计算机,提供8EFLOPS FP8算力、1PB HBM容量,RTT时延最低2微秒。通过NPO光引擎替代大量可插拔光模块,模块数量降至约1/9,系统功耗降低超550千瓦。灵衢互联架构进一步支持最大51.2万卡集群,并探索向100万卡扩展,推动AI基础设施进入系统工程阶段。

要点透视

  • 华为仿真数据显示,10万卡集群中卡间通信可能消耗40%以上训练时间,算力利用率(MFU)往往不到30%。
  • 2026年7月WAIC期间,鹏城实验室与全球计算联盟联合38家单位发布《超节点定义与实践白皮书》,明确超节点需具备跨物理节点统一内存编址能力,逻辑上像一台计算机。
  • 昇腾960超节点基于灵衢+Hi-ONE打造,最多支持4096卡,提供8EFLOPS FP8、16EFLOPS FP4算力,最高1PB HBM容量,RTT时延最低2微秒。
  • 昇腾960使用约5500个Hi-ONE替代原本需要的4.8万个800G光模块,模块数量降至约1/9;Hi-ONE带宽达7.2Tb/s,由36个200G Lane集成,1个模块可替代9个800G光模块。
  • 昇腾960系统功耗降低超过550千瓦,系统可用度达99.8%,无故障运行时间提升1倍;相比昇腾950的1024卡规模,计算卡规模提升至4倍。
  • 灵衢UnifiedBus将互联带宽从百GB级提升至TB级,RTT通信时延从7微秒压缩至2微秒,支持最大51.2万卡集群,结合多轨道拓扑可支持100万卡昇腾超节点集群。
  • 截至目前,昇腾910C超节点已部署超过1000套,昇腾950超节点进入规模商用阶段,覆盖互联网、运营商、金融、教育、医疗等行业。
  • 华为在OIF推动的《12.8Tb/s光电近封装模块》标准提案已立项,未来有望形成6.4T/12.8T近封装光学模块行业标准。

文章拆解

大模型竞赛进入十万亿参数阶段,算力集群规模从万卡向10万卡甚至更大扩展,但有效算力并未同步增长。华为仿真显示,10万卡集群中卡间通信可能吃掉40%以上训练时间,MFU不到30%,这意味着大量昂贵算力被通信和同步开销消耗。对于训练周期以月计的前沿模型,MFU每提升几个百分点,都可能节省数天时间和数千万元成本。超节点因此成为行业焦点,其核心不是简单堆叠服务器,而是通过高效互联协议和统一内存编址,让数千张卡在逻辑上像一台计算机工作。

昇腾960超节点是这一理念的工程化落地。它基于灵衢和Hi-ONE,将4096颗算力卡融合为一个逻辑整体,提供8EFLOPS FP8算力和1PB HBM容量,RTT时延最低2微秒。相比上一代1024卡规模,单超节点计算卡数量提升至4倍,意味着单个系统能容纳更大模型,减少跨节点切分带来的通信开销。同时,约5500个Hi-ONE替代4.8万个800G光模块,模块数量降至约1/9,系统功耗降低超550千瓦,可用度达99.8%,无故障运行时间提升1倍。这些指标最终会转化为企业训练效率和成本优势。

从行业影响看,超节点正在从概念走向规模化应用。昇腾910C超节点已部署超1000套,昇腾950进入规模商用,覆盖互联网、运营商、金融、教育、医疗等行业。白皮书的发布也为超节点提供了标准定义,有助于产业链分工和成本下降。但挑战依然存在:NPO技术标准尚缺位,封装形式、接口规格、光源方案无统一约定,各厂商方案互不兼容,产业链难以放量。华为在OIF推动的12.8Tb/s光电近封装模块标准已立项,但形成行业标准仍需时间。

更大规模的集群还面临Scale Out难题。灵衢UnifiedBus将互联带宽从百GB级提升至TB级,RTT时延从7微秒压缩至2微秒,支持最大51.2万卡集群,结合多轨道拓扑可支持100万卡。同时,灵衢试图打破CPU、NPU、内存和存储之间的协议边界,让不同子系统平等互联。在Agent时代,通算与智算融合需求更加迫切,鲲鹏超节点基于灵衢全光组网,最大支持4096节点,形成256TB统一内存池,十万级沙箱启动相比传统服务器提升30倍。

值得关注的变量包括:NPO标准能否尽快统一并形成多厂商生态;灵衢在超大规模集群中的实际可靠性和运维成本;以及通算与智算融合能否在真实Agent负载中兑现性能承诺。潜在风险在于,超节点系统复杂度高,任一环节掉队都可能拖累整体效率,且标准缺位可能延缓产业放量。华为强调AI基础设施竞争已进入多学科系统工程阶段,其计算与通信综合优势能否持续转化为客户价值,尚待更大规模部署验证。

查看原文