精华速览
2026年AICC大会上,IDC预测全球活跃Agent将从2026年的约7940万个增至2030年的22.16亿个,Token消耗量同期从0.026Peta激增至152667Peta。面对Agent带来的算力需求爆发,浪潮信息发布元脑SD200 Ultra超节点AI服务器和元脑HC2000多元算力机组,分别应对前沿模型部署门槛高和大规模推理性价比不足两大难题。SD200 Ultra以128芯本土AI芯片实现单机运行2.8万亿参数Kimi K3,Token生成时延首次突破5.85毫秒;HC2000在典型Agent任务中实现同等投资下10倍Token产能提升。浪潮信息将这一策略概括为从Capability到Capacity的系统协同,推动算力产业从提供算力走向生产智能。
要点透视
- IDC在AICC 2026大会上发布数据:2026年全球活跃Agent约7940万个,2030年将达22.16亿个,增长约28倍;同期Token消耗量从0.026Peta增至152667Peta,增幅达数百万倍。
- Kimi K3总参数量2.8万亿,权重文件约1.56TB,官方推荐至少64卡甚至更大规模才能运行,普通AI服务器GPU显存无法容纳权重。
- 浪潮信息元脑SD200 Ultra紧耦合128芯本土AI芯片,采用3D HyperMesh架构,提供8TB带宽和64TB内存,跨芯片通信时延降至0.69微秒。
- SD200 Ultra单机运行Kimi K3时Token生成时延首次突破5.85毫秒,并支持10万亿参数规模的前沿模型扩展。
- 浪潮信息通过超级算子库将KDA、Gated MLA、MoE中的基础算子融合为大算子,算子数量降至原先的1/11,减少Kernel Launch次数和HBM访问开销。
- 元脑HC2000基于DirectCom 2.0极速架构和原生液冷高密整机柜,单柜供电能力达300千瓦以上,最大承载256张AI卡,算力密度实现4倍跃升。
- HC2000通过MCIS软件栈动态分配多元算力,在典型Agent任务场景中,同等SLO约束下相比单一算力推理系统实现同等投资10倍Token产能提升。
- 浪潮信息首席AI战略官刘军提出“贯穿式创新”,涵盖芯片到模型、单机到系统、技术到生态三个层面,主张放弃通用巨无霸芯片策略,转向多元芯片协同。
文章拆解
Agent时代算力需求的结构性变化是理解此次发布的关键。过去AI调用是单次且临时的,而Agent一次用户意图背后可能是几十次甚至几百次推理,多个Agent连续协同数小时甚至数天。这种应用形态变化直接推高了算力系统的门槛:一方面前沿模型参数规模持续膨胀,Kimi K3的2.8万亿参数和1.56TB权重文件让单机部署成为难题;另一方面大规模Agent调用便宜模型时,性价比算力的容量不足又导致低价供给难以持续。DeepSeek在2026年上半年将V4-Pro的API价格下调75%后,8月又预告整体提价并直指“算力不足”,正是这一矛盾的典型体现。
浪潮信息的应对逻辑是分而治之。SD200 Ultra解决“向上”问题,通过超节点架构把128芯本土AI芯片纳入统一内存寻址域,以对称直连和算子融合减少数据搬移,使单机能够承载前沿模型。HC2000解决“向广”问题,核心思路是让Prefill、Decode、Attention、MoE等不同计算特征的负载匹配最适合的芯片类型,再通过MCIS软件栈统一调度。这种多元算力协同策略放弃了用同一种通用芯片干所有事的思路,理论上能提升整体Token产出效率。
从行业影响看,这一方案对国产算力生态具有双重意义。技术层面,128芯本土AI芯片紧耦合运行2.8万亿参数模型,验证了国产芯片在超节点架构下的协同能力;商业层面,同等投资10倍Token产能提升若能在更广泛场景复现,将直接降低Agent规模化部署的成本门槛。但需注意,当前10倍提升数据基于“某模型适配”和“典型Agent任务场景”,尚待确认其在更多模型和任务类型中的普适性。
值得关注的变量包括:多元芯片协同的软件栈成熟度能否支撑长期稳定运行;不同厂商芯片混用时的生态兼容性和运维复杂度;以及超节点方案在能耗和散热上的实际表现。潜在风险在于,系统协同策略对软件栈的依赖度极高,一旦调度层出现瓶颈,多元算力的理论优势可能被抵消。此外,Agent数量与Token消耗的指数级增长预测本身存在不确定性,若实际增速不及预期,算力投资回报周期可能拉长。

暂无评论。