精华速览

智谱创始人唐杰与GLM团队发布长文,披露GLM-5.3驱动的Infra Agent在超10万张国产芯片集群上,直接参与GLM-5.3-Flash推理基础设施的适配、诊断与优化,不到两周将端到端吞吐提升至初始基线的3倍。该Agent依托正确性测试、执行Trace、微基准等“稠密反馈”,能自主提出假设、修改代码并验证结果,例如定位KDA算子CP路径精度缺陷、发现DeepEP未释放GIL导致的KV Transfer并发瓶颈。团队认为这尚非完整递归自我改进(RSI),但已出现AI参与构建自身继任者的早期形态,人类仍负责目标设定与风险边界。

要点透视

  • GLM-5.3驱动的Infra Agent在超过10万张国产芯片组成的集群上,从零搭建生产级推理服务,GLM-5.3-Flash全部线上推理运行于该系统。
  • 该Agent在不到两周内将端到端吞吐提升至初始基线的3倍,技术栈包含节点内张量并行、ReplaySSM、W8A8量化、混合精度缓存量化、Layer Split及EPD分离式架构。
  • GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode与OpenRouter接受真实调用,上线一周成为双平台调用量最大模型,6天token调用量超过62万亿。
  • Agent通过算子级精度对照发现KDA算子上下文并行路径的TF32累积误差,修复方案为显式指定input_precision="tf32x3",相关修复已合并至Flash Linear Attention上游PR #1180。
  • Agent定位到DeepEP v1.2.1的intranode_dispatch和intranode_combine未显式释放Python GIL,导致Mooncake Transfer线程调度受阻,修复后Prefill+KV Transfer与单独Prefill的性能差距从超20%降至小于1%。
  • 在KDA Decode算子优化中,Agent从存量Kernel提炼“优化骨架”,合并沿V维度的重复分块计算,获得1.71倍性能提升;此前除法优化已缩短执行时间9.6%。
  • 团队将“稠密反馈”定义为局部、低成本及时、可客观验证三类特征,工程师负责定义目标与约束并审核关键修改,Agent负责假设、修改与实验。
  • 唐杰及GLM团队明确表示尚未达到完整递归自我改进,选择目标、设定边界、判断风险仍由人承担,并认为这条线在相当长时间内应由人守护。

文章拆解

智谱此次披露的核心信息,不是单点性能数字,而是大模型开始介入自身运行系统的构建与优化。过去模型辅助写代码,主要停留在静态代码库层面;而Infra Agent面对的是精度异常、性能退化、通信与调度交互等动态系统问题。GLM团队提出的“稠密反馈”正是针对这一落差:端到端指标只能告诉Agent“结果变差”,无法解释“为什么变差”,因此需要把正确性测试、执行Trace、运行时事件和微基准组织成可局部归因、可反复执行的验证工作流。

从三个案例看,这一闭环已具备工程可操作性。KDA算子CP路径的精度问题,靠并行策略到算子的映射和切分/非切分对照暴露;KV Transfer并发瓶颈,靠性能约束、时间线和Python/C++边界分析定位到GIL持有范围;KDA Decode算子优化,则靠存量Kernel提炼的“优化骨架”加分层验证实现1.71倍提升。三者共同说明,Agent的价值不只取决于模型代码能力,更取决于系统能否提供结构化、可归因的反馈环境。

对行业而言,这一实践释放了两个信号。其一,国产芯片集群承载大规模生产推理的可行性得到一次公开验证,团队称硬件利用效率与单Token成本达到主流NVIDIA GPU相当水平,但该对比的具体口径与测试条件尚待确认。其二,AI参与自身推理系统优化,可能显著压缩基础设施工程周期,并让每次上线经验回流为下一次优化的起点,形成工程师投入递减的循环。

值得关注的变量包括:稠密反馈环境的构建成本能否随模型迭代摊薄;Agent在涉及数值语义、异步并发和线上风险的关键修改上,仍需工程师审核,这一人工瓶颈的规模能扩展到多大尚待确认;以及安全能力增强研究已使GLM在真实代码库中发现数千个漏洞,团队为此设计受信访问计划,说明能力外溢与风险管控正在同步升级。潜在风险在于,若反馈信号不完整或归因错误,Agent可能优化局部指标却损害端到端稳定性;同时,RSI早期形态若持续演进,目标设定与风险边界的责任划分将更依赖制度而非技术默认。团队明确表示尚未走到递归自我改进,这条线仍由人守,但“两周、三倍、十万卡”表明,其演进速度不会因主观意愿而放缓。

查看原文