精华速览

阿里巴巴高级技术专家杨林枫将在2026年QCon上海站分享《从算子调优到推理自治:构建MaaS场景下的AI Inference自动优化闭环》。针对MaaS业务中模型、硬件与请求工况快速变化、传统人工调优周期难以匹配生产负载的问题,该分享提出一套自动优化流程:先探索部署配置,再从生产Trace中提取热门算子并生成可复现Benchmark,随后由Atrex Kernel Agent通过Agent Loop完成性能分析、代码生成与验证,最终回接推理框架做端到端回归和灰度上线。相关实践已支撑Qwen3.8获得NVIDIA SOL-ExecBench FlashInfer算子优化榜首,并服务于阿里百炼MaaS大规模GPU集群的性能优化。

要点透视

  • 2026年QCon全球软件开发大会上海站定于10月22日至24日举办,主题聚焦Harness AI时代的工程实践,覆盖AI Native架构、Agent Runtime、AI Infra等20个专题论坛。
  • 阿里巴巴高级技术专家杨林枫确认出席“AI Infra:算力效率决定规模化落地”专题,发表题为《从算子调优到推理自治:构建MaaS场景下的AI Inference自动优化闭环》的演讲。
  • 杨林枫为斯坦福大学博士,是开源AI框架MindSpore核心贡献者,曾主导昇腾算子编译器SWFT的设计与研发,现为Atrex Kernel Agent核心研发者。
  • 其相关实践支撑Qwen3.8获得NVIDIA SOL-ExecBench FlashInfer算子优化榜首,并用于阿里百炼MaaS大规模GPU集群的性能优化。
  • 自动优化流程包含部署配置探索、从生产Trace识别热门算子、工况去重清洗脱敏泛化生成Benchmark、Atrex Kernel Agent多轮优化、结果回接推理框架并灰度验证等环节。
  • Atrex Kernel Agent通过Agent Loop执行profile、瓶颈分析、方案生成、代码修改、验证和复盘,外围Loop负责实验预算、状态恢复、正确性门禁与终止控制。
  • 实践痛点包括生产工况变化快且存在长尾、线上Trace不能直接作为Benchmark、Agent可能过拟合公开Shape或将GPU测量波动误判为收益、Kernel局部变快不代表端到端收益。

文章拆解

MaaS场景的推理优化正面临一个结构性矛盾:模型、卡型、请求工况和部署配置持续变化,而传统优化流程依赖人工完成需求分析、性能定位、算子开发、验证及上线,周期往往跟不上生产负载的变化。杨林枫此次分享的核心,是把这条链路从“人工驱动”改造成“Agent驱动”的闭环。

从流程设计看,这套方案并非只做算子层面的局部提速,而是先解决“优化什么”的问题。给定卡型、模型和典型工况后,系统先探索并行策略、批处理及推理引擎配置,结合延迟、吞吐、显存和资源成本选择候选部署方案,再根据实际运行Trace定位瓶颈。这意味着算子优化任务来自真实生产工况,而非人工提交的需求,理论上更贴近实际收益点。

更关键的是Benchmark的生成方式。线上Trace不能直接用于评测,需要经过去重、清洗、脱敏、泛化和Shape归并,才能形成可复现的Benchmark,并建立正确性、数值容差和性能评测标准。这一步决定了后续Agent优化是否有可靠靶子。Atrex Kernel Agent则通过Agent Loop进行多轮profile、瓶颈分析、方案生成、代码修改和验证,同时用隔离会话、Git worktree、结构化memory和实验journal管理多轮实验;外围Loop控制实验预算、状态恢复、正确性门禁和终止条件,并以完整workload和同卡ABBA测量验证性能收益。

对行业和用户而言,这套闭环若能在不同卡型、模型和生产工况上稳定复用,将降低MaaS推理优化的边际成本,缩短从生产负载变化到性能改进的响应时间。但素材也明确提示了若干变量与风险:生产工况存在长尾,采样过少可能遗漏重要场景,采样过多则推高分析和评测成本;Agent可能过拟合公开Shape,也可能把GPU测量波动误判为性能收益;Kernel局部变快不等于端到端一定有收益,仍需在推理框架和模型层重新验证;自动生成的代码进入生产前,仍需正确性验证、性能回归、灰度发布和异常回滚。这些约束说明,推理自治目前更接近“有边界的自动优化闭环”,而非完全无人值守。其长期效果和跨场景泛化能力,尚待更多生产数据确认。

查看原文