精华速览

OpenAI 于 9 月 23 日推出 GPT-6 系列新成员 Sol 和 Luna,沿用 Astra 的训练方法,将专业工作、编码、计算机使用等能力下放到更快、更经济的模型,API 价格较 GPT-5.6 促销价降低 50%,并改进提示缓存。同期,字节跳动豆包通用 Session 团队被曝减员约一半,对话方向后训练团队同步收缩,部分人员转岗商业化与飞书。阿里云栖大会提出「思考力商品化」,并披露 Qwen4 已投入训练、千问发布 AI 手机全栈方案。此外,理想芯片子公司推进首轮融资,投前估值约 150 亿元。

要点透视

  • OpenAI 发布 GPT-6 Sol 和 Luna,API 价格较 GPT-5.6 促销价降低 50%,官方称 Astra 仍是整体最强模型。
  • 在 AutomationBench 跨应用业务流程测试中,GPT-6 Sol 于 xhigh 强度下表现优于 Claude Opus 5,每任务成本仅为后者的 9%;Luna 在 high 强度下较前代提升 5.4%,每任务成本降低 58%。
  • Last Exam 智能体评估中,GPT-6 Sol 在 max effort 状态下得分 56.4%,高于 Claude Opus 5 最高分,每任务成本降低 60%。
  • 豆包通用 Session 团队规模预计缩减约一半,该团队此前约 50 人,曾是豆包内最大团队;对话方向产品后训练团队同步缩减,部分员工转岗至 Horizon RL、产品后训练-办公等团队。
  • 阿里云栖大会披露 Qwen3.8-Max 在 Artificial Analysis Agentic 智能体榜和 CodeArena 前端编程榜位列第一;基于下一代架构的 Qwen4 已投入训练,后续版本参数将扩展至 5 到 10 万亿。
  • 千问发布 AI 手机全栈解决方案 Qwen Intelligence,提供规划、操作、创意三套方案,官方称均达行业 SOTA 水平并已在真实场景落地。
  • 理想芯片子公司推进首轮外部融资,投前估值约 150 亿元,计划融资数十亿元;自研芯片团队约 200 人,马赫 M100 采用 5nm 车规级工艺,单芯片算力 1280 TOPS。
  • 日本计划最早 2027 年在国际空间站举办 AI 机器人竞赛,由今年 7 月成立的 SAIRA 组织,胜出队伍将控制希望号实验舱内的 Int-Ball2 球形无人机。

文章拆解

OpenAI 此次发布的核心逻辑是用「同源训练、分层定价」覆盖更宽的市场。Sol 和 Luna 沿用 Astra 的训练方法,把专业工作、事实性、编码和计算机使用能力下放到更快、更便宜的模型,同时把 API 价格压到 GPT-5.6 促销价的一半,并改进提示缓存以降低智能体重复调用上下文的成本。从官方给出的数据看,Sol 在跨应用业务流程和智能体评估中已能与 Claude Opus 5 正面竞争,且单任务成本显著更低。这意味着 OpenAI 的竞争重心正从「最强模型」转向「最强性价比」,对依赖大规模智能体调用的开发者而言,迁移成本正在下降。不过 Astra 仍被官方定位为无妥协选项,说明能力分层依然存在,用户需在效果与成本之间做取舍。

豆包的团队调整则指向另一条逻辑:对话产品的规模红利正在见顶。豆包 DAU 已超过 2 亿,但素材明确指出其成功本质仍是对话产品的成功。当通用对话能力逐渐成为基础能力,继续维持约 50 人的通用 Session 团队和独立评测团队的人效比就会受到质疑。负责人赵祺此前负责增长中台、穿山甲和集团人力资源,到任后拆散独立评测团队、推动人员向商业化和飞书转岗,反映出字节正把资源从「把对话做得更好」转向「把对话变成收入或嵌入办公场景」。对话模型合版负责人一个月内更换两次,也说明该方向的组织与目标仍在剧烈调整中。这一变化对用户侧的直接影响尚不明显,但可能影响豆包后续对话体验的迭代节奏,具体产品策略尚待确认。

把两条线索放在一起看,行业正在从「模型能力竞赛」进入「成本、场景与组织效率」的综合比拼。阿里在云栖大会提出「思考力商品化」,并给出 AI 芯片、AI 模型、AI 云三大基石和 2032 年数据中心超 20GW 的目标,本质上也是在为智能体时代的基础设施定价。千问发布 AI 手机全栈方案、Qwen4 投入训练,说明手机端 Agent 和下一代模型是阿里接下来的两个抓手。理想以约 150 亿元投前估值推进芯片融资,则显示车企也在把算力自主权视为长期变量。值得关注的变量包括:OpenAI 降价是否会引发新一轮 API 价格战;豆包收缩后国内 AI 应用是否会集体从对话转向商业化与办公;以及 Qwen4 的 5 到 10 万亿参数路线能否在成本可控的前提下落地。潜在风险在于,智能体大规模调用带来的成本下降可能刺激滥用,而组织收缩若过快,也可能削弱产品迭代的连续性。

查看原文