精华速览
在2026骁龙峰会上,高通同时推出第六代骁龙8超级至尊版与第六代骁龙8至尊版两款2nm制程移动平台,首次将产品逻辑从手机为中心转向以智能体为中心。超级至尊版搭载最高5GHz的Oryon CPU、首次在Adreno GPU中集成Matrix Cores,以及可端侧运行300亿参数MoE模型的Hexagon NPU。高通联合阶跃、无量火、江波龙完成该模型手机端部署,内存需求降低超50%,预填充超330 Token/s。高通称智能体全天运行的核心瓶颈是内存与续航,而非单纯算力,因此从片上缓存、系统内存到闪存进行系统级重构。
要点透视
- 2026骁龙峰会上,高通同时发布第六代骁龙8超级至尊版和第六代骁龙8至尊版,两款均为2nm制程移动旗舰平台,超级至尊版定位产品组合顶端。
- 第六代骁龙8超级至尊版搭载业界首个最高主频达5GHz的移动CPU,采用全新Oryon FlexCache,8个核心共享同一L2缓存池并按负载动态分配。
- Adreno GPU首次加入Matrix Cores,性能最高提升44%,能效最高提升40%,并配备第二代18MB独立高速显存HPM,图形管线功耗降低12%。
- Hexagon NPU共享内存增加50%,支持最高32K Token上下文,部分模型预填充性能提升最高80%,可端侧运行300亿参数MoE模型,每Token仅激活约30亿路由参数。
- 高通与阶跃、无量火、江波龙合作,将StepEdge-Omni 30B-MoE完整部署到手机端,运行内存需求较常规方案降低超50%,预填充超330 Token/s,解码超28 Token/s。
- NPU与GPU双引擎协同的预填充吞吐性能,相比仅使用NPU的通用推理方案提升超过30%。
- 传感器中枢双Micro NPU性能提升85%、功耗降低20%,可在不频繁唤醒主应用处理器的情况下持续处理环境语音与用户活动。
- 第二代AI-ISP架构将视频吞吐能力提升2倍,并首次在搭载骁龙移动平台的智能手机上支持8K 60fps视频拍摄。
文章拆解
高通此次发布的核心变化,不是单纯刷新CPU主频或GPU跑分,而是承认智能体AI对移动SoC提出了与App时代不同的设计约束。过去旗舰芯片的竞争围绕峰值性能展开,但智能体需要持续感知、理解上下文、调用工具并在用户不操作时代表用户执行任务,这意味着芯片必须长时间低功耗运行,而非短时爆发。高通产品技术专家朱元堃明确表示,端侧智能体的主要问题是内存和续航限制,而非性能限制,这为理解5GHz、FlexCache、HPM和NPU共享内存扩容提供了统一逻辑:减少数据在系统内存与片上存储之间的搬运,才能让高频计算真正用于有效工作。
从核心逻辑看,高通在CPU、GPU、NPU三个计算单元上同时针对内存墙动刀。Oryon FlexCache让8个核心共享L2缓存池,减少智能体多任务交接时的数据重载;Adreno GPU的18MB独立显存和Matrix Cores让AI任务留在图形管线内完成,避免数据在GPU与NPU之间往返;Hexagon NPU共享内存增加50%,使模型状态、上下文和KV-cache更多留在片上。这种系统级思路比单点提升算力更贴近智能体全天运行的实际需求。
对行业和用户而言,最直观的验证是300亿参数MoE模型在手机端运行。300亿参数决定知识容量,约30亿激活参数控制单次推理计算量,这一组合试图在模型能力与手机内存、功耗之间找到新平衡。高通联合阶跃、无量火、江波龙完成部署,内存需求降低超50%,预填充超330 Token/s,说明端侧AI正从单次问答向连续任务工作流迁移。邮件理解、行程规划、日历同步等场景若能在本地闭环,将减少对云端的依赖,并强化隐私和即时响应优势。
值得关注的变量有三。第一,异构调度效率能否在真实负载下持续兑现,NPU与GPU双引擎协同预填充提升超30%是实验室数据,实际游戏、影像和办公并发场景尚待确认。第二,端侧运行大模型对散热和续航的长期影响,高通虽给出功耗优化数字,但智能体全天在线意味着传感器中枢、NPU和连接模块需持续工作,整机续航表现仍需真机验证。第三,跨终端连续性依赖连接和生态协同,高通提出手机、PC、眼镜、汽车共享智能体理解,但不同厂商的模型、推理引擎和存储方案能否无缝配合,尚待确认。总体看,第六代骁龙8超级至尊版是高通对下一代旗舰标准的一次系统性回答,其成败不取决于单个参数,而取决于内存、功耗和异构协同能否让智能体在有限空间中真正全天运行。

暂无评论。