精华速览

苹果 A20 Pro 芯片首次采用双 16 核神经网络引擎,配合 iPhone 18 Pro 系列升级的 12GB LPDDR5X 内存,将端侧 AI 性能推至新高度。实测显示,iPhone 18 Pro 本地运行 270 亿参数的 Bonsai-27B 模型时,生成速度可达 iPhone 17 Pro 的两倍,内存带宽提升至 115.2GB/s。不过,新一代 Bonsai 2 因 2 比特量化后体积过大,无法完整载入本地内存,用户仍需在模型规模与性能之间权衡。这一进展表明手机离线运行大模型正从概念走向实用,但内存容量仍是关键瓶颈。

要点透视

  • A20 Pro 芯片搭载双 16 核神经网络引擎,为苹果自研 Apple Silicon 史上首次采用该设计。
  • iPhone 18 Pro 与 iPhone 18 Pro Max 均配备 12GB、96 位位宽 LPDDR5X 内存,内存速度较 iPhone 17 Pro 系列明显提升。
  • 实测中,iPhone 18 Pro 运行 270 亿参数的 Bonsai-27B 模型,生成词元速度达到 iPhone 17 Pro 的两倍。
  • A20 Pro 的内存带宽可达 115.2GB/s,双神经网络引擎在专用任务下峰值吞吐超过芯片内 7 核 GPU。
  • 初代 Bonsai 为 1 比特量化模型,4GB 内存设备即可运行,8GB 或 12GB 内存手机运行更流畅。
  • Bonsai 2 采用 2 比特量化,体积过大无法完整存入 iPhone 18 Pro 本地内存,可能导致性能下降。
  • 演示由网友 Adrien Grondin 在 iPhone 18 Pro 上完成,直观展示了模型生成速度的提升。
  • 苹果后续机型若进一步加大内存,有望支持参数量更大、复杂度更高的本地 AI 模型。

文章拆解

苹果 A20 Pro 的端侧 AI 演示,核心看点不在“能跑大模型”,而在“跑得动且跑得快”。270 亿参数模型此前通常需要云端或桌面级硬件,如今在手机本地实现两倍于上代的速度,说明苹果正把神经网络引擎和统一内存作为 AI 性能的双引擎来推。双 16 核 NPU 是架构层面的首次尝试,而 12GB LPDDR5X 与 115.2GB/s 带宽则解决了大模型加载和推理时的内存墙问题。两者叠加,才让 Bonsai-27B 这类模型在手机上保持高速、不降速卡顿。

从行业角度看,这释放了一个明确信号:端侧 AI 的竞争焦点正从“能否运行”转向“运行多大规模、多快速度”。苹果通过硬件规格的跃升,把本地 AI 从演示功能推向可用功能。对用户而言,离线运行大模型意味着隐私更好、延迟更低、不依赖网络,但代价是内存占用和模型选择受限。Bonsai 2 因 2 比特量化后体积过大无法完整载入,就是这种取舍的直接体现——更先进的模型未必能在当前硬件上发挥最佳效果。

值得关注的变量有三个。第一,内存容量是否会继续提升。素材中明确提到,希望苹果后续机型加大内存以支持更大模型,这说明 12GB 可能只是过渡规格。第二,量化技术与模型压缩的进展。如果 2 比特量化仍无法解决体积问题,未来可能需要更高效的压缩方案或分层加载策略。第三,NPU 与 GPU 的任务分配。双 NPU 峰值吞吐超过 7 核 GPU,意味着苹果可能在引导开发者将 AI 负载更多交给专用引擎,这会改变应用层的优化方向。

潜在风险同样存在。本地运行大模型对散热和续航的压力尚待确认,长时间高负载推理是否会导致降频,素材未提供相关数据。此外,Bonsai-27B 的实测速度翻倍是在特定模型和演示环境下取得的,不同模型、不同任务下的表现可能差异较大。端侧 AI 的实用性不仅取决于峰值性能,还取决于持续性能和生态适配。苹果若想将这一能力转化为用户可感知的体验,还需要在内存规格、模型优化和开发者工具上持续投入。

查看原文