精华速览

AI Simulation赛道近期快速升温,核心是用大模型驱动的智能体模拟人类个体与社会行为,并尝试预测现实结果。斯坦福小镇实验从25个Agent扩展到1052个数字分身,问卷回答与真人相似度达85%;哈佛与MIT联合项目MatrAIx构建了83亿个虚拟人格,完成超1.8万次测试。商业端,Simile估值突破20亿美元,已为财富100强运行数千万次模拟;Aaru估值近10亿美元,客户包括麦当劳、安永等。但行业仍面临预测黑箱、验证标准缺失和规模化成本等挑战,高估值更多是对未来空间的提前押注。

要点透视

  • 斯坦福与Google 2023年发布Generative Agents实验,25个AI Agent在虚拟小镇中自主生活、工作和社交,无预设剧本。
  • 2024年斯坦福团队将实验扩大到1052个Agent,每个对应真实美国成年人,经约两小时深度访谈生成数字分身,问卷回答与真人两周后答案相似度达85%。
  • 哈佛与MIT联合发起的MatrAIx项目构建83亿个独特人格,每人格由1290个维度定义,在四种环境中完成超1.8万次测试,400次受控实验显示91.5%情况下Agent能遵循预设人格。
  • Simile由斯坦福小镇核心研究者创办,2025年2月正式亮相,估值已突破20亿美元,已为财富100强企业运行数千万次模拟,并与CVS合作构建40万个数字分身。
  • Aaru由00后团队创办,创始人成立时分别18岁和19岁,技术负责人15岁;回测2020年美国大选误差不到0.5%,2025年纽约市长民主党初选成功预测曼达尼胜出,客户包括麦当劳、安永、拜耳等,估值接近10亿美元。
  • 成本快速下降:2023年斯坦福小镇25个Agent运行两天消耗数千美元Token,2025年100个Agent一整轮模拟成本可能仅几美元。
  • AI预测能力提升:2025年6月基于OpenAI o1的模型首次进入Metaculus预测排行榜第25位,最新赛季前五名几乎被AI占据。
  • Aaru在2024年美国大选真正预测中错误判断哈里斯获胜,显示复现历史与预测未来之间仍存在显著差距。

文章拆解

AI模拟人类与社会的探索正从学术实验走向商业落地,其核心逻辑是用大语言模型驱动智能体,在虚拟环境中复现个体决策与群体互动,进而推演现实世界可能发生的结果。这一方向之所以在近期升温,直接原因是模型推理成本快速下降和Agent技术成熟,使得大规模模拟从理论走向可行。斯坦福小镇从25个Agent扩展到1052个数字分身,以及MatrAIx构建83亿人格数据集,都标志着模拟精度和规模的双重跃升。

商业上,当前主要分化为两条路线。一条以Simile为代表,追求高保真还原个体,通过深度访谈生成数字分身,适用于消费者研究、产品测试等需要深入理解特定人群的场景,但代价是标准化难、可迁移性未知,每家企业可能需重新训练。另一条以Aaru为代表,侧重群体模拟和速度,基于人口、消费等数据快速构建模拟人群,适合大规模市场调研,但个体深度有限。两条路线各有取舍,也对应不同的付费意愿和客户需求。

行业影响方面,AI模拟若成熟,可能冲击传统市场调研和咨询行业。Russ Salakhutdinov甚至认为麦肯锡、BCG等机构应被AI取代。但当前营收规模仍小,Aaru仅数千万美元级别,高估值更多是押注未来。用户端,企业可以用数字分身提前测试产品、价格和政策反应,降低决策成本,但前提是模拟结果足够可信。

值得关注的变量包括:预测验证的天然悖论——只有事后才能确认预测准确性,而预测价值恰恰在事前;大模型倾向于给出合理答案,可能掩盖真实行为偏差;长尾极端事件如金融危机、地震难以从历史数据中学到;规模扩大后,多体互动复杂度指数级上升,成本可能再次成为瓶颈。此外,Agent在模拟中产生恋爱、结婚甚至怀疑世界真实性等未预设行为,虽不证明意识,但提示复杂系统可能涌现意外结果。

潜在风险在于,若企业过度依赖模拟结果做重要决策,而模拟精度不足或存在系统性偏差,可能导致误判。行业目前缺乏统一评估标准,MatrAIx等尝试建立基础设施,但尚待确认能否成为通用基准。总体看,AI模拟仍处早期,技术、商业和伦理问题均需持续观察。

查看原文