精华速览

过去大半年,国内多家AI模型厂商密集启动预训练返工,核心原因指向数据质量问题。此前行业普遍认为数据规模优先,粗放式堆砌万亿token语料,导致模型效果卡在60-70分,甚至被1%规模的小模型反超。脏数据不仅浪费算力与人力,还耽误时间窗口。与此同时,数据获取面临预算不足与产能稀缺双重瓶颈,部分厂商通过API中转站截留用户交互轨迹。业内认为数据飞轮尚未真正转起来,高质量数据积累没有捷径,未来一两年可能还有更多推倒重来的案例。

要点透视

  • 多家国内基模厂商在过去大半年密集启动预训练返工,主因是数据质量不达标,而非算力或架构问题。
  • 有厂商花一年训练万亿参数模型,落地表现被市面上1%规模的小模型倒挂,排查后确认是脏数据拖累。
  • 典型翻车案例:某中部基模公司将爬取的技术博客整批灌入预训练语料,训练中期发现大量机器生成页重复数万次,模型在评测集上出现复读,几万卡时作废。
  • 业内粗略拆解AI训练预算:每100元中算力约40元、人才30元、广告20元、数据仅10元,数据投入占比偏低。
  • 专家数据价格差距显著:美国HLE调研一条起价一两万美金,国内基本只给一两千人民币。
  • 部分模型厂商隐蔽运营API中转站做Token转发,借此收集用户调用先进模型的真实任务数据,用于训练。
  • 数据飞轮面临三处堵点:组织数据墙未破除、数据类人才匮乏、内生数据不足,长程轨迹数据主要依赖AI Coding和AI办公场景。
  • 多位业内人士预计未来一两年行业还会出现更多推倒重来的案例,数据基建完成前难以看清最终分野。

文章拆解

这轮预训练返工潮,本质上是行业为早期粗放式数据策略集中补课。大模型发展初期,主流观点认为数据规模可以弥补质量缺陷,模型自身具备鲁棒性和转化能力。但实践表明,底层脏数据的危害远超预期:它不仅让算力、资金和人力投入打水漂,更关键的是耽误了模型迭代的时间窗口。当海外模型能力跑到90分时,被脏数据卡在60-70分的团队很难靠算法或算力短期追回差距。

更深层的问题在于,互联网时代积累的场景数据在AI时代并未形成预期壁垒。通用基模比拼的是通用能力,本地生活、社交、电商等垂直场景数据的迁移价值有限。Google场景数据最多却未在基模上领先,Anthropic、OpenAI等此前数据零积累的厂商反而冲得更猛,说明行业已站到同一起跑线,胜负取决于数据获取速度、质量以及稳定转化为模型能力的管线。

数据工作的难点集中在钱和产能。大厂看似不差钱,但分摊到数据上的预算占比很小,专家数据采购上国内外价差悬殊。正规渠道供给不足,催生了API中转站截留交互轨迹、模型路由公司盯上数据资产等灰色操作。这些门路能带来短期优势,但可持续性尚待确认。

数据飞轮的逻辑虽闭环,但真正转起来的厂商寥寥。组织内部数据墙、数据工程人才短缺、内生高质量轨迹数据单薄,都是现实障碍。长程轨迹数据主要来自AI Coding和AI办公,前者被海外模型占据较大份额,后者产品能力尚处早期,沉淀有限。

值得关注的变量包括:厂商能否在组织层面打通从用户行为到模型训练的数据通路;数据预算占比是否会随竞争加剧而提升;监管对API中转站截留数据的态度是否变化。潜在风险在于,若数据治理持续滞后,模型厂商可能陷入反复返工的消耗战,而高质量数据的积累需要时间与定力,没有捷径可走。未来一两年,推倒重来的案例可能继续出现,真正的分野要等数据基建基本完成后才能看清。

查看原文