跳转到内容
主站 新闻 控制台

[AINews] 性能差10%,成本低100倍,速度快10000倍:仿真为何正在占据主导地位

· Latent Space
播客深度访谈

按照如今的 AI 行业标准,今天是一个相当平静的周五,因此是时候退后一步,思考究竟发生了什么。如果你读过我们的《2025 年阅读清单》,关注过我们对 Z.ai GLM 的报道,理解了 Poolside 的转向,一直在关注我们的 AI for Science 主题,并收听了今天的 Simile 播客,那么你不仅是 Latent Space 最大的读者群体之一,可能也会形成这样一种心智模型:

图片

自 2022 年以来,每年都会有一个生成机器智能的流水线组件,从人类制造转变为模型制造。这种转变既不是渐进式的,也不是均匀发生的——每一次转变都有一个“零号病人”:某篇论文或某款产品,合成版本首次在前沿实验室中成为承重结构,此后,未来就已经到来,只是尚未完成生产化。

如果你稍微眯起眼睛观察,就会发现,我们过去称之为“合成数据”“合成评分标准”“AI 研究员”和“端到端强化学习环境”的东西,本质上都只是越来越雄心勃勃的人类模拟——效果差 10%,但成本降低 100 倍,速度提升 10,000 倍。

阶段 1:奖励信号(2022 年)

第一个转向合成的东西,出人意料地是评判者。InstructGPT 确立了如今已成为经典的方法:只收集一次人类偏好,训练一个奖励模型,然后让策略针对模型进行优化,而不是针对人类进行优化。从策略的视角来看,负责发放认可的东西已经是一个 LLM。

Constitutional AI 更进一步,让 AI 根据一组原则进行自我批评(RLAIF);之后,Lee 等人 证明,AI 反馈能够以极低的成本达到与人类反馈相匹配的效果。等到 LLM-as-judge 成为默认的评估方法(MT-Bench、AlpacaEval)时,整套认可机制——奖励、批评、评估——都已经由模型来评判模型。

阶段 2:训练数据(2023 年)

微软的 Phi 系列在标题中就提出了这一论点:《你所需要的只有教科书》(Textbooks Are All You Need)。一个使用 LLM 合成的、教科书级别数据训练的小模型,能力远超其参数规模所应达到的水平,而 phi-1.5 证实这并非偶然。

苹果的 WRAP 将这一做法进一步推广:不要只是生成数据,而是用 LLM 改写整个互联网,这样预训练效率大约可以提升 3 倍。此后,这条流水线开始工业化——NVIDIA 的 Nemotron-4 340B 将一套采用宽松许可的合成数据生成流水线作为主要卖点发布;到 2025 年,重新