关键观点
科学实验被定义为下一代训练数据源Lila 判断,互联网预训练数据已经接近耗尽,而科学可以持续产生新的、可验证的数据。实验结果不像普通合成文本那样只依赖人工偏好,而是由自然规律提供反馈,因此适合成为强化学习中的验证信号。其目标是让模型通过反复提出假设、调用实验并接收结果,持续扩大科学推理能力边界。这里的“无限”并非指实验没有成本,而是指可提出的新问题和新实验组合不会像静态语料库一样被一次性消耗完。
Lila 判断,互联网预训练数据已经接近耗尽,而科学可以持续产生新的、可验证的数据。实验结果不像普通合成文本那样只依赖人工偏好,而是由自然规律提供反馈,因此适合成为强化学习中的验证信号。其目标是让模型通过反复提出假设、调用实验并接收结果,持续扩大科学推理能力边界。这里的“无限”并非指实验没有成本,而是指可提出的新问题和新实验组合不会像静态语料库一样被一次性消耗完。
为什么重要: 如果这一判断成立,科学实验能力将从研发基础设施转变为前沿模型的数据基础设施,并形成难以复制的专有数据壁垒。
支撑证据
science, running the scientific method and using nature and experiments as verifier is like the ultimate version of that.
核心资产是模型,实验室是数据生成器