关键观点
RLVR是实验室押注的通用智能路径主流研究押注认为,在数百万个可验证任务和数千个强化学习环境中训练,可以塑造通用的问题解决代理。这种代理应能在错误、歧义和长期任务中持续制定计划并修正策略。其核心假设不是记住所有领域知识,而是把可验证训练获得的能力迁移到训练分布之外。
主流研究押注认为,在数百万个可验证任务和数千个强化学习环境中训练,可以塑造通用的问题解决代理。这种代理应能在错误、歧义和长期任务中持续制定计划并修正策略。其核心假设不是记住所有领域知识,而是把可验证训练获得的能力迁移到训练分布之外。
为什么重要: 如果迁移足够强,实验室便可能通过继续扩大环境、算力和训练规模逼近AGI,而不必先解决持续学习。
支撑证据
They think that if we train AIs to accomplish millions of verifiable tasks across thousands of diverse RL environments, then we will have basically built AGI.
可验证并不等于可训练一个领域即使结果可以检查,也未必适合当前强化学习。高效训练还要求环境具有确定性、可重放、可重置,并允许从相同起点运行大量并行轨迹。计算机操作进展慢,正暴露了验证条件与规模化采样条件之间的差距。