关键观点
超级智能可能卡在泛化而非基准能力模型可能继续在数学、代码和精心构造的环境中取得高分,却无法把能力稳定迁移到现实任务。真正的限制可能表现为持续存在的模拟到现实鸿沟、较差的判断力,以及无法充分检查自己的工作。这样一来,每一代模型都会短暂制造“AGI 已至”的印象,但实际使用一段时间后,弱点重新成为整体生产率的瓶颈。受访者认为这种情形并非最可能,却是2036年世界仍大致正常时最可信的技术解释之一。
模型可能继续在数学、代码和精心构造的环境中取得高分,却无法把能力稳定迁移到现实任务。真正的限制可能表现为持续存在的模拟到现实鸿沟、较差的判断力,以及无法充分检查自己的工作。这样一来,每一代模型都会短暂制造“AGI 已至”的印象,但实际使用一段时间后,弱点重新成为整体生产率的瓶颈。受访者认为这种情形并非最可能,却是2036年世界仍大致正常时最可信的技术解释之一。
为什么重要: 评估模型不能只看峰值能力或基准分数,还要看它在开放环境中的可靠性、迁移能力和最弱环节。
支撑证据
There’s this cycle that keeps repeating where a new model comes out and people are blown away and they’re like, "This is it. This is AGI." But then they use it a bit, and it starts to feel dumb after a month or so.
决定起飞速度的是能否自主提出正确目标