关键观点
能力必须写成预算函数传统评测为每个模型和基准提供一个孤立分数,无法区分算法能力与推理投入。5.5 的基准提升看似有限,但它获得结果所需的思考时间少于 5.4;控制测试时计算后,差距会更加明显。因此,模型能力应表示为性能随时间、Token 或成本变化的曲线,而不是脱离预算的固定属性。
传统评测为每个模型和基准提供一个孤立分数,无法区分算法能力与推理投入。5.5 的基准提升看似有限,但它获得结果所需的思考时间少于 5.4;控制测试时计算后,差距会更加明显。因此,模型能力应表示为性能随时间、Token 或成本变化的曲线,而不是脱离预算的固定属性。
为什么重要: 统一预算后,用户和研究者才能判断新模型是真正更高效,还是仅仅消耗了更多计算。
支撑证据
the proper way to evaluate the models now is you either have some kind of budget for the benchmark whether it's tokens or cost or time or whatever or you plot the performance as a function of the amount of test time compute
运行到平台期已经不现实早期模型无法长时间进行有效推理,所以运行到性能饱和曾是可行方案。现代模型经过合理脚手架组织后,可以在部分任务上持续改进数周。网络安全评测甚至显示,模型使用一亿 Token 后仍在提升。完整测出能力上限所需的时间,可能已经超过模型自身的发布周期。