关键观点
旧上限约为200至300条指令讲者首先复现IFScale原始实验,以确认所谓“200条指令上限”并非传闻。该基准要求模型在商业报告中包含一组指定词汇,并以成功出现的比例衡量指令遵循准确率。复现实验与原论文结果处于噪声范围内:规则数达到约500条时,模型会漏掉30%至50%。因此,一年前的前沿模型确实会在约200至300条规则后开始明显退化。
讲者首先复现IFScale原始实验,以确认所谓“200条指令上限”并非传闻。该基准要求模型在商业报告中包含一组指定词汇,并以成功出现的比例衡量指令遵循准确率。复现实验与原论文结果处于噪声范围内:规则数达到约500条时,模型会漏掉30%至50%。因此,一年前的前沿模型确实会在约200至300条规则后开始明显退化。
为什么重要: 旧模型时代的短提示词、技能分片和多代理设计具有现实依据,但这些设计前提需要随模型能力更新。
支撑证据
our curves matched the results in the original paper within the noise boundary. So the finding was real. uh a year ago somewhere around 200 to 300 rules frontier models started falling apart.
指令容量在一年内提升近10倍