关键观点
Harness 是模型与现实世界之间的能力层原始大模型本质上只处理可见上下文中的 token 输入和输出。Harness 在其外部加入持久状态、工具、计算环境、文件、记忆和其他智能体,使固定权重能够处理更广泛的问题。它不是装饰性包装,而是决定模型能采取哪些行动、保留哪些经验以及能运行多久的执行系统。同一权重文件因 harness 不同而产生显著性能差异,说明评测模型时不能忽略执行层。
原始大模型本质上只处理可见上下文中的 token 输入和输出。Harness 在其外部加入持久状态、工具、计算环境、文件、记忆和其他智能体,使固定权重能够处理更广泛的问题。它不是装饰性包装,而是决定模型能采取哪些行动、保留哪些经验以及能运行多久的执行系统。同一权重文件因 harness 不同而产生显著性能差异,说明评测模型时不能忽略执行层。
为什么重要: 模型采购、基准测试和智能体设计都应把模型与 harness 视为完整系统,而不是只比较模型名称或困惑度。
支撑证据
The harness itself is the layer between the LLM and the world that adds things like this persistent state tools and compute.
Harness 已从静态脚手架走向自我改进