关键观点
长周期任务是最明显的能力跃迁评测者让 Fable 5.1 在 Ultra Code 模式下调用约 40 个子代理,端到端生成了名为 Hands 的桌面代理。该应用能够从其他代理或 Slack 接收任务、远程操作 Mac,并展示截图、当前动作和日志。此前使用旧版 Fable 尝试约五六次仍未真正成功,而新版在约一天后给出了可运行结果。这个案例来自评测者个人实践,并非可重复的标准化基准。
评测者让 Fable 5.1 在 Ultra Code 模式下调用约 40 个子代理,端到端生成了名为 Hands 的桌面代理。该应用能够从其他代理或 Slack 接收任务、远程操作 Mac,并展示截图、当前动作和日志。此前使用旧版 Fable 尝试约五六次仍未真正成功,而新版在约一天后给出了可运行结果。这个案例来自评测者个人实践,并非可重复的标准化基准。
为什么重要: 它表明模型的价值可能从辅助写代码转向接管完整项目,但高 token 消耗和较弱交互性仍限制了适用范围。
支撑证据
This was built end to end by Fable 5.1 from a couple prompts that is a desktop agent built fully by this model.
效率显著优于 Opus 5内部代理基准中,Fable 5.1 平均每次运行约消耗 766 tokens,而 Opus 5 接近 2000 tokens。平均响应延迟分别约为 22 秒和 37 秒。按这些数字计算,Fable 5.1 的 token 用量约为 Opus 5 的 38%,响应速度约快 68%;视频中“快两倍、使用一半 token”的说法属于概括性表达,并不与给出的数字严格相等。