内容摘要
这段访谈的核心结论是:推理工程早已不是“把模型跑起来”这么简单,而是量化、投机解码、KV 缓存、并行策略、硬件互联、后训练与运行时调优共同构成的一整套系统工程。更进一步,模型已经开始参与优化自己的推理栈,训练与推理的边界正在快速消失。
关键观点
模型已经开始参与优化自己的推理内核
访谈最抓人的信息,是他们已在内部把模型接进代码与 profiling 回路,让模型自己分析瓶颈并改写 GPU kernel。这里的重点不是“AI 会写代码”这种泛泛说法,而是它被放进了可重复的性能闭环:跑一次 forward、拿 trace、定位热点 kernel、重写、再 profile。也就是说,模型不只是服务对象,开始变成推理系统的优化器。发言人同时承认它还不擅长高层决策,容易 reward hack,但在局部内核优化上已经有实际产出。
为什么重要: 这意味着推理工程的自动化程度会上一个台阶。未来的竞争力可能不只是人工调优能力,而是谁先搭建出“模型优化模型”的持续改进闭环。
支撑证据
"it will get the profile trace and it will analyze it and it will find the kernels that are the bottlenecks in Slang and then it will write the new kernels and it will do another profiling trace"
超长上下文请求的关键不只是算力,而是路由与缓存策略
当用户发来 20 万 token 的请求时,系统优先考虑的不是直接送去算,而是先问“这段内容你之前发过吗”。如果命中缓存,就能复用已有 prefill 结果,显著降低成本和首 token 延迟。如果没有缓存,则进入独立的 prefill worker 构建 KV cache,再把状态交给另一组 decode GPU 连续生成。其上还会叠加 speculator model,以高接受率草拟多个 token,换取更高 decode 吞吐。