
Next 100x in AI: Inference, Networking, & Self-Optimizing Models — Philip Kiely & Ali Taha, Baseten
这段访谈的核心结论是:推理工程早已不是“把模型跑起来”这么简单,而是量化、投机解码、KV 缓存、并行策略、硬件互联、后训练与运行时调优共同构成的一整套系统工程。更进一步,模型已经开始参与优化自己的推理栈,训练与推理的边界正在快速消失。
9 个关键观点

这段访谈的核心结论是:推理工程早已不是“把模型跑起来”这么简单,而是量化、投机解码、KV 缓存、并行策略、硬件互联、后训练与运行时调优共同构成的一整套系统工程。更进一步,模型已经开始参与优化自己的推理栈,训练与推理的边界正在快速消失。
9 个关键观点



讲者把大语言模型解释为“下一词预测器 + 海量参数 + 工具调用系统”:运行它并不神秘,难的是昂贵训练、后续对齐和持续评测。真正决定其上限的,不只是模型本身,还有规模化训练、多模态、工具使用,以及不断扩大的安全攻击面。
11 个关键观点

这段内容的核心判断是:分词不是无聊的预处理,而是大模型能力、成本、稳定性与怪异行为的底层约束。很多看似“模型不聪明”的问题,实际先来自 tokenization 的表示方式。
10 个关键观点

这期内容把 GPT-2 124M 从公开权重、架构实现到多卡训练完整复现了一遍,并用现代 PyTorch 工程手段把训练效率大幅拉高。作者最终在其采用的验证损失和 HellaSwag 指标上超过公开 GPT-2 124M,但也明确保留了数据顺序、评测公平性和 torch.compile 兼容性等疑点。
11 个关键观点