内容摘要
这场分享的核心结论是:多 GPU AI 内核优化的主要瓶颈已从单卡内存访问转向跨 GPU 通信,而现有前沿模型还不足以可靠推理这类通信权衡。Together AI 试图用一组更小、更清晰的原语和一个新基准,把这件事从“靠高手手搓”变成可系统研究的问题。
关键观点
多 GPU 通信已成为新的主要瓶颈
讲者的基本判断是,AI 系统优化的重心已经发生迁移。过去行业把大量精力投入到单卡 kernel、注意力优化、稀疏架构和更好的 DSL 上,这些努力显著抬高了单 GPU 利用率。结果是,随着模型和工作负载规模继续增长,真正限制扩展效率的部分转成了多 GPU 之间的数据交换。尤其在生产级分布式训练和推理中,通信时间已经开始吞噬大部分总运行时间,并直接压低大规模场景下的 MFU。
为什么重要: 这意味着继续只盯着单卡算子优化,边际收益会越来越低。下一阶段的系统竞争力,会更多取决于你是否能把通信当成一等公民来设计。
支撑证据
with significant investment in better kernels like flash attention, uh, memory efficient architectures like from deepseek, sparse attentions, mambas and so on, um, and better DSLs, we've sort of shifted the bottleneck to multi-GPU communication.
硬件层级决定了内核设计的基本物理约束
演讲没有直接跳进框架或代码,而是先回到 GPU 的物理结构。核心逻辑很简单:离计算单元越近的存储,带宽越高但容量越小;越远的存储,容量更大但访问更慢。这解释了为什么寄存器、L2、HBM 与跨卡互联不能被同等看待,也解释了为什么多 GPU kernel 的性能常常不是被单一算子决定,而是被整条数据移动路径限制。讲者还用 H100 举例强调,寄存器速度极快,但资源极其稀缺,因此通信方案会直接影响可用于计算的资源预算。