关键观点
推理成本是随使用量增长的持续性成本模型训练通常是阶段性投入,而推理成本会随着用户、请求、词元和会话数量持续增加。硬件容量有限、GPU 计算昂贵,使高频 AI 产品必须关注单位请求或单位词元成本。讲者提出两个基本方向:减少词元使用量,或提升推理服务本身的效率。
模型训练通常是阶段性投入,而推理成本会随着用户、请求、词元和会话数量持续增加。硬件容量有限、GPU 计算昂贵,使高频 AI 产品必须关注单位请求或单位词元成本。讲者提出两个基本方向:减少词元使用量,或提升推理服务本身的效率。
为什么重要: 产品即使承担得起训练费用,也可能因持续增长的线上推理支出而失去商业可行性。
支撑证据
it's a recurring cost because it's a operating cost that scales with every user that comes in that every token that comes in every session
显存、TTFT 与吞吐量构成三类基础痛点上下文越长,需要保存的 KV 向量越多,显存占用随之增长,并可能触发显存不足。更长的输入还会增加 prefill 工作量,使首词元到达更慢。缺乏批处理和调度优化的朴素实现往往顺序处理请求,因此并发用户越多,完成时间越长。