内容摘要
讲者把大语言模型解释为“下一词预测器 + 海量参数 + 工具调用系统”:运行它并不神秘,难的是昂贵训练、后续对齐和持续评测。真正决定其上限的,不只是模型本身,还有规模化训练、多模态、工具使用,以及不断扩大的安全攻击面。
关键观点
LLM 在工程上可以被看成“两文件系统”
讲者先用极简方式去神秘化大语言模型:一个模型本体可以近似理解为参数文件加运行代码。以 Llama 2 70B 为例,参数是神经网络权重,运行文件则实现前向计算逻辑。也因此,推理阶段并不必然依赖云端或联网;只要本地机器能承载参数并执行代码,就能直接与模型交互。
为什么重要: 这改变了很多人把 LLM 误解为纯在线服务的印象。对工程选型而言,它把问题拆成“如何拿到参数”和“如何高效运行参数”两部分。
支撑证据
the Llama 270b model is really just two files on your file system the parameters file and the Run uh some kind of a code that runs those parameters
训练比推理难得多,本质像对互联网做有损压缩
讲者把训练描述为把大块互联网文本压缩进参数中的过程,而且强调这不是无损压缩,而是只保留某种统计性和知识性的“整体感”。他给出的示例数字很具体:大约 10TB 文本、6000 张 GPU、12 天、200 万美元。更重要的是,他还指出这些按当时标准都只是“rookie numbers”,前沿模型往往还要再放大一个数量级。
为什么重要: