内容摘要
这段讲解把大语言模型拆成三段:预训练学互联网文本分布,监督微调学如何像助手那样回答,强化学习学更强的推理策略。它很强,但本质仍是按 token 概率续写的系统,最好把它当会用检索和代码工具的高效助手,而不是无条件可信的权威。
关键观点
LLM 是三段式训练流水线
讲者把大模型拆成预训练、后训练/监督微调、强化学习三段,而不是一个神秘整体。第一段从互联网文本中学习统计规律,产出只会续写文本的 base model。第二段把数据换成对话,让模型模仿“有帮助、真实、无害”的助手。第三段再用可验证任务反复试错,让模型自己发现更适合它的推理路径。
为什么重要: 这能直接解释为什么不同模型看起来像在做不同的事:有的像聊天助手,有的像会慢慢思考的解题器。
支撑证据
there's going to be multiple stages arranged sequentially
预训练本质是压缩互联网文本
预训练的第一步被直白地描述为“下载并处理互联网”。数据并非整网照单全收,而是经过 URL 过滤、正文抽取、语言筛选、去重和 PII 清理。讲者用 FineWeb 举例:原始互联网极其庞杂,但真正进入训练的数据会被压缩成高质量、高多样性的文本集合。模型随后通过海量“下一个 token 预测”把这些分布压进参数里,因此它记住的更像统计结构而不是可精确索引的事实库。
为什么重要: 理解这一点,就能明白模型为什么对高频公共知识更稳,对冷门和长尾事实更飘。