AI 编程播客整理

按节目浏览

可以直接阅读

Andrej Karpathy

[1hr Talk] Intro to Large Language Models

讲者把大语言模型解释为“下一词预测器 + 海量参数 + 工具调用系统”:运行它并不神秘,难的是昂贵训练、后续对齐和持续评测。真正决定其上限的,不只是模型本身,还有规模化训练、多模态、工具使用,以及不断扩大的安全攻击面。

11 个关键观点

原节目
Andrej Karpathy

Let's build the GPT Tokenizer

这段内容的核心判断是:分词不是无聊的预处理,而是大模型能力、成本、稳定性与怪异行为的底层约束。很多看似“模型不聪明”的问题,实际先来自 tokenization 的表示方式。

10 个关键观点

原节目
Andrej Karpathy

Let's reproduce GPT-2 (124M)

这期内容把 GPT-2 124M 从公开权重、架构实现到多卡训练完整复现了一遍,并用现代 PyTorch 工程手段把训练效率大幅拉高。作者最终在其采用的验证损失和 HellaSwag 指标上超过公开 GPT-2 124M,但也明确保留了数据顺序、评测公平性和 torch.compile 兼容性等疑点。

11 个关键观点

原节目

更多整理内容