
《从零开始构建智能体》第三章 大语言模型基础-读书笔记
下面这张图梳理了从 N-gram 到现代 大语言模型 (LLM) 的核心发展路径,重点突出了每个阶段要解决的关键问题。

这个演进过程,可以看作是一场不断突破瓶颈的“闯关游戏”:
1. 第一关 (统计模型):用“计数”解决了语言建模的可行性问题,但困在了 “死记硬背” 的层面。
2. 第二关 (神经网络模型):用 “词嵌入” 赋予了模型理解语义的能力,迈出了从“记忆”到“理解”的关键一步,但计算效率成了新瓶颈。
3. 第三关 (Transformer):用 “自注意力” 机制彻底推翻了循环结构的束缚,同时解决了 “并行计算” 和 “长距离依赖” 两大难题,为大规模训练扫清了道路。
4. 终局 (Decoder-Only LLM):在Transformer基础上,“预测下一个词” 这一统一而简洁的训练目标,配合海量数据与算力,最终催生了具有 “涌现能力” 的现代大语言模型。