目 录
第1章 宏观视角:什么是大语言模型 1
1.1 生成式AI的定位 2
1.2 本书能带给你什么 5
1.3 LLM工作原理初探 7
1.4 到底什么是智能 9
1.5 人类与机器表征语言的方式有何不同 10
1.6 GPT及其同类模型 12
1.7 LLM为何表现如此出色 13
1.8 LLM实战:优势、缺陷与隐患 15
本章小结 16
第2章 分词器:LLM如何“看见”世界 19
2.1 词元:文本的数值表征形式 20
2.2 语言模型只能“看见”词元 21
2.2.1 分词的基本流程 23
2.2.2 分词过程中的词汇量控制 25
2.2.3 分词原理详解 27
2.2.4 分词的潜在风险 31
2.3 分词与LLM的能力边界 33
2.3.1 LLM不擅长文字游戏 34
2.3.2 LLM在数学任务上表现不佳 35
2.3.3 LLM与语言公平性问题 36
2.4 自测小练习 37
2.5 分词的整体定位 38
本章小结 38
第3章 Transformer:从输入到输出 41
3.1 Transformer模型 42
3.2 Transformer架构深度解析 46
3.2.1 嵌入层 47
3.2.2 Transformer层 53
3.2.3 反嵌入层 56
3.3 创造性与主题相关性的权衡 60
3.4 Transformer的整体定位 61
本章小结 62
第4章 LLM如何学习 65
4.1 梯度下降 66
4.1.1 损失函数的定义 67
4.1.2 什么是梯度下降 70
4.2 LLM如何模仿人类文本 74
4.3 LLM与新颖任务 79
4.3.1 任务识别失败问题 82
4.3.2 LLM缺乏规划能力 83
4.4 若LLM外推能力有限,还能使用它们吗 84
4.5 模型越大越好吗 86
本章小结 87
第5章 如何约束LLM的行为 89
5.1 约束LLM行为的核心动因 91
5.1.1 基础模型的实用性局限 93
5.1.2 模型的部分输出结果不合预期 93
5.1.3 特定场景对输出格式有严格要求 95
5.2 微调:改变LLM行为的核心方法 95
5.2.1 有监督微调 96
5.2.2 基于人类反馈的强化学习 98
5.2.3 微调技术全景 101
5.3 RLHF的工作机制 101
5.3.1 朴素版RLHF的初步探索 101
5.3.2 质量奖励模型 103
5.3.3 平衡质量与相似性的RLHF目标 104
5.4 定制LLM行为的其他关键因素 105
5.4.1 调整训练数据 106
5.4.2 优化基础模型训练流程 107
5.4.3 调整输出结果 108
5.5 将LLM集成至复杂工作流 109
5.5.1 基于检索增强生成的LLM定制 109
5.5.2 通用LLM编程 112
本章小结 114
第6章 超越自然语言处理 117
6.1 用于软件开发的LLM 119
6.1.1 改进LLM以适配代码任务 122
6.1.2 验证LLM生成的代码 123
6.1.3 通过格式化优化代码 124
6.2 面向形式化数学的LLM 126
6.2.1 输入预处理的挑战 127
6.2.2 数字理解的优化 128
6.2.3 数学领域的LLM也会使用工具 131
6.3 Transformer与计算机视觉 133
6.3.1 图像与补丁的相互转换 134
6.3.2 结合图像与文本的多模态模型 137
6.3.3 既往知识的适用性 138
本章小结 140
第7章 LLM的常见误解、能力局限与卓越优势 141
7.1 人类与LLM学习速度的对比 142
7.1.1 自我改进的局限性 146
7.1.2 少样本学习 150
7.2 工作效率对比:10瓦的人类大脑与2000瓦的计算机 151
7.2.1 能源消耗 152
7.2.2 延迟、可扩展性与可用性 153
7.2.3 优化改进 153
7.3 语言模型并非世界模型 154
7.4 计算局限性:难题依旧难解 157
7.4.1 用“模糊算法”解决“模糊问题” 161
7.4.2 对于难题,有时近似解就已足够 162
本章小结 163
第8章 基于LLM设计解决方案 165
8.1 直接开发一个聊天机器人 166
8.2 自动化偏见 169
8.2.1 调整流程 171
8.2.2 当LLM自主运行风险过高时 172
8.3 结合多种工具降低风险 174
8.3.1 LLM嵌入向量与其他工具的结合 174
8.3.2 基于嵌入向量的解决方案设计 177
8.4 技术呈现方式至关重要 179
8.4.1 如何实现透明度 181
8.4.2 与用户利益对齐 181
8.4.3 建立反馈循环 182
本章小结 183
第9章 构建与使用LLM的伦理问题 185
9.1 为何要构建LLM 186
9.1.1 LLM“无所不能”的利弊 187
9.1.2 要将人类所有工作都自动化吗 189
9.2 LLM是否构成生存性风险 193
9.2.1 自我改进与迭代式S曲线 196
9.2.2 对齐问题 197
9.3 数据获取与复用的伦理问题 200
9.3.1 什么是合理使用 201
9.3.2 向内容创作者支付报酬面临的挑战 203
9.3.3 公共领域数据的局限性 204
9.4 LLM输出内容的伦理担忧 205
9.4.1 LLM输出内容的许可协议影响 206
9.4.2 LLM的输出内容是否会毒化数据源 208
9.5 LLM伦理的其他探索方向 211
本章小结 212
