注册 登录 进入教材巡展
#
  • #

出版时间:2026-08-17

出版社:机械工业出版社

以下为《剖析大语言模型》的配套数字资源,这些资源在您购买图书后将免费附送给您:
  • 机械工业出版社
  • 9787111813033
  • 1-1
  • 2026-08-17
  • 283
内容简介
本书是大语言模型的入门书籍,共分为7章,内容由浅入深、逻辑清晰。开篇从大语言模型的基本定义、发展脉络与技术演进讲起,细致拆解Transformer核心架构;随后依次讲解自监督预训练原理、模型高效微调技术、检索增强生成(RAG)框架,以及高质量数据体系构建方法;最后梳理当前主流开源大模型,详解多个实战项目,为读者搭建起清晰的大语言模型学习路径。
目录
目 录

前言
主要符号表

第 1 章 绪论          1
1.1 大模型的定义        1
1.1.1 大模型的核心特征        2
1.1.2 大模型与深度学习的关系       3
1.2 大模型的发展历程以及里程碑      5
1.2.1 大模型的发展历程        5
1.2.2 大模型的里程碑        8
1.2.3 重要组织及团队        11
1.3 大模型的应用场景        13
1.4 大模型的研究问题        15
1.5 大模型的未来挑战        18
1.6 小结         22
练习            22

第 2 章 大模型技术的基石        24
2.1 Transformer 架构        25
2.1.1 位置编码         25
2.1.2 注意力机制         28
2.1.3 前馈网络         34
2.1.4 残差连接与归一化        35
2.2 基于 Transformer 的经典大模型及其架构     35
2.2.1 编码器架构         36
2.2.2 解码器架构         40
2.2.3 编码器–解码器架构       42
2.3 不同架构的优缺点以及适用场景分析     44
2.4 分布式训练与并行计算技术       47 2.4.1 大模型训练的挑战        47
2.4.2 数据并行训练        48
2.4.3 流水线并行训练        52
2.4.4 张量并行训练        54
2.5 小结         56
练习            56

第 3 章 大模型核心技术         58
3.1 从自监督到大模型预训练       58
3.2 预训练任务          60
3.2.1 自回归         60
3.2.2 自编码与去噪        62
3.2.3 对比学习         64
3.3 对齐策略优化与模型训练       66
3.3.1 人类反馈强化学习        66
3.3.2 混合训练策略        71
3.4 模型压缩与效率提升       73
3.4.1 剪枝        73
3.4.2 模型量化         75
3.4.3 知识蒸馏         76
3.5 提示词工程          78
3.5.1 基础提示优化        78
3.5.2 人工提示优化        78
3.5.3 自动提示优化        81
3.5.4 思维链         83
3.6 小结         85
练习            85

第 4 章 大模型微调技术         88
4.1 微调技术概述         88
4.1.1 为什么要微调        88
4.1.2 微调技术分类        88
4.1.3 高效参数微调的通用架构       91
4.2 前缀微调          92 4.2.1 原理与方法         93
4.2.2 实现细节         93
4.2.3 前缀向量的优化方法       95
4.3 提示词微调          96
4.3.1 硬提示         97
4.3.2 软提示         98
4.3.3 典型变体         99
4.3.4 实现技术细节        102
4.4 适配器微调        103
4.4.1 原理与方法        103
4.4.2 经典变体         105
4.5 LoRA 微调         109
4.5.1 原理与方法        109
4.5.2 经典变体         110
4.5.3 实现技术细节        115
4.6 微调技术比较         117
4.7 小结          118
练习          119

第 5 章 大模型检索增强生成        121
5.1 为什么需要 RAG        121
5.2 RAG 架构与工作原理        123
5.2.1 检索器         124
5.2.2 生成器         125
5.2.3 RAG 的架构类型        126
5.3 RAG 中的数据准备与索引机制      127
5.3.1 数据准备:统一文档对象的构建     127
5.3.2 文本分块:让长文变得“可消化”     128
5.3.3 向量存储与高效索引:让大模型有“记忆力”   130
5.4 检索器系统优化技术       132
5.4.1 查询转换         132
5.4.2 重排序         134
5.4.3 递归检索         135 5.4.4 混合检索         136
5.4.5 检索器微调        137
5.5 生成器系统增强机制       138
5.5.1 提示工程         139
5.5.2 解码调优         139
5.5.3 生成器微调        142
5.6 小结          143
练习          144

第 6 章 大模型的训练数据和评估       146
6.1 大模型与数据质量        146
6.1.1 为什么需要高质量数据       146
6.1.2 数据质量对大模型的影响      147
6.2 训练数据收集与预处理       149
6.2.1 数据收集         149
6.2.2 数据预处理        151
6.2.3 数据标注         165
6.3 基准测试数据集介绍       169
6.3.1 通用能力评估基准       170
6.3.2 领域专项评估基准       171
6.3.3 伦理安全评估基准       172
6.3.4 新兴任务评估基准       173
6.4 大模型带来的数据隐私与安全问题      173
6.4.1 大模型数据隐私问题       174
6.4.2 大模型安全问题        176
6.5 小结          178
练习          178

第 7 章 大模型部署         181
7.1 使用开源大模型进行开发       181
7.2 主流开源大模型介绍       183
7.2.1 Meta Llama 系列       183
7.2.2 OpenAI Community GPT-2     187
7.2.3 Google Gemma 系列       188 7.2.4 Alibaba Qwen 系列      190
7.2.5 DeepSeek 系列        193
7.2.6 总结         195
7.3 Hugging Face 介绍        197
7.3.1 什么是 Hugging Face       197
7.3.2 Hugging Face 的核心功能      198
7.3.3 Hugging Face 的使用方法      198
7.3.4 实例:使用 Transformers 进行情感分析    200
7.3.5 运行环境与输出示例       203
7.4 基于开源大模型的构建       204
7.4.1 选择合适的开源模型       204
7.4.2 在本地部署 Qwen2-0.5B-Instruct 模型   205
7.4.3 构建 Web 界面        208
7.4.4 运行和测试        210
7.5 参数高效微调实战        211
7.5.1 LoRA 概述        211
7.5.2 实验背景与目标        212
7.5.3 实验准备         212
7.5.4 实验实现         213
7.5.5 实验结果与分析        217
7.6 检索增强生成实战        218
7.6.1 检索增强生成概述       218
7.6.2 实验背景与目标        218
7.6.3 实验准备         219
7.6.4 实验实现         220
7.6.5 测试结果         224
7.7 小结          226
练习          227

参考文献          230