大模型数据:原理、技术与实战 / 通用智能与大模型丛书
定价:¥79.00
作者: 何聪辉
出版时间:2026-06
出版社:电子工业出版社
- 电子工业出版社
- 9787121523748
- 1-4
- 16开
- 2026-06
- 320
- 工学
- 计算机类
- 计算机科学与技术
- 本科 研究生及以上
内容简介
本书系统构建了大模型数据科学的理论框架与工程实践体系,在编写时特别注重技术深度与落地应用的结合。本书主体详细介绍了大模型数据的全生命周期管理,涵盖数据采集与获取、精细化清洗与结构化解析、专业标注体系等基础工程;重点深入剖析了数据合成与增强(包括通用、代码、全模态合成)、多维度数据质量评估等核心技术;并探讨了数据合规监管、版权保护及安全隐私等前沿议题。另外,书中包含了一个基于PDF数据的垂类模型微调实战案例,帮助读者打通从数据处理到模型应用的完整链路。
目录
第1章 大模型数据概览
1.1 数据驱动的大模型演进简史
1.1.1 大模型进化路线
1.1.2 数据的重要性变迁
1.2 大模型数据的生命周期
1.2.1 生命周期总览
1.2.2 生命周期的三大阶段
1.3 大模型数据的四大关键维度
1.3.1 知识广度
1.3.2 智能精度
1.3.3 泛化能力
1.3.4 新知洞察
1.4 大模型数据生态系统简述
1.4.1 开源数据集生态
1.4.2 工具与平台链路
1.4.3 数据治理与伦理边界
第2章 大模型训练所需数据来源
2.1 典型的数据来源
2.1.1 大模型训练所需核心数据的类型
2.1.2 网络爬取与社交媒体收集
2.1.3 数据共享平台与协作机制
2.1.4 数据来源挑战与演变
2.2 典型的公开数据集
2.2.1 预训练数据集:通用知识构建
2.2.2 微调数据集:任务与领域适配
2.2.3 对齐强化数据集:对齐与价值塑造
2.3 数据获取方式
2.3.1 公共渠道采集
2.3.2 众包采集
2.3.3 智能体式采集
2.3.4 模型与仿真生成
第3章 数据标注与清洗
3.1 从原始数据到高质量语料
3.2 数据清洗:剔除噪声与冗余
3.2.1 数据过滤
3.2.2 数据去重
3.3 数据解析:从原始信息中恢复结构与语义
3.3.1 结构化、半结构化与非结构化数据解析
3.3.2 代表性OCR工具
3.4 数据标注:从任务建模到质量保障
3.4.1 数据标注方式与策略体系
3.4.2 数据标注任务分类与体系
3.4.3 数据标注质量保障机制
3.5 小试牛刀
3.5.1 数据解析
3.5.2 数据清洗
3.5.3 数据重写与增强
第4章 数据合成与增强
4.1 数据合成与增强的整体框架
4.2 数据合成方法
4.2.1 数据合成方法概述
4.2.2 领域数据合成
4.2.3 多模态数据合成
4.2.4 全模态数据合成
4.2.5 代表性数据合成工具
4.3 数据增强技术
4.3.1 传统数据增强方法
4.3.2 大模型时代的数据增强
4.4 数据合成与增强的挑战和风险
4.4.1 数据偏见与幻觉
4.4.2 模型坍缩
4.4.3 数据隐私与安全
第5章 数据质量评估
5.1 数据质量评估体系
5.1.1 大模型时代数据质量评估的重要性
5.1.2 数据质量的多维框架
5.1.3 数据评估方法的分类
5.2 面向特定指标的评估
5.2.1 数据纯净度与品质评估
5.2.2 数据多样性评估
5.2.3 数据安全性与偏见评估
5.3 基于模型的评估
5.3.1 基于学习难度的筛选
5.3.2 指令进化与复杂性评估
5.3.3 基于模型偏好的质量排序
5.3.4 模型评估方法对比与选择
5.4 人工辅助的数据质量评估
5.4.1 人工评估的不可或缺性
5.4.2 人工评估的方法与流程
5.4.3 人工评估在大模型时代的核心角色
5.5 数据价值验证平台—— OpenDataArena
5.6 数据价值量化方法
第6章 数据前沿趋势展望
6.1 全球大模型数据合规监管趋势与挑战
6.1.1 数据合规监管的背景与现状
6.1.2 全球数据合规监管的主要趋势与实践
6.1.3 数据合规监管面临的挑战
6.2 大模型训练数据的版权争议与合规方案
6.2.1 数据版权争议焦点
6.2.2 数据版权典型案例
6.2.3 数据版权合规与技术解决方案
6.3 大模型数据安全与隐私保护
6.3.1 数据脱敏与匿名化技术
6.3.2 数据隐私攻击与防御机制
6.3.3 综合性隐私保护趋势与实践
6.4 数据与AI的协同发展关系
6.4.1 高质量数据加速垂类AI应用落地
6.4.2 AI 应用促进数据飞轮反哺AI发展
第7章 案例实操——基于PDF数据的垂类模型能力提升
7.1 案例概述
7.1.1 微调垂类模型时,数据层面的常见问题
7.1.2 从PDF到训练数据:整体处理思路
7.2 数据解析:从PDF中稳定提取结构化内容
7.2.1 解析任务与输出形式
7.2.2 文档结构解析
7.2.3 基于布局的内容精修
7.2.4 批处理调度与解析流程
7.2.5 解析结果与后续数据构建
7.3 数据治理:将解析结果转化为可训练样本
7.3.1 数据对齐
7.3.2 数据合成与增强
7.3.3 数据处理
7.3.4 可视化流水线编排与调试
7.4 数据质量评估:判断自动构建数据是否“真的可用”
7.4.1 基于大模型的质量评估方法
7.4.2 质量评估伪代码示例
7.5 微调垂类模型
7.5.1 微调:LLaMA-Factory
7.5.2 动态训练:DataFlex
参考文献
1.1 数据驱动的大模型演进简史
1.1.1 大模型进化路线
1.1.2 数据的重要性变迁
1.2 大模型数据的生命周期
1.2.1 生命周期总览
1.2.2 生命周期的三大阶段
1.3 大模型数据的四大关键维度
1.3.1 知识广度
1.3.2 智能精度
1.3.3 泛化能力
1.3.4 新知洞察
1.4 大模型数据生态系统简述
1.4.1 开源数据集生态
1.4.2 工具与平台链路
1.4.3 数据治理与伦理边界
第2章 大模型训练所需数据来源
2.1 典型的数据来源
2.1.1 大模型训练所需核心数据的类型
2.1.2 网络爬取与社交媒体收集
2.1.3 数据共享平台与协作机制
2.1.4 数据来源挑战与演变
2.2 典型的公开数据集
2.2.1 预训练数据集:通用知识构建
2.2.2 微调数据集:任务与领域适配
2.2.3 对齐强化数据集:对齐与价值塑造
2.3 数据获取方式
2.3.1 公共渠道采集
2.3.2 众包采集
2.3.3 智能体式采集
2.3.4 模型与仿真生成
第3章 数据标注与清洗
3.1 从原始数据到高质量语料
3.2 数据清洗:剔除噪声与冗余
3.2.1 数据过滤
3.2.2 数据去重
3.3 数据解析:从原始信息中恢复结构与语义
3.3.1 结构化、半结构化与非结构化数据解析
3.3.2 代表性OCR工具
3.4 数据标注:从任务建模到质量保障
3.4.1 数据标注方式与策略体系
3.4.2 数据标注任务分类与体系
3.4.3 数据标注质量保障机制
3.5 小试牛刀
3.5.1 数据解析
3.5.2 数据清洗
3.5.3 数据重写与增强
第4章 数据合成与增强
4.1 数据合成与增强的整体框架
4.2 数据合成方法
4.2.1 数据合成方法概述
4.2.2 领域数据合成
4.2.3 多模态数据合成
4.2.4 全模态数据合成
4.2.5 代表性数据合成工具
4.3 数据增强技术
4.3.1 传统数据增强方法
4.3.2 大模型时代的数据增强
4.4 数据合成与增强的挑战和风险
4.4.1 数据偏见与幻觉
4.4.2 模型坍缩
4.4.3 数据隐私与安全
第5章 数据质量评估
5.1 数据质量评估体系
5.1.1 大模型时代数据质量评估的重要性
5.1.2 数据质量的多维框架
5.1.3 数据评估方法的分类
5.2 面向特定指标的评估
5.2.1 数据纯净度与品质评估
5.2.2 数据多样性评估
5.2.3 数据安全性与偏见评估
5.3 基于模型的评估
5.3.1 基于学习难度的筛选
5.3.2 指令进化与复杂性评估
5.3.3 基于模型偏好的质量排序
5.3.4 模型评估方法对比与选择
5.4 人工辅助的数据质量评估
5.4.1 人工评估的不可或缺性
5.4.2 人工评估的方法与流程
5.4.3 人工评估在大模型时代的核心角色
5.5 数据价值验证平台—— OpenDataArena
5.6 数据价值量化方法
第6章 数据前沿趋势展望
6.1 全球大模型数据合规监管趋势与挑战
6.1.1 数据合规监管的背景与现状
6.1.2 全球数据合规监管的主要趋势与实践
6.1.3 数据合规监管面临的挑战
6.2 大模型训练数据的版权争议与合规方案
6.2.1 数据版权争议焦点
6.2.2 数据版权典型案例
6.2.3 数据版权合规与技术解决方案
6.3 大模型数据安全与隐私保护
6.3.1 数据脱敏与匿名化技术
6.3.2 数据隐私攻击与防御机制
6.3.3 综合性隐私保护趋势与实践
6.4 数据与AI的协同发展关系
6.4.1 高质量数据加速垂类AI应用落地
6.4.2 AI 应用促进数据飞轮反哺AI发展
第7章 案例实操——基于PDF数据的垂类模型能力提升
7.1 案例概述
7.1.1 微调垂类模型时,数据层面的常见问题
7.1.2 从PDF到训练数据:整体处理思路
7.2 数据解析:从PDF中稳定提取结构化内容
7.2.1 解析任务与输出形式
7.2.2 文档结构解析
7.2.3 基于布局的内容精修
7.2.4 批处理调度与解析流程
7.2.5 解析结果与后续数据构建
7.3 数据治理:将解析结果转化为可训练样本
7.3.1 数据对齐
7.3.2 数据合成与增强
7.3.3 数据处理
7.3.4 可视化流水线编排与调试
7.4 数据质量评估:判断自动构建数据是否“真的可用”
7.4.1 基于大模型的质量评估方法
7.4.2 质量评估伪代码示例
7.5 微调垂类模型
7.5.1 微调:LLaMA-Factory
7.5.2 动态训练:DataFlex
参考文献















