注册 登录 进入教材巡展
#
  • #

出版时间:2025-11-19

出版社:机械工业出版社

以下为《机器学习基础:面向预测数据分析的算法、实用范例与案例研究(原书第2版)》的配套数字资源,这些资源在您购买图书后将免费附送给您:
  • 机械工业出版社
  • 9787111791638
  • 1-1
  • 2025-11-19
  • 900
内容简介
本书重点讲述用于预测性数据分析的重要的机器学习方法,包括理论概念和实际应用。
目录
目 录
译者序
前言
符号
第一部分 机器学习和数据分析导论
第1章 面向预测数据分析的机器
 学习2
1.1 什么是预测数据分析2
1.2 什么是机器学习3
1.3 机器学习是如何工作的6
1.4 归纳偏差与采样偏差9
1.5 机器学习可能出现什么问题10
1.6 预测数据分析项目的生命周期:
 CRISP-DM11
1.7 预测数据分析工具12
1.8 未来之路13
1.9 习题14
第2章 从数据到见解再到决策16
2.1 将业务问题转化为分析解决方案16
2.1.1 案例研究:汽车保险欺诈17
2.2 评估可行性18
2.2.1 案例研究:汽车保险欺诈19
2.3 设计分析基础表19
2.3.1 案例研究:汽车保险欺诈21
2.4 设计和实现特征22
2.4.1 不同类型的数据23
2.4.2 不同类型的特征24
2.4.3 处理时间25
2.4.4 法律问题28
2.4.5 实现特征28
2.4.6 案例研究:汽车保险欺诈29
2.5 总结31
2.6 延伸阅读32
2.7 习题33
第3章 数据探索36
3.1 数据质量报告37
3.1.1 案例研究:汽车保险欺诈37
3.2 了解数据40
3.2.1 正态分布42
3.2.2 案例研究:汽车保险欺诈43
3.3 辨识数据质量问题44
3.3.1 缺失值44
3.3.2 不规则基数45
3.3.3 异常值45
3.3.4 案例研究:汽车保险欺诈46
3.4 处理数据质量问题47
3.4.1 处理缺失值48
3.4.2 处理异常值48
3.4.3 案例研究:汽车保险欺诈49
3.5 高级数据探索50
3.5.1 可视化特征之间的关系50
3.5.2 度量协方差和相关性57
3.6 数据准备61
3.6.1 标准化61
3.6.2 分箱62
3.6.3 采样65
3.7 总结66
3.8 延伸阅读67
3.9 习题67
第二部分 预测数据分析
第4章 基于信息的学习82
4.1 主要思想82
4.2 基础知识84
4.2.1 决策树85
4.2.2 香农熵模型86
4.2.3 信息增益89
4.3 标准方法:ID3算法93
4.3.1 实用范例:植被分布预测95
4.4 扩展和变体100
4.4.1 其他特征选择和不纯净度
 度量100
4.4.2 处理连续型描述性特征103
4.4.3 预测连续型目标106
4.4.4 树剪枝108
4.4.5 模型集成111
4.5 总结119
4.6 延伸阅读120
4.7 习题121
第5章 基于相似性的学习127
5.1 主要思想127
5.2 基础知识128
5.2.1 特征空间128
5.2.2 使用距离度量来衡量
 相似性129
5.3 标准方法:最近邻算法131
5.3.1 实用范例131
5.4 扩展和变体134
5.4.1 处理噪声数据134
5.4.2 高效的内存搜索137
5.4.3 数据标准化143
5.4.4 预测连续型目标146
5.4.5 其他相似性度量149
5.4.6 特征选择156
5.5 总结161
5.6 延伸阅读163
5.7 后记164
5.8 习题164
第6章 基于概率的学习170
6.1 主要思想170
6.2 基础知识171
6.2.1 贝叶斯定理173
6.2.2 贝叶斯预测175
6.2.3 条件独立性和因子分解179
6.3 标准方法:朴素贝叶斯模型182
6.3.1 实用范例183
6.4 扩展和变体185
6.4.1 平滑处理186
6.4.2 连续型特征:概率密度
 函数188
6.4.3 连续型特征:分箱196
6.4.4 贝叶斯网络199
6.5 总结210
6.6 延伸阅读212
6.7 习题212
第7章 基于误差的学习217
7.1 主要思想217
7.2 基础知识218
7.2.1 简单的线性回归218
7.2.2 测量误差220
7.2.3 误差曲面222
7.3 标准方法:使用梯度下降的
 多变量线性回归223
7.3.1 多变量线性回归223
7.3.2 梯度下降224
7.3.3 选择学习率和初始权重229
7.3.4 实用范例230
7.4 扩展和变体232
7.4.1 解释多变量线性回归模型232
7.4.2 使用权重衰减设置学习率234
7.4.3 处理类别型描述性特征235
7.4.4 处理类别型目标特征:
 logistic回归236
7.4.5 建模非线性关系246
7.4.6 多项式logistic回归250
7.4.7 支持向量机253
7.5 总结257
7.6 延伸阅读259
7.7 习题259
第8章 深度学习267
8.1 主要思想268
8.2 基础知识269
8.2.1 人工神经元269
8.2.2 人工神经网络272
8.2.3 神经网络的矩阵运算273
8.2.4 为什么非线性激活函数
   是必要的276
8.2.5 为什么网络深度很重要277
8.3 标准方法:反向传播和梯度
  下降282
8.3.1 反向传播:算法的
   一般结构283
8.3.2 反向传播:误差梯度的
   反向传播284
8.3.3 反向传播:更新网络中
   的权重288
8.3.4 反向传播:算法291
8.3.5 实用范例:使用反向
   传播训练前馈网络完成
   回归任务293
8.4 扩展和变体303
8.4.1 梯度消失和ReLU304
8.4.2 权重初始化和不稳定
   梯度313
8.4.3 处理类别型目标特征:
   softmax输出层和交叉
   熵损失函数321
8.4.4 早停法和随机失活:
   防止过拟合328
8.4.5 卷积神经网络332
8.4.6 序列模型:循环神经网
   络和长短时记忆网络347
8.5 总结361
8.6 延伸阅读362
8.7 习题363
第9章 评估368
9.1 主要思想368
9.2 基础知识 369
9.3 标准方法:留出测试集上的
   误分类率369
9.4 扩展和变体373
9.4.1 设计评估实验373
9.4.2 性能度量:类别型目标
    特征378
9.4.3 性能度量:预测分数384
9.4.4 性能度量:多目标特征396
9.4.5 性能度量:连续型目标
      特征399
9.4.6 部署后评估模型402
9.5 总结407
9.6 延伸阅读407
9.7 习题408
第三部分 预测模型之外
第10章 预测模型之外:
     无监督学习416
10.1 主要思想416
10.2 基础知识417
10.3 标准方法:k-means聚类算法418
10.3.1 实用范例419
10.4 扩展和变体422
10.4.1 选择初始簇质心422
10.4.2 评估聚类424
10.4.3 选择簇的数量428
10.4.4 理解聚类结果428
10.4.5 凝聚层次聚类430
10.4.6 使用自编码器进行表示
       学习438
10.5 总结441
10.6 延伸阅读442
10.7 习题442
第11章 预测模型之外:强化学习448
11.1 主要思想448
11.2 基础知识449
11.2.1 智能代理449
11.2.2 强化学习的基础450
11.2.3 马尔可夫决策过程452
11.2.4 贝尔曼方程458
11.2.5 时序差分学习459
11.3 标准方法:Q学习,离线策略
   时序差分学习462
11.3.1 实用范例463
11.4 扩展和变体467
11.4.1 SARSA在线策略时序
    差分学习467
11.4.2 深度Q网络470
11.5 总结475
11.6 延伸阅读476
11.7 习题477
第四部分 案例研究和结论
第12章 案例研究:客户流失482
12.1 业务理解482
12.2 数据理解484
12.3 数据准备487
12.4 建模491
12.5 评估492
12.6 部署495
第13章 案例研究:星系分类496
13.1 业务理解496
13.1.1 情景流畅性498
13.2 数据理解499
13.3 数据准备504
13.4 建模507
13.4.1 基线模型508
13.4.2 特征选择510
13.4.3 五级别模型511
13.5 评估513
13.6 部署513
第14章 预测数据分析的机器
     学习艺术515
14.1 预测模型的不同视角516
14.2 选择机器学习方法519
14.2.1 将机器学习方法与项目
     匹配520
14.2.2 将机器学习方法与数据
    匹配522
14.3 预测模型之外523
14.4 下一步学习资料推荐523
第五部分 附录
附录A 机器学习的描述性统
    计量和数据可视化526
附录B 机器学习的概率入门536
附录C 机器学习的微分技术543
附录D 线性代数入门547
参考文献550