注册 登录 进入教材巡展
#
  • #

出版时间:2026-06-23

出版社:机械工业出版社

以下为《数据挖掘基础与案例》的配套数字资源,这些资源在您购买图书后将免费附送给您:
  • 机械工业出版社
  • 9787111810377
  • 1-1
  • 2026-06-23
  • 468
内容简介
本书共7章,重点介绍三方面的内容:数据挖掘的基础知识,包括数据挖掘的概念、标准过程模型、数据预处理、分类、关联分析、聚类分析等;数据挖掘工具,包括Python基础、NumPy工具包、Pandas工具包、Matplotlib绘图库和 Scikit-Learn工具包;数据挖掘案例,包括分类、关联分析、聚类分析三个应用主题,每个案例都系统地展示了一个数据挖掘项目的具体过程和分析细节(其中一个案例还给出了Python的实现方法与代码)。
  本书为融媒体新形态教材,从教学需求出发,为使用本书作为教材的教师提供教学课件、例题代码、习题参考答案、实验的步骤与代码等配套资源。关于本书配套数字资源:图片可手机扫码在线浏览;扫描zip文件二维码后,请复制邮箱内的文件下载链接,在新浏览器页面打开下载,避免邮箱拦截链接。
  本书可作为本科生数据挖掘课程的教材,也可作为数据挖掘爱好者和相关从业人员的参考书。
目录
目录
前言
第1章绪论1
1.1数据挖掘的概念与流程1
1.1.1数据挖掘的概念1
1.1.2数据挖掘的标准过程模型2
1.2数据挖掘的主要任务4
1.2.1分类与回归4
1.2.2聚类分析5
1.2.3关联分析5
1.2.4异常检测6
1.3数据挖掘的应用6
1.3.1数据挖掘在金融行业的应用7
1.3.2数据挖掘在电信行业的应用8
1.3.3数据挖掘在医疗行业的应用9
1.3.4推荐系统10
习题10
参考文献11
第2章数据挖掘工具12
2.1Python12
2.1.1Python基础12
2.1.2NumPy工具包25
2.1.3Pandas工具包38
2.1.4Matplotlib绘图库44
2.2Scikit-Learn工具包50
2.2.1数据集50
2.2.2k近邻分类器52
2.2.3决策树53
2.2.4朴素贝叶斯分类器54
2.2.5多层感知器55
2.2.6支持向量机55
2.2.7随机森林与AdaBoost56
2.2.8k均值聚类57
2.2.9基于密度的聚类58
2.2.10主成分分析58
习题59
实验60
参考文献60
第3章数据61
3.1数据概述61
3.1.1数据类型62
3.1.2数据质量64
3.1.3数据来源65
3.2探索数据66
3.2.1汇总统计66
3.2.2数据可视化68
3.3数据预处理74
3.3.1数据预处理任务74
3.3.2数据清洗76
3.3.3数据归约78
3.3.4数据离散化85
3.3.5数据规范化86
3.4数据对象相似性与相异性度量87
3.4.1数据矩阵与邻近度矩阵88
3.4.2标称属性的邻近度88
3.4.3二元属性的邻近度89
3.4.4数值属性的邻近度91
3.4.5序数属性的邻近度91
3.4.6混合类型属性的邻近度92
3.4.7余弦相似度和广义Jaccard系数93
习题95
实验97
参考文献98
第4章分类的概念与方法99
4.1分类的基本概念99
4.2分类的一般方法101
4.3决策树归纳102
4.3.1决策树归纳的基本原理102
4.3.2属性划分的度量 104
4.3.3树的剪枝107
4.3.4决策树归纳算法109
4.3.5由决策树提取规则117
4.3.6决策树归纳的一般特点118
4.4模型的评估与选择119
4.4.1模型的过拟合120
4.4.2模型的性能度量123
4.4.3模型评估——交叉验证法127
4.4.4模型选择127
4.5k-最近邻分类131
4.5.1k-最近邻分类原理131
4.5.2最近邻分类器的特点132
4.6朴素贝叶斯分类器132
4.6.1贝叶斯定理132
4.6.2朴素贝叶斯分类器的原理133
4.6.3朴素贝叶斯分类器的特征136
4.7Logistic回归136
4.7.1Logistic回归的基本原理136
4.7.2Logistic 回归的特点138
4.8人工神经网络139
4.8.1多层前馈神经网络139
4.8.2误差反向传播算法141
4.8.3人工神经网络的特点144
4.8.4人工神经网络与深度学习145
4.9支持向量机145
4.9.1线性可分支持向量机145
4.9.2软间隔支持向量机149
4.9.3非线性支持向量机152
4.9.4支持向量机的优缺点155
4.10集成学习方法156
4.10.1基本原理156
4.10.2随机森林158
4.11分类的典型应用160
习题161
实验163
参考文献166
第5章关联分析的概念与方法168
5.1关联分析的基本概念168
5.1.1购物篮分析168
5.1.2频繁项集和关联规则169
5.2关联分析的基本任务171
5.3关联分析方法171
5.3.1先验原理171
5.3.2Apriori算法产生频繁项集172
5.3.3Apriori算法生成关联规则179
5.4频繁项集的紧凑表示181
5.4.1极大频繁项集182
5.4.2闭频繁项集182
5.5关联模式评估183
5.5.1模式的客观兴趣度度量183
5.5.2支持度-置信度框架的局限性183
5.5.3提升度、相关度与IS度量184
5.6关联分析的典型应用186
习题187
实验188
参考文献191
第6章聚类分析的概念与方法193
6.1聚类分析的基本概念193
6.1.1聚类分析193
6.1.2聚类分析方法194
6.2k均值聚类195
6.2.1基本k均值算法196
6.2.2基本k均值算法的初始化问题201
6.2.3二分k均值算法202
6.2.4k均值的优点和缺点203
6.3凝聚的层次聚类203
6.3.1簇间邻近度204
6.3.2基本凝聚层次聚类算法及实现205
6.3.3层次聚类的优点和主要问题213
6.4DBSCAN聚类213
6.4.1DBSCAN算法的相关概念213
6.4.2DBSCAN算法及实现214
6.4.3DBSCAN算法参数选择 216
6.4.4DBSCAN算法的优缺点 216
6.5聚类评估216
6.5.1概述217
6.5.2无监督簇评估:凝聚度、分离度
与轮廓系数217
6.5.3确定簇的数目220
6.5.4聚类趋势220
6.6聚类分析的典型应用221
6.6.1环境与数据准备222
6.6.2实验步骤222
6.6.3总结与结论230
习题231
实验231
参考文献231
第7章案例分析232
7.1机票航班延误预测232
7.1.1应用背景与目标232
7.1.2数据探索与理解232
7.1.3数据预处理238
7.1.4分类模型构建与评估241
7.1.5模型的作用246
7.2零售行业购物篮分析247
7.2.1应用背景与目标247
7.2.2数据探索与理解248
7.2.3数据预处理250
7.2.4关联规则挖掘与评估251
7.2.5规则解释255
7.3航空公司客户价值分析255
7.3.1应用背景与目标255
7.3.2数据探索与理解256
7.3.3数据预处理260
7.3.4聚类模型构建与评估262
7.3.5模型解释与应用264