- 科学出版社
- 9787030707819
- 1版
- 2022-08
- 理学
- 统计学类
- 财经商贸大类
- 统计类
- 统计学
- 本科
内容简介
本书通过大量的实例,循序渐进、全面系统地讲解了
语言的基础知识,以及运用
命令解决数据分析和处理中的技巧和方法。
本书分为4部分,共17章。第1部分为
语言基础知识,旨在让读者熟练掌握工具的使用方法与语法规则,为后续的数据处理打好基础。这部分的主要内容包括
软件的下载与安装、数据管理元素的创建和使用、数据包的安装与加载、流程控制。第2部分为
绘图,数据可视化有助于用户对数据快速做出判断。这部分介绍
基础绘图和高级绘图两种方法,运用实例讲解常用图形的绘制方法,包括散点图、折线图、条形图、直方图、密度图、箱线图等基本图形,还包括热图、词云图、韦恩图、小提琴图等高级图形。第3部分为统计分析,主要内容包括统计描述、假设检验、回归分析、主成分分析和因子分析、生存分析。第4部分为数据分析与预测,介绍数据预处理的常用解决方法及几个主要的机器学习算法。
本书适用于统计分析和数据可视化的初学者,既可作为从事数据分析和数据管理工作人员的参考用书,也可作为理工、生物等专业学生的教材或参考书。
语言的基础知识,以及运用
命令解决数据分析和处理中的技巧和方法。
本书分为4部分,共17章。第1部分为
语言基础知识,旨在让读者熟练掌握工具的使用方法与语法规则,为后续的数据处理打好基础。这部分的主要内容包括
软件的下载与安装、数据管理元素的创建和使用、数据包的安装与加载、流程控制。第2部分为
绘图,数据可视化有助于用户对数据快速做出判断。这部分介绍
基础绘图和高级绘图两种方法,运用实例讲解常用图形的绘制方法,包括散点图、折线图、条形图、直方图、密度图、箱线图等基本图形,还包括热图、词云图、韦恩图、小提琴图等高级图形。第3部分为统计分析,主要内容包括统计描述、假设检验、回归分析、主成分分析和因子分析、生存分析。第4部分为数据分析与预测,介绍数据预处理的常用解决方法及几个主要的机器学习算法。
本书适用于统计分析和数据可视化的初学者,既可作为从事数据分析和数据管理工作人员的参考用书,也可作为理工、生物等专业学生的教材或参考书。
目录
第1部分
语言基础知识
第1章
概述 3
1.1
软件的下载与安装 4
1.2 获得帮助 7
1.3
包 7
1.3.1 本地库中的
包 7
1.3.2 安装
包 8
1.3.3 加载
包 11
1.3.4 维护
包 12
第2章 数据管理 13
2.1 数据对象的创建与删除 13
2.2 对象的类型与运算符 15
2.3 数据结构 17
2.3.1 向量 18
2.3.2 矩阵和数组 26
2.3.3 时间序列 31
2.3.4 因子 33
2.3.5 列表 35
2.3.6 数据框 39
2.4 读写文件数据 44
2.4.1 工作路径 44
2.4.2 内置数据集 44
2.4.3 读写文本文件 45
第3章 流程控制 47
3.1 分支语句 47
3.1.1 if-else语句 47
3.1.2 switch语句 48
3.2 循环语句 49
3.2.1
epeat循环语句 49
3.2.2 while循环语句 51
3.2.3 fo
循环语句 52
3.2.4
eplication高级循环 54
3.3 自定义函数 54
3.4 程序运行时间与效率 58
第2部分
绘 图
第4章 基础绘图 61
4.1 图形参数 61
4.1.1 设置颜色 61
4.1.2 选择颜色组合和调色板 64
4.1.3 设置绘图符号及大小 68
4.1.4 选择线型和线宽 70
4.1.5 设置坐标轴 70
4.1.6 设置图例 75
4.2 绘制图形 76
4.2.1 散点图 76
4.2.2 折线图 78
4.2.3 条形图 79
4.2.4 直方图和密度图 81
4.2.5 箱线图 83
4.2.6 热图 85
4.2.7 散点图矩阵 86
4.2.8 词云图 87
4.2.9 韦恩图 88
4.2.10 生存函数图 92
4.2.11 函数图像 93
4.2.12 小提琴图 94
4.2.13 三维图形 95
4.3 保存和输出图形 100
第5章 高级绘图 102
5.1 qplot绘图 102
5.2 ggplot2绘图 114
5.2.1 图层构建图像 114
5.2.2 几何对象和统计变换 118
5.3 绘制图形 121
5.3.1 直方图 121
5.3.2 密度曲线图 124
5.3.3 箱线图 127
5.3.4 小提琴图 130
5.3.5 火山图 133
5.3.6 富集分析气泡图 135
5.3.7 等高图
等高线 137
第3部分 统 计 分 析
第6章 统计描述 145
6.1 描述统计量 145
6.1.1 集中趋势 145
6.1.2 离散趋势 150
6.1.3 分布形状的度量 152
6.2 数据常用分布、随机抽样及正态性检验 153
6.2.1 数据常用分布 153
6.2.2 随机抽样 160
6.2.3 正态性检验 165
6.3 多元数据分布 168
6.3.1 二元变量数据分析 168
6.3.2 多元变量数据分析 170
6.3.3 探索数据分布 171
6.4 参数估计 173
6.4.1 极大似然估计 173
6.4.2 最小二乘法 176
6.4.3 EM算法 177
第7章 假设检验 181
7.1 基本概念 181
7.2 参数假设检验 182
7.2.1 总体均值的检验 182
7.2.2 总体方差的检验 187
7.3 非参数假设检验 189
7.3.1 Pea
son拟合度 检验 189
7.3.2 Kolmogo
ov-Smi
nov检验 192
7.3.3 列联表的独立性检验 195
7.3.4 符号检验 199
7.3.5 秩检验 201
7.3.6 多组样本检验 205
7.4 方差分析 208
7.4.1 单因素方差分析 209
7.4.2 双因素方差分析 213
第8章 回归分析 219
8.1 一元线性回归 219
8.2 多元线性回归 225
8.2.1 数学模型 225
8.2.2 显著性检验 225
8.2.3 预测 228
8.2.4 修正拟合模型 228
8.2.5 逐步回归 232
8.3 非线性回归 240
8.4 广义线性回归模型 247
8.5 Logistic回归模型 249
第9章 主成分分析和因子分析 257
9.1 主成分分析 257
9.2 因子分析 264
第10章 生存分析 267
10.1 基本概念 267
10.2 生存曲线 269
第4部分 数据分析与预测
第11章 数据预处理 277
11.1 异常值与缺失值处理 278
11.1.1 异常值处理 278
11.1.2 缺失值处理 280
11.2 数据标准化 289
11.2.1 min-max标准化 290
11.2.2 z-sco
e标准化 290
11.2.3 归一化 291
第12章 分类技术:k近邻算法(k-NN) 293
12.1 k-NN算法概述 293
12.1.1 算法原理 293
12.1.2 距离计算 294
12.2 利用k-NN算法诊断糖尿病 295
12.2.1 数据准备和探索 295
12.2.2 基于数据构建模型 298
第13章 分类技术:支持向量机 301
13.1 SVM模型概述 301
13.2 核函数 302
13.3 基于数据训练模型 303
13.4 评估模型性能 306
第14章 决策树 309
14.1 决策树原理 309
14.1.1 选择最佳的分割 309
14.1.2 剪枝策略 312
14.2 决策树案例 312
14.2.1 实现心脏病患病预测 312
14.2.2 使用C5.0决策识别高风险银行贷款 315
14.2.3 条件推理树 317
14.3 随机森林 318
14.3.1 基于数据构建模型 318
14.3.2 模型性能影响因素 321
14.3.3 评估模型 323
14.4 梯度提升 324
14.5 使用随机森林进行特征选择 328
第15章 聚类算法 331
15.1 层次聚类 331
15.2 k-means算法 335
15.3 k-medoids算法 339
15.4 基于密度的聚类 342
15.5 期望最大化聚类 345
第16章 关联规则 348
16.1 基本概念 348
16.2 Ap
io
i算法 349
16.2.1 数据准备和探索 349
16.2.2 基于数据训练模型 352
第17章 神经网络 355
17.1 神经网络介绍 355
17.2 神经网络应用案例 357
参考文献 361
语言基础知识
第1章
概述 3
1.1
软件的下载与安装 4
1.2 获得帮助 7
1.3
包 7
1.3.1 本地库中的
包 7
1.3.2 安装
包 8
1.3.3 加载
包 11
1.3.4 维护
包 12
第2章 数据管理 13
2.1 数据对象的创建与删除 13
2.2 对象的类型与运算符 15
2.3 数据结构 17
2.3.1 向量 18
2.3.2 矩阵和数组 26
2.3.3 时间序列 31
2.3.4 因子 33
2.3.5 列表 35
2.3.6 数据框 39
2.4 读写文件数据 44
2.4.1 工作路径 44
2.4.2 内置数据集 44
2.4.3 读写文本文件 45
第3章 流程控制 47
3.1 分支语句 47
3.1.1 if-else语句 47
3.1.2 switch语句 48
3.2 循环语句 49
3.2.1
epeat循环语句 49
3.2.2 while循环语句 51
3.2.3 fo
循环语句 52
3.2.4
eplication高级循环 54
3.3 自定义函数 54
3.4 程序运行时间与效率 58
第2部分
绘 图
第4章 基础绘图 61
4.1 图形参数 61
4.1.1 设置颜色 61
4.1.2 选择颜色组合和调色板 64
4.1.3 设置绘图符号及大小 68
4.1.4 选择线型和线宽 70
4.1.5 设置坐标轴 70
4.1.6 设置图例 75
4.2 绘制图形 76
4.2.1 散点图 76
4.2.2 折线图 78
4.2.3 条形图 79
4.2.4 直方图和密度图 81
4.2.5 箱线图 83
4.2.6 热图 85
4.2.7 散点图矩阵 86
4.2.8 词云图 87
4.2.9 韦恩图 88
4.2.10 生存函数图 92
4.2.11 函数图像 93
4.2.12 小提琴图 94
4.2.13 三维图形 95
4.3 保存和输出图形 100
第5章 高级绘图 102
5.1 qplot绘图 102
5.2 ggplot2绘图 114
5.2.1 图层构建图像 114
5.2.2 几何对象和统计变换 118
5.3 绘制图形 121
5.3.1 直方图 121
5.3.2 密度曲线图 124
5.3.3 箱线图 127
5.3.4 小提琴图 130
5.3.5 火山图 133
5.3.6 富集分析气泡图 135
5.3.7 等高图
等高线 137
第3部分 统 计 分 析
第6章 统计描述 145
6.1 描述统计量 145
6.1.1 集中趋势 145
6.1.2 离散趋势 150
6.1.3 分布形状的度量 152
6.2 数据常用分布、随机抽样及正态性检验 153
6.2.1 数据常用分布 153
6.2.2 随机抽样 160
6.2.3 正态性检验 165
6.3 多元数据分布 168
6.3.1 二元变量数据分析 168
6.3.2 多元变量数据分析 170
6.3.3 探索数据分布 171
6.4 参数估计 173
6.4.1 极大似然估计 173
6.4.2 最小二乘法 176
6.4.3 EM算法 177
第7章 假设检验 181
7.1 基本概念 181
7.2 参数假设检验 182
7.2.1 总体均值的检验 182
7.2.2 总体方差的检验 187
7.3 非参数假设检验 189
7.3.1 Pea
son拟合度 检验 189
7.3.2 Kolmogo
ov-Smi
nov检验 192
7.3.3 列联表的独立性检验 195
7.3.4 符号检验 199
7.3.5 秩检验 201
7.3.6 多组样本检验 205
7.4 方差分析 208
7.4.1 单因素方差分析 209
7.4.2 双因素方差分析 213
第8章 回归分析 219
8.1 一元线性回归 219
8.2 多元线性回归 225
8.2.1 数学模型 225
8.2.2 显著性检验 225
8.2.3 预测 228
8.2.4 修正拟合模型 228
8.2.5 逐步回归 232
8.3 非线性回归 240
8.4 广义线性回归模型 247
8.5 Logistic回归模型 249
第9章 主成分分析和因子分析 257
9.1 主成分分析 257
9.2 因子分析 264
第10章 生存分析 267
10.1 基本概念 267
10.2 生存曲线 269
第4部分 数据分析与预测
第11章 数据预处理 277
11.1 异常值与缺失值处理 278
11.1.1 异常值处理 278
11.1.2 缺失值处理 280
11.2 数据标准化 289
11.2.1 min-max标准化 290
11.2.2 z-sco
e标准化 290
11.2.3 归一化 291
第12章 分类技术:k近邻算法(k-NN) 293
12.1 k-NN算法概述 293
12.1.1 算法原理 293
12.1.2 距离计算 294
12.2 利用k-NN算法诊断糖尿病 295
12.2.1 数据准备和探索 295
12.2.2 基于数据构建模型 298
第13章 分类技术:支持向量机 301
13.1 SVM模型概述 301
13.2 核函数 302
13.3 基于数据训练模型 303
13.4 评估模型性能 306
第14章 决策树 309
14.1 决策树原理 309
14.1.1 选择最佳的分割 309
14.1.2 剪枝策略 312
14.2 决策树案例 312
14.2.1 实现心脏病患病预测 312
14.2.2 使用C5.0决策识别高风险银行贷款 315
14.2.3 条件推理树 317
14.3 随机森林 318
14.3.1 基于数据构建模型 318
14.3.2 模型性能影响因素 321
14.3.3 评估模型 323
14.4 梯度提升 324
14.5 使用随机森林进行特征选择 328
第15章 聚类算法 331
15.1 层次聚类 331
15.2 k-means算法 335
15.3 k-medoids算法 339
15.4 基于密度的聚类 342
15.5 期望最大化聚类 345
第16章 关联规则 348
16.1 基本概念 348
16.2 Ap
io
i算法 349
16.2.1 数据准备和探索 349
16.2.2 基于数据训练模型 352
第17章 神经网络 355
17.1 神经网络介绍 355
17.2 神经网络应用案例 357
参考文献 361













