- 电子工业出版社
- 9787121528828
- 1-1
- 16开
- 2026-12
- 335
- 电子与信息大类
- 计算机类
- 计算机类
- 中职
内容简介
本书是职业院校大数据专业核心教材,是基于“岗课赛证融通”理念开发的中等职业教育大数据技术应用专业新形态教材,严格对标职业教育教学标准、大数据相关职业技能等级证书考核要求、大数据工程师技术人员岗位能力标准并深度融合职业院校技能大赛大数据相关赛项的相关内容编写而成。全书分为四大篇章,构建“基础 — 采集 — 存储 — 分析”递进式知识体系。大数据基础平台搭建篇(项目1—项目3)包括大数据平台基础环境搭建、部署Hadoop分布式平台、部署Zookeeper分布式协调服务,大数据采集技术应用篇(项目4—项目6)包括部署与应用Flume、部署与应用Kafka、部署与应用Sqoop,大数据存储技术应用篇(项目7-项目8)包括部署与应用HBase、部署与应用Flink,大数据分析技术应用篇(项目9-项目10)包括部署完全分布式Spark集群、部署与应用Flink。
目录
大数据基础平台搭建篇
项目1 大数据平台基础环境搭建 2
任务1.1 创建并配置虚拟环境 7
1.1.1 安装虚拟机软件 7
1.1.2 创建CentOS 7虚拟机 10
1.1.3 配置CentOS 7虚拟机 14
1.1.4 固定虚拟机IP地址并
验证 21
任务1.2 配置网络连接工具 22
1.2.1 安装Xshell和Xftp 23
1.2.2 配置连接虚拟机 25
任务1.3 配置基础平台 30
1.3.1 配置本地YUM源及
安装常用软件 31
1.3.2 安装JDK 33
1.3.3 克隆虚拟机 35
1.3.4 修改克隆的虚拟机的IP
地址 37
1.3.5 添加IP地址主机映射 39
1.3.6 配置SSH免密登录 39
1.3.7 配置时间同步服务 41
AI助学 44
项目2 部署Hadoop分布式平台 46
任务2.1 部署完全分布式Hadoop
集群 53
2.1.1 下载Hadoop 54
2.1.2 解压缩Hadoop 54
2.1.3 修改配置文件 55
2.1.4 分发Hadoop至其他
节点 61
2.1.5 格式化NameNode 61
2.1.6 启动Hadoop集群 61
2.1.7 验证Hadoop集群是否
启动成功 62
任务2.2 测试Hadoop平台 64
2.2.1 上传日志文件至
HDFS 64
2.2.2 运行MapReduce任务 66
2.2.3 查看集群状态 67
AI助学 69
项目3 部署ZooKeeper分布式协调
服务 70
任务3.1 部署ZooKeeper集群 74
3.1.1 下载ZooKeeper 74
3.1.2 解压缩ZooKeeper 75
3.1.3 修改配置文件 75
3.1.4 分发ZooKeeper至其他
节点 77
3.1.5 启动ZooKeeper集群 77
*任务3.2 基于ZooKeeper集群
部署Hadoop HA模式 78
3.2.1 修改Hadoop配置
文件 79
3.2.2 启动ZooKeeper集群 86
3.2.3 初始化Hadoop HA
功能 86
3.2.4 验证HA模式 88
AI助学 91
大数据采集技术应用篇
项目4 部署与应用Flume 94
任务4.1 部署Flume 98
4.1.1 下载Flume 99
4.1.2 解压缩Flume 100
4.1.3 修改Flume的名称 100
4.1.4 修改配置文件 100
4.1.5 查看Flume版本 101
*任务4.2 使用Flume采集农村电商
网站服务器日志数据 102
4.2.1 定时抽取数据 102
4.2.2 编写采集脚本 103
4.2.3 启动采集程序 105
AI助学 107
项目5 部署与应用Kafka 108
任务5.1 部署Kafka集群 112
5.1.1 下载Kafka 112
5.1.2 解压缩Kafka 113
5.1.3 修改配置文件 113
5.1.4 分发Kafka至其他
节点 113
5.1.5 启动ZooKeeper集群 113
5.1.6 启动Kafka集群 114
5.1.7 验证Kafka集群是否
部署成功 114
*任务5.2 使用Kafka订阅农村电商网站服务器日志数据 115
AI助学 120
项目6 部署与应用Sqoop 122
任务6.1 部署Sqoop 124
任务6.2 使用Sqoop实现中国工业
产品产量数据迁移 128
6.2.1 在MySQL中创建
数据表 129
6.2.2 使用Sqoop将数据表中的数据迁移至HDFS 131
AI助学 134
大数据存储技术应用篇
项目7 部署与应用HBase 136
任务7.1 部署完全分布式HBase
集群 141
7.1.1 下载HBase 141
7.1.2 解压缩HBase 142
7.1.3 修改配置文件 142
7.1.4 分发HBase至其他
节点 144
7.1.5 启动HBase集群 144
7.1.6 验证HBase集群是否
部署成功 145
*任务7.2 使用HBase实现碳排放
数据存储 146
7.2.1 设计HBase的
表结构 146
7.2.2 通过HBase Shell创建新
命名空间和新表 147
7.2.3 通过Linux Shell脚本
导入数据 147
AI助学 150
项目8 部署与应用Hive 152
任务8.1 部署本地模式的Hive 159
8.1.1 安装MySQL 159
8.1.2 部署Hive 164
*任务8.2 使用Hive实现铁路
客流量分析 168
8.2.1 将铁路数据上传至
HDFS 169
8.2.2 在Hive中创建
数据表 169
8.2.3 将HDFS中的数据导入
数据表 171
8.2.4 分析不同站点的客流量
分布情况 172
AI助学 174
大数据分析技术应用篇
项目9 部署与应用Spark 176
任务9.1 部署完全分布式Spark
集群 180
9.1.1 下载Spark 181
9.1.2 解压缩Spark 182
9.1.3 修改配置文件 182
9.1.4 分发Spark至其他
节点 183
9.1.5 启动Spark集群 183
9.1.6 验证Spark集群是否
部署成功 184
*任务9.2 使用Spark实现水稻信息
数据分析 185
9.2.1 读取水稻基本信息
数据 186
9.2.2 分析水稻数量情况 187
AI助学 190
项目10 部署与应用Flink 192
任务10.1 部署Flink集群 196
10.1.1 下载Flink 197
10.1.2 解压缩Flink 197
10.1.3 修改配置文件 198
10.1.4 分发Flink至其他
节点 198
10.1.5 启动Flink集群 198
10.1.6 验证Flink集群是否
部署成功 198
*任务10.2 使用Flink实时计算
农村电商数据 199
10.2.1 采集农村电商商品
数据 200
10.2.2 搭建Flink开发
环境 202
10.2.3 创建MySQL
存储表 212
10.2.4 统计每日销售额和每日
访问次数 213
AI助学 219
项目1 大数据平台基础环境搭建 2
任务1.1 创建并配置虚拟环境 7
1.1.1 安装虚拟机软件 7
1.1.2 创建CentOS 7虚拟机 10
1.1.3 配置CentOS 7虚拟机 14
1.1.4 固定虚拟机IP地址并
验证 21
任务1.2 配置网络连接工具 22
1.2.1 安装Xshell和Xftp 23
1.2.2 配置连接虚拟机 25
任务1.3 配置基础平台 30
1.3.1 配置本地YUM源及
安装常用软件 31
1.3.2 安装JDK 33
1.3.3 克隆虚拟机 35
1.3.4 修改克隆的虚拟机的IP
地址 37
1.3.5 添加IP地址主机映射 39
1.3.6 配置SSH免密登录 39
1.3.7 配置时间同步服务 41
AI助学 44
项目2 部署Hadoop分布式平台 46
任务2.1 部署完全分布式Hadoop
集群 53
2.1.1 下载Hadoop 54
2.1.2 解压缩Hadoop 54
2.1.3 修改配置文件 55
2.1.4 分发Hadoop至其他
节点 61
2.1.5 格式化NameNode 61
2.1.6 启动Hadoop集群 61
2.1.7 验证Hadoop集群是否
启动成功 62
任务2.2 测试Hadoop平台 64
2.2.1 上传日志文件至
HDFS 64
2.2.2 运行MapReduce任务 66
2.2.3 查看集群状态 67
AI助学 69
项目3 部署ZooKeeper分布式协调
服务 70
任务3.1 部署ZooKeeper集群 74
3.1.1 下载ZooKeeper 74
3.1.2 解压缩ZooKeeper 75
3.1.3 修改配置文件 75
3.1.4 分发ZooKeeper至其他
节点 77
3.1.5 启动ZooKeeper集群 77
*任务3.2 基于ZooKeeper集群
部署Hadoop HA模式 78
3.2.1 修改Hadoop配置
文件 79
3.2.2 启动ZooKeeper集群 86
3.2.3 初始化Hadoop HA
功能 86
3.2.4 验证HA模式 88
AI助学 91
大数据采集技术应用篇
项目4 部署与应用Flume 94
任务4.1 部署Flume 98
4.1.1 下载Flume 99
4.1.2 解压缩Flume 100
4.1.3 修改Flume的名称 100
4.1.4 修改配置文件 100
4.1.5 查看Flume版本 101
*任务4.2 使用Flume采集农村电商
网站服务器日志数据 102
4.2.1 定时抽取数据 102
4.2.2 编写采集脚本 103
4.2.3 启动采集程序 105
AI助学 107
项目5 部署与应用Kafka 108
任务5.1 部署Kafka集群 112
5.1.1 下载Kafka 112
5.1.2 解压缩Kafka 113
5.1.3 修改配置文件 113
5.1.4 分发Kafka至其他
节点 113
5.1.5 启动ZooKeeper集群 113
5.1.6 启动Kafka集群 114
5.1.7 验证Kafka集群是否
部署成功 114
*任务5.2 使用Kafka订阅农村电商网站服务器日志数据 115
AI助学 120
项目6 部署与应用Sqoop 122
任务6.1 部署Sqoop 124
任务6.2 使用Sqoop实现中国工业
产品产量数据迁移 128
6.2.1 在MySQL中创建
数据表 129
6.2.2 使用Sqoop将数据表中的数据迁移至HDFS 131
AI助学 134
大数据存储技术应用篇
项目7 部署与应用HBase 136
任务7.1 部署完全分布式HBase
集群 141
7.1.1 下载HBase 141
7.1.2 解压缩HBase 142
7.1.3 修改配置文件 142
7.1.4 分发HBase至其他
节点 144
7.1.5 启动HBase集群 144
7.1.6 验证HBase集群是否
部署成功 145
*任务7.2 使用HBase实现碳排放
数据存储 146
7.2.1 设计HBase的
表结构 146
7.2.2 通过HBase Shell创建新
命名空间和新表 147
7.2.3 通过Linux Shell脚本
导入数据 147
AI助学 150
项目8 部署与应用Hive 152
任务8.1 部署本地模式的Hive 159
8.1.1 安装MySQL 159
8.1.2 部署Hive 164
*任务8.2 使用Hive实现铁路
客流量分析 168
8.2.1 将铁路数据上传至
HDFS 169
8.2.2 在Hive中创建
数据表 169
8.2.3 将HDFS中的数据导入
数据表 171
8.2.4 分析不同站点的客流量
分布情况 172
AI助学 174
大数据分析技术应用篇
项目9 部署与应用Spark 176
任务9.1 部署完全分布式Spark
集群 180
9.1.1 下载Spark 181
9.1.2 解压缩Spark 182
9.1.3 修改配置文件 182
9.1.4 分发Spark至其他
节点 183
9.1.5 启动Spark集群 183
9.1.6 验证Spark集群是否
部署成功 184
*任务9.2 使用Spark实现水稻信息
数据分析 185
9.2.1 读取水稻基本信息
数据 186
9.2.2 分析水稻数量情况 187
AI助学 190
项目10 部署与应用Flink 192
任务10.1 部署Flink集群 196
10.1.1 下载Flink 197
10.1.2 解压缩Flink 197
10.1.3 修改配置文件 198
10.1.4 分发Flink至其他
节点 198
10.1.5 启动Flink集群 198
10.1.6 验证Flink集群是否
部署成功 198
*任务10.2 使用Flink实时计算
农村电商数据 199
10.2.1 采集农村电商商品
数据 200
10.2.2 搭建Flink开发
环境 202
10.2.3 创建MySQL
存储表 212
10.2.4 统计每日销售额和每日
访问次数 213
AI助学 219










