Flink实时大数据处理技术 / 高等院校大数据与人工智能应用人才培养系列教材
定价:¥79.90
作者: 刘月峰
出版时间:2024-06-15
最新印次日期:2025-2
出版社:机械工业出版社
试读
- 机械工业出版社
- 9787111752004
- 1-2
- 49260211-5
- 16开
- 2024-06-15
- 工学
- 计算机类
- 数据科学与大数据技术
- 本科
内容简介
本书从实践的角度出发,介绍了Flink实时大数据处理框架开发的技术知识,包括实时处理系统的相关概念、开发方法、分布式计算的体系结构,以及面向事件驱动的编程技术。书中详细探讨了Flink的流式处理和批处理融合的能力,以及它在大规模数据流处理中的优势,并通过一个具体的实例介绍大数据实时处理系统的开发方法和开发过程。此外,本书还介绍了实时数据仓库的设计与实现,包括数据抽取、数据转换、数据存储和数据可视化等方面的内容,以帮助读者构建强大而可扩展的实时数据处理系统。除第10章外,其余各章配有习题,以指导读者深入地进行学习。
本书既可作为高等学校计算机软件技术课程的教材,也可作为大数据开发人员的技术参考书。
本书既可作为高等学校计算机软件技术课程的教材,也可作为大数据开发人员的技术参考书。
目录
前言
第1章Apache Flink概述
11Flink是什么
111Flink的起源
112Flink的发展过程和主要版本
113Flink的定义
114编程语言的选择
12Flink层次架构
121架构设计
122API和Libraries层
123Runtime核心层
124物理部署层
13大数据处理架构的发展
131Lambda架构
132Kappa架构
133流处理框架的发展
14Flink应用场景
141事件驱动型应用
142数据分析应用
143数据管道应用
144行业应用
15Flink生态系统和社区
151Flink的生态系统和相关工具
152Flink的社区和贡献者
16Flink与其他大数据框架的
关系
161Flink与Hadoop
162Flink与Hive
163Flink与Spark Streaming
164Flink与Storm
17习题
第2章Scala语言
21Scala语言概述
211Scala简介
212开发环境配置
213创建项目
22Scala语言入门
221类型体系结构
222变量的定义与使用
223字面量与插值表达式
224运算符
225流程控制语句
23集合
231集合概述
232Array和ArrayBuffer
233Tuple
234List和ListBuffer
235Set
236Map
237集合操作符号
24函数式编程
241函数的定义与使用
242匿名函数
243高阶函数
244柯里化与闭包
25面向对象编程
251类与对象
252构造器
253继承
254伴生类与伴生对象
255多态
256泛型
257隐式转换
26模式匹配
261基本使用
262条件守卫
263常用匹配
264样例类
27习题
第3章环境搭建和应用部署
31Flink开发环境搭建
311CentOS环境准备
312项目初始化
313项目结构与依赖
32Flink词频统计
321批处理方式
322流处理方式
323两种方式对比
324向集群提交作业
33Flink 集群部署
331Flink集群核心组件
332部署模式
333Standalone模式
334YARN模式
34YARN模式的部署与应用提交
341环境准备
342会话模式
343单作业模式
344应用模式
35习题
第4章Flink流处理架构与原理
41流处理模型与原理
411数据流的概念
412流处理和批处理
413流处理的原理
414流处理的模型
415流处理的优化策略
42Flink流处理架构
421Flink的数据流模型
422算子
423Flink的状态管理
424Flink的容错机制
425Flink在流计算中的优化
43Flink 集群架构
431集群组件的协作
432Task和算子链
433Task Slots和资源管理
44习题
第5章流处理API
51基本使用
511DataStream是什么
512基础程序
513并行度的设置
52DataStream 数据源
521内置Data Source
522自定义 Data Source
53DataStream 转换算子
531数据流转换
532RichFunction
533物理分区
534算子链
535资源组
54DataStream Sink
541Data Sinks
542自定义Sink
55用户行为实时分析
56习题
第6章时间和窗口
61时间与窗口的概念
611Flink中的时间
612窗口
613水位线
62窗口的基本使用
621窗口分配器
622内置窗口分配器
623窗口触发器
624内置触发器
63窗口函数
631ReduceFunction
632AggregateFunction
633ProcessWindowFunction
634增量聚合的ProcessWindow
Function
64习题
第7章处理函数与状态管理
71处理函数
711ProcessFunction
712KeyedProcessFunction
713定时器
72多流操作
721Union
722Connect
723Window Join
724Interval Join
725侧输出流
726处理迟到数据
73状态管理
731有状态的流处理
732键控状态
733算子状态
74状态持久化
741Checkpoint
742StateBackend
743Savepoint
75习题
第8章Table API和SQL API
81Table API和SQL API概述
811程序基本结构
812TableEnvironment创建
813创建Table
814Table查询
815Table输出
816Table与DataStream的转换
82Flink SQL使用
821基本使用
822DDL创建表
823查询表
824插入数据
83窗口处理
831窗口表值函数
832窗口聚合
833窗口连接
834Top-N
835去重
84函数
841标量函数
842表值函数
843聚合函数
844表值聚合函数
85习题
第9章Flink Kafka 连接器
91Kafka概述
911基本概念
912环境准备
92生产者与消费者
921Topic操作
922消息发送及消费
923容错机制
93Flink集成Kafka
931DataStream API集成Kafka
932Table API集成Kafka
94数据实时清洗与可视化
941数据模拟
942数据清洗处理
943将数据写入ClickHouse
944数据可视化
95习题
第10章Flink 数据仓库项目实战
101数据仓库概述
1011基本概念
1012与数据库比较
1013OLTP与OLAP
1014数据仓库的应用
102数据仓库架构与模型设计
1021数据仓库架构
1022数据ETL
1023维度数据模型
1024数据仓库分层
1025离线数据仓库与实时数据
仓库
103实时数据仓库环境准备
1031项目需求
1032Nginx日志数据模拟
1033安装和配置 Flume
104项目具体实现
1041数据处理
1042数据分析
1043数据存储
1044数据可视化
参考文献
第1章Apache Flink概述
11Flink是什么
111Flink的起源
112Flink的发展过程和主要版本
113Flink的定义
114编程语言的选择
12Flink层次架构
121架构设计
122API和Libraries层
123Runtime核心层
124物理部署层
13大数据处理架构的发展
131Lambda架构
132Kappa架构
133流处理框架的发展
14Flink应用场景
141事件驱动型应用
142数据分析应用
143数据管道应用
144行业应用
15Flink生态系统和社区
151Flink的生态系统和相关工具
152Flink的社区和贡献者
16Flink与其他大数据框架的
关系
161Flink与Hadoop
162Flink与Hive
163Flink与Spark Streaming
164Flink与Storm
17习题
第2章Scala语言
21Scala语言概述
211Scala简介
212开发环境配置
213创建项目
22Scala语言入门
221类型体系结构
222变量的定义与使用
223字面量与插值表达式
224运算符
225流程控制语句
23集合
231集合概述
232Array和ArrayBuffer
233Tuple
234List和ListBuffer
235Set
236Map
237集合操作符号
24函数式编程
241函数的定义与使用
242匿名函数
243高阶函数
244柯里化与闭包
25面向对象编程
251类与对象
252构造器
253继承
254伴生类与伴生对象
255多态
256泛型
257隐式转换
26模式匹配
261基本使用
262条件守卫
263常用匹配
264样例类
27习题
第3章环境搭建和应用部署
31Flink开发环境搭建
311CentOS环境准备
312项目初始化
313项目结构与依赖
32Flink词频统计
321批处理方式
322流处理方式
323两种方式对比
324向集群提交作业
33Flink 集群部署
331Flink集群核心组件
332部署模式
333Standalone模式
334YARN模式
34YARN模式的部署与应用提交
341环境准备
342会话模式
343单作业模式
344应用模式
35习题
第4章Flink流处理架构与原理
41流处理模型与原理
411数据流的概念
412流处理和批处理
413流处理的原理
414流处理的模型
415流处理的优化策略
42Flink流处理架构
421Flink的数据流模型
422算子
423Flink的状态管理
424Flink的容错机制
425Flink在流计算中的优化
43Flink 集群架构
431集群组件的协作
432Task和算子链
433Task Slots和资源管理
44习题
第5章流处理API
51基本使用
511DataStream是什么
512基础程序
513并行度的设置
52DataStream 数据源
521内置Data Source
522自定义 Data Source
53DataStream 转换算子
531数据流转换
532RichFunction
533物理分区
534算子链
535资源组
54DataStream Sink
541Data Sinks
542自定义Sink
55用户行为实时分析
56习题
第6章时间和窗口
61时间与窗口的概念
611Flink中的时间
612窗口
613水位线
62窗口的基本使用
621窗口分配器
622内置窗口分配器
623窗口触发器
624内置触发器
63窗口函数
631ReduceFunction
632AggregateFunction
633ProcessWindowFunction
634增量聚合的ProcessWindow
Function
64习题
第7章处理函数与状态管理
71处理函数
711ProcessFunction
712KeyedProcessFunction
713定时器
72多流操作
721Union
722Connect
723Window Join
724Interval Join
725侧输出流
726处理迟到数据
73状态管理
731有状态的流处理
732键控状态
733算子状态
74状态持久化
741Checkpoint
742StateBackend
743Savepoint
75习题
第8章Table API和SQL API
81Table API和SQL API概述
811程序基本结构
812TableEnvironment创建
813创建Table
814Table查询
815Table输出
816Table与DataStream的转换
82Flink SQL使用
821基本使用
822DDL创建表
823查询表
824插入数据
83窗口处理
831窗口表值函数
832窗口聚合
833窗口连接
834Top-N
835去重
84函数
841标量函数
842表值函数
843聚合函数
844表值聚合函数
85习题
第9章Flink Kafka 连接器
91Kafka概述
911基本概念
912环境准备
92生产者与消费者
921Topic操作
922消息发送及消费
923容错机制
93Flink集成Kafka
931DataStream API集成Kafka
932Table API集成Kafka
94数据实时清洗与可视化
941数据模拟
942数据清洗处理
943将数据写入ClickHouse
944数据可视化
95习题
第10章Flink 数据仓库项目实战
101数据仓库概述
1011基本概念
1012与数据库比较
1013OLTP与OLAP
1014数据仓库的应用
102数据仓库架构与模型设计
1021数据仓库架构
1022数据ETL
1023维度数据模型
1024数据仓库分层
1025离线数据仓库与实时数据
仓库
103实时数据仓库环境准备
1031项目需求
1032Nginx日志数据模拟
1033安装和配置 Flume
104项目具体实现
1041数据处理
1042数据分析
1043数据存储
1044数据可视化
参考文献











