- 构建大数据完整知识体系:覆盖数据采集、存储、计算、分析、调度等全链路技术,解决知识碎片化问题。
- 掌握主流采集工具实战:通过Flume、Logstash、Filebeat、Sqoop、Maxwell等工具的实战案例,解决数据采集难题。
- 理解企业级大数据架构:讲解离线、实时、批流一体化数据仓库及数据中台架构,解决架构选型困惑。
- 快速上手大数据开发:以图解+实战形式降低学习门槛,帮助Java开发者快速转型大数据方向。
- 应对真实业务场景:通过双十一数据大屏、全文搜索系统等案例,解决实际项目中的架构设计问题。
★★★
中级
入门初级中级进阶高级
- Java开发转大数据方向:具备Java基础,希望转型大数据开发的技术人员。
- 大数据初学者:对大数据感兴趣但缺乏系统学习路径的开发人员。
- 数据平台开发工程师:需要搭建和维护大数据平台,希望掌握完整技术栈的工程师。
- 架构师与技术管理者:需要了解大数据架构选型与技术全景的技术决策者。
- 先通读基础篇:第1章的大数据生态圈总览是全书地图,务必先理解整体技术版图。
- 动手完成实战案例:每章的工具安装与实战案例需亲自动手操作,切忌只看不练。
- 重点攻克采集与架构:数据采集篇和企业级架构案例是本书精华,建议重点研读。
- 结合Java基础学习:本书需要一定Java基础,建议先确保Java能力过关再阅读。
- 按技术栈分阶段学习:可先学采集与存储,再学计算与分析,最后研究架构案例。
- 全链路技术视野:建立从数据采集到数据分析的大数据完整技术体系认知。
- 采集工具实战能力:熟练使用Flume、Sqoop、Maxwell等主流数据采集工具。
- 架构设计能力:掌握离线、实时、批流一体化数据仓库及数据中台的架构设计方法。
- 集群管理技能:具备大数据集群的安装、配置与管理能力。
- 项目实战经验:通过双十一数据大屏等案例积累企业级大数据项目经验。
- 技术选型能力:能够根据业务需求选择合适的大数据技术栈与架构方案。
📖 书籍简介
作 者:徐葳 著
定 价:146
出 版 社:电子工业出版社
出版日期:2022年07月01日
页 数:500
装 帧:平装
ISBN:9787121437748
●基础篇
第1章 大数据的前世今生
1.1 什么是大数据
1.2 大数据产生的背景
1.3 大数据的4V特征
1.4 大数据的典型应用场景
1.5 大数据生态圈核心技术总览
技术篇
第2章 海量数据采集
2.1 为什么需要数据采集
2.2 数据形态
2.3 数据来源
2.4 数据采集规则
2.5 日志数据采集工具
2.5.1 对比常见的日志数据采集工具
2.5.2 Flume的原理及架构分析
2.5.3 Flume的应用
2.5.3.1 安装Flume
2.5.3.2 Hello World
2.5.3.3 【实战】日志汇总采集
2.5.4 Logstash的原理及架构分析
2.5.5 Logstash的应用
2.5.5.1 安装Logstash
2.5.5.2 【实战】Hello World案例
2.5.5.3 【实战】采集异常日志案例
2.5.6 Filebeat的原理及架构分析
2.5.6.1 Filebeat的由来
2.5.6.2 原理及架构分析
2.5.7 Filebeat的应用
2.5.7.1 安装Filebeat
2.5.7.2 【实战】采集应用程序日志
2.6 数据库数据采集工具
2.6.1 对比常见的数据库数据采集工具
2.6.1.1 数据库离线数据采集工具
2.6.1.2 数据库实时数据采集工具
2.6.2 Saoop的原理及架构分析
2.6.3 DataX的原理及架构分析
2.6.4 Sqoop的应用
2.6.4.1 安装Sqoop
2.6.4.2 Sqoop 常见参数
2.6.4.3 【实战】导入数据
2.6.4.4 【实战】导出数据
2.6.4.5 【实战】封装Sqoop脚本
2.6.5 Canal的原理及架构分析
2.6.6 Maxwell的原理及架构分析
2.6.7 Maxwell的应用
2.6.7.1 安装Maxwell
2.6.7.2 【实战】采集MySQL数据库的实时数据
2.7 网页数据采集工具
2.7.1 常见的网页数据采集工具
2.7.2 网页数据采集工具的原理及架构分析
2.8 物联网数据采集工具
……
第1章 大数据的前世今生
1.1 什么是大数据
1.2 大数据产生的背景
1.3 大数据的4V特征
1.4 大数据的典型应用场景
1.5 大数据生态圈核心技术总览
技术篇
第2章 海量数据采集
2.1 为什么需要数据采集
2.2 数据形态
2.3 数据来源
2.4 数据采集规则
2.5 日志数据采集工具
2.5.1 对比常见的日志数据采集工具
2.5.2 Flume的原理及架构分析
2.5.3 Flume的应用
2.5.3.1 安装Flume
2.5.3.2 Hello World
2.5.3.3 【实战】日志汇总采集
2.5.4 Logstash的原理及架构分析
2.5.5 Logstash的应用
2.5.5.1 安装Logstash
2.5.5.2 【实战】Hello World案例
2.5.5.3 【实战】采集异常日志案例
2.5.6 Filebeat的原理及架构分析
2.5.6.1 Filebeat的由来
2.5.6.2 原理及架构分析
2.5.7 Filebeat的应用
2.5.7.1 安装Filebeat
2.5.7.2 【实战】采集应用程序日志
2.6 数据库数据采集工具
2.6.1 对比常见的数据库数据采集工具
2.6.1.1 数据库离线数据采集工具
2.6.1.2 数据库实时数据采集工具
2.6.2 Saoop的原理及架构分析
2.6.3 DataX的原理及架构分析
2.6.4 Sqoop的应用
2.6.4.1 安装Sqoop
2.6.4.2 Sqoop 常见参数
2.6.4.3 【实战】导入数据
2.6.4.4 【实战】导出数据
2.6.4.5 【实战】封装Sqoop脚本
2.6.5 Canal的原理及架构分析
2.6.6 Maxwell的原理及架构分析
2.6.7 Maxwell的应用
2.6.7.1 安装Maxwell
2.6.7.2 【实战】采集MySQL数据库的实时数据
2.7 网页数据采集工具
2.7.1 常见的网页数据采集工具
2.7.2 网页数据采集工具的原理及架构分析
2.8 物联网数据采集工具
……
本书提供了学习大数据技术及架构的一站式解决方案,覆盖了大数据生态圈中的完整技术体系,包括数据采集、数据存储、分布式资源管理、数据计算、数据分析、任务调度、数据检索、大数据底层基础技术和大数据集群安装与管理。
本书还介绍了多个企业级大数据应用案例(包括海量数据采集、“双十一”数据大屏、海量数据全文搜索系统等)和大数据平台架构案例(包括离线数据仓库架构、实时数据仓库架构、批流一体化数据仓库架构、数据中台架构、直播大数据平台架构、电商大数据平台架构等),可以帮助读者从全局角度理解大数据。
在本书中,技术内容基本上都是从零讲起的,结合原理和架构,以“图解+实战”的形式帮助读者轻松理解复杂的知识。
本书适合对大数据感兴趣的开发人员。无论读者是否接触过大数据开发,只要具备一定的Java开发基础,都可以通过本书快速理解大数据的核心技术栈和典型应用场景,并且掌握海量数据的采集、存储等
📑 章节目录
- 大数据的前世今生与生态圈总览
- 海量数据采集——日志采集工具实战
- 数据库数据采集——离线与实时方案
- 网页与物联网数据采集技术
- 大数据存储技术详解
- 分布式资源管理与调度框架
- 大数据计算引擎与数据分析
- 任务调度与数据检索系统
- 大数据底层基础技术
- 大数据集群安装与管理
- 企业级大数据应用案例实战
- 大数据平台架构设计与选型
