- 掌握Spark核心API:通过实例学习DataFrame、SQL、Dataset的使用方法,解决数据处理任务开发效率低的问题。
- 理解Spark运行机制:深入剖析RDD低级API及SQL执行过程,解决集群上任务调度与执行的原理性困惑。
- 构建端到端流处理应用:学习结构化流处理API,解决实时数据处理场景下的开发与部署难题。
- 实现集群调优与监控:讲解Spark应用的调试、监控和性能调优方法,解决生产环境中作业慢、资源浪费的问题。
- 应用MLlib解决实际问题:通过分类、推荐等案例学习机器学习算法实现,解决大数据场景下的建模需求。
- 大数据开发工程师:需要使用Spark进行大规模数据处理与分析的技术人员。
- 数据科学家与分析师:希望利用Spark MLlib进行大规模机器学习建模的从业者。
- 系统管理员与运维工程师:负责Spark集群部署、监控和调优的运维人员。
- 计算机相关专业学生:学习大数据课程、需要一本权威Spark教材的本科生和研究生。
- 前两章快速通读:建立Spark整体认知,了解其在大数据生态中的定位。
- 第3-5章重点精读:核心API和运行机制是后续所有内容的基础,务必动手实践。
- 第6-7章结合实际场景:调优和流处理部分建议在自己的集群或Databricks上验证。
- 第8-9章按需深入:机器学习部分可根据实际项目需求选择性学习算法实现。
- Spark全面掌握:能熟练使用DataFrame、SQL、Dataset和RDD API完成数据处理任务。
- 流处理开发能力:能基于结构化流处理构建端到端的实时数据应用。
- 集群调优经验:掌握Spark应用的性能调优、监控和故障排查方法。
- 机器学习实战:能使用MLlib实现分类、推荐等常见机器学习算法并应用于实际数据。
- 架构理解深入:理解Spark在集群上的运行原理和资源调度机制。
📖 书籍简介
产品特色
编辑推荐
通过本书你将了解到如何使用、部署和维护Apache Spark开源集群计算框架。本书由Spark的创始人所撰写,重点介绍Spark新版本的新功能和新特点。本书将Spark功能分解为若干独立主题来进行全面介绍。
你将接触到Spark的基本操作和常用函数,还包括一种全新的构建端到端流数据应用的结构化流处理API。开发人员和系统管理员将了解到Spark的监控、调优,以及调试的原则和方法,并通过使用Spark提供的可扩展机器学习库Mllib来了解机器学习算法的实现技术。
内容简介
主要内容
·大数据技术和Spark概述。
·通过实例学习DataFrame、SQL、Dataset等Spark的核心API。
·了解Spark的低级API实现,包括RDD以及SQL和DataFrame的执行过程。
·了解Spark如何在集群上运行。
·Spark集群和应用程序的调试、监控、和调优。
·学习Spark强大的流处理引擎——结构化流处理。
·学习MLlib并了解如何应用它解决包括分类、推荐,以及其他多种实际问题。
作者简介
作者介绍
Bill Chambers是Databricks的一名产品经理,致力于使用Spark和Databricks帮助客户完成大规模数据分析的任务。Bill还定期写关于数据科学和大数据方面的博客, 并常在各种会议和见面会上展示产品。他拥有加州大学伯克利分校信息学院的信息系统硕士学位, 研究方向为数据科学。
Matei Zaharia是斯坦福大学计算机科学系助理教授和Databricks的首席技术官。他于2009年在加州大学伯克利分校创立了Spark项目, 那时他是一名博士生, 并继续担任Apache Spark项目的副主席。Matei Zaharia还是Apache Mesos项目的联合创始人,也是Apache Hadoop项目的贡献者。Matei Zaharia以他出色的研究工作获得了2014年美国计算机学会博士论文奖和VMware系统研究奖。
译者介绍
张岩峰,东北大学教授,在国内外从事大数据分布式处理研究工作10余年,中国计算机学会数据库专委会委员,大数据专委会通讯委员,研究设计了iMapReduce、Maiter等大数据迭代计算分布式框架,承担和参与国家自然科学基金、国家重点研发计划等多项课题,在SIGMOD、VLDB、ICDE、PPoPP、TPDS、TKDE等顶D级国际会议和期刊上发表论文10余篇,曾获云计算国际会议ACM SOCC 2011优秀论文奖及多项国内外奖励和荣誉。
精彩书评
“这本书是所有Spark开发人员的必读书籍,介绍了许多别处无法学到的使用技巧。”
——Ion Stoica
美国加州大学伯克利分校
RISE实验室主任
目录
前言/序言
📑 章节目录
- 大数据技术与Spark概述
- Spark的基本操作与常用函数
- DataFrame、SQL与Dataset核心API
- RDD低级API与Spark执行过程
- Spark在集群上的运行机制
- Spark应用的调试、监控与调优
- 结构化流处理:构建端到端流数据应用
- MLlib机器学习库与算法实现
- 分类、推荐等实际问题的机器学习解决方案
- Spark生态系统与生产部署最佳实践

















