- 系统脆弱点难发现:通过混沌工程实验主动揭示分布式系统中的潜在故障点。
- 稳定性验证不足:提供一套系统化的方法验证系统容错能力,避免盲目自信。
- 复杂系统管理困难:帮助理解复杂系统的行为,制定有效的稳定性保障策略。
- 故障演练无章法:介绍混沌工程原则,指导如何安全、可控地实施实验。
- 高可用架构设计:学习Netflix的实践经验,设计更具弹性的微服务架构。
- 运维工程师:负责系统稳定性,需要掌握混沌工程方法和工具。
- 软件架构师:设计高可用微服务架构,需要了解如何验证系统弹性。
- 研发工程师:编写健壮的代码,需要理解系统故障模式。
- 测试工程师:希望扩展测试手段,通过混沌实验发现深层问题。
- 技术管理者:推动团队建立稳定性文化,需要了解混沌工程价值。
- 理解原则:重点阅读第3-5章,掌握混沌工程的核心原则。
- 学习案例:第8章Netflix实践案例,了解如何落地。
- 工具实践:第9章介绍常用工具,选择适合团队的进行尝试。
- 从小范围开始:先在测试环境实施实验,逐步扩大范围。
- 结合组织文化:第10章讨论组织文化,推动稳定性意识。
- 理解混沌工程:掌握混沌工程的定义、原则和价值。
- 掌握实验方法:学会建立稳定状态假设、设计实验和最小化爆炸半径。
- 提升系统稳定性:能够主动发现并修复系统脆弱点。
- 借鉴Netflix经验:了解Netflix的混沌工程实践和工具。
- 推动组织变革:在团队中推广混沌工程文化。
- 设计高可用架构:将混沌工程思想融入架构设计。
📖 书籍简介
产品特色

编辑推荐
√混沌工程是对系统的容错设计进行验证,保障系统稳定性的新方法!
√本书系统地介绍了混沌工程的演进及实践原则,帮助读者理解其设计思想;
√来自混沌工程概念的提出者与实践者Netflix工程师的官方一手资料;
√国内混沌工程的早期实践者与推动者中亭作序审校;
√本书对英文原版中一些较难理解的词句进行了优化,并对专业术语等做了详细注解。
内容简介
在一个由很多微服务组成的分布式系统中,我们永远难以全面掌握发生什么事件会导致系统局部不可用,甚至全面崩溃。但我们却可以尽可能地在这些不可用的情况发生之前找出系统中的脆弱点。本书介绍了Netflix 的工程师团队是如何根据多年实践经验主动发现系统中脆弱点的一整套方法。这套方法现在已经逐渐演变成计算机科学的一门新兴学科,即“混沌工程”。通过一系列可控的实验和执行实验的原则,混沌工程将揭示出分布式系统中随时发生的各类事件是如何逐步导致系统整体不可用的。
本书既适合研发、测试人员用来了解如何构建健壮的系统,也适合软件架构师用来了解设计创建高可用微服务体系的前沿方法,同时更适合在大型互联网或技术组织中专门负责系统稳定性的工程团队阅读。
作者简介
译者介绍
侯杰,美利金融集团技术副总裁,TGO鲲鹏会会员,毕业于南京大学;曾就职于IBM中国、IBM澳大利亚和iClick(爱点击);在多个行业的大型组织机构中负责过研发和管理工作,拥有十多年大规模分布式信息系统的设计、研发和实施经验。
技术审校者
周洋,花名中亭,阿里巴巴高可用架构团队高级技术专家,混沌工程布道师,开源项目ChaosBlade发起人。具有多年高可用保障、产品研发和系统架构经验,曾担任2015年*十一稳定性负责人。目前负责高可用技术云化输出,并担任应用高可用服务(AHAS)及集团突袭演练负责人。
精彩书评
“O’Reilly Radar博客有口皆碑。”
——Wired
“O’Reilly凭借一系列(真希望当初我也想到了)非凡想法建立了数百万美元的业务。”
——Business 2.0
“O’Reilly Conference是聚集关键思想领袖的绝对典范。”
——CRN
“一本O’Reilly的书就代表一个有用、有前途、需要学习的主题。”
——Irish Times
“Tim是位特立独行的商人,他不光放眼于*长远、*广阔的视野并且切实地按照Yogi Berra的建议去做了:‘如果你在路上遇到岔路口,走小路(岔路)。’回顾过去,Tim似乎每一次都选择了小路,而且有几次都是一闪即逝的机会,尽管大路也不错。”
——Linux Journal
📑 章节目录
- 为什么需要混沌工程
- 管理复杂性
- 建立稳定状态的假设
- 用多样的现实世界事件做验证
- 在生产环境中运行实验
- 自动化实验
- 最小化爆炸半径
- 混沌工程实践案例
- 工具与平台
- 组织与文化
- 未来展望