- 决策缺乏数据支撑:教会读者如何通过可信赖的线上对照实验获取因果证据,用数据驱动产品和业务决策。
- 实验结果不可信:深入分析特威曼定律、辛普森悖论等统计陷阱,帮助读者识别和避免实验中的常见错误。
- 实验平台搭建困难:系统介绍实验平台的基础设施、工具化日志记录、随机化单元选择等工程实现方案。
- 指标设计不合理:讲解机构指标的分类、制定原则和OEC综合评估标准,帮助设计科学合理的实验指标体系。
- 规模化实验难管理:分享谷歌、领英、微软每年运行两万多个实验的实践经验,解决实验放量和规模化分析的挑战。
★★★
中级
入门初级中级进阶高级
- 数据科学家与分析师:需要设计和分析A/B测试,本书提供了从统计原理到工程实现的完整方法论。
- 产品经理与运营人员:希望通过实验驱动产品迭代,本书帮助理解实验设计逻辑和结果解读方法。
- 软件工程师与架构师:需要搭建实验平台或参与实验系统开发,书中的工程实践和平台搭建内容直接适用。
- 技术管理者与决策者:希望推动组织建立数据驱动文化,本书的实验成熟度模型和文化建设经验具有重要参考价值。
- 从概览和案例入手:第1至4章是全书基础,建议先通读以建立对线上对照实验的整体认知。
- 重点研读统计原理:第3章和第17章的统计学知识是理解实验结果可信度的关键,建议反复阅读并配合实际数据练习。
- 根据角色选读:产品人员重点读指标和OEC章节,工程师重点读平台搭建章节,管理者重点读实验文化和伦理章节。
- 结合实际实验对照:每读完一个专题,回顾自己公司或团队的实验流程,找出改进点并逐步优化。
- 实验设计能力:掌握从假设提出、实验设计、运行到分析的完整流程,能够独立设计可信赖的线上对照实验。
- 统计素养提升:理解p值、置信区间、辛普森悖论等统计概念,能够正确解读实验结果避免误判。
- 指标体系构建:学会制定机构指标和OEC综合评估标准,建立科学的产品和业务度量体系。
- 平台搭建知识:了解实验平台的基础设施需求、客户端实验方案和规模化分析架构。
- 数据驱动文化:理解如何在组织中推广实验文化,建立从数据到决策的科学流程。
📖 书籍简介
| 书名: | 关键迭代:可信赖的线上对照实验|8079821 |
| 图书定价: | 99元 |
| 图书作者: | [美] 罗恩·科哈维(Ron Kohavi) 黛安·唐(Diane Tang) 许亚(Ya Xu) |
| 出版社: | 机械工业出版社 |
| 出版日期: | 2021/4/9 0:00:00 |
| ISBN号: | 9787111678809 |
| 开本: | 16开 |
| 页数: | 293 |
| 版次: | 1-1 |
| 内容简介 |
| 由谷歌(Google)、领英(LinkedIn)和微软(Microsoft)的实验领导者编写的这本实用指南将教你如何使用可信赖的线上对照实验(也就是A/B测试)来加速创新。根据每年每个公司运行的两万多个对照实验的实践经验,作者为准备着手运行实验的学生和行业的专业人员分享了一些实例、需要避免的陷阱以及建议,并为希望改善自身及其机构做出数据驱动决策方式的高级从业者深入探讨了进阶专题。 |
| 目录 |
本书赞誉 译者序 前言——如何阅读本书 致谢 第一部分 线上对照实验概览 第1章 概述和写作动机003 1.1 线上对照实验的术语005 1.2 为什么进行实验?相关性、因果关系和可信赖度008 1.3 有效运行对照实验的必要元素010 1.4 宗旨011 1.5 随时间推移的改进013 1.6 有趣的线上对照实验实例015 1.7 战略、战术及它们和实验的关系020 1.8 补充阅读 023 第2章 运行和分析实验——一个全程剖析的案例025 2.1 设立实验025 2.2 假设检验:确立统计显著性028 2.3 设计实验030 2.4 运行实验并获得数据032 2.5 分析结果033 2.6 从结果到决策034 第3章 特威曼定律与实验的可信赖度037 3.1 曲解统计结果038 3.2 置信区间041 3.3 对内部有效性的威胁041 3.4 对外部有效性的威胁046 3.5 细分群的差异049 3.6 辛普森悖论 052 3.7 鼓励健康的怀疑态度054 第4章 实验平台和文化055 4.1 实验成熟度模型055 4.2 基础设施和工具062 第二部分 基础原理 第5章 速度很重要:一个全程案例剖析075 5.1 关键假设:局部线性近似077 5.2 如何测量网站的性能078 5.3 减速实验的设计080 5.4 对不同页面元素的影响是不同的081 5.5 极端结果083 第6章 机构指标085 6.1 指标的分类086 6.2 指标的制定:原则和技术089 6.3 指标的评估091 6.4 指标的演变092 6.5 更多的资源093 6.6 补充材料:护栏指标093 6.7 补充材料:可操纵性095 第7章 实验指标和综合评估标准097 7.1 从业务指标到适用于实验的指标098 7.2 将关键指标组合成一个OEC099 7.3 案例:亚马逊电子邮件的OEC101 7.4 案例:必应搜索引擎的OEC103 7.5 Goodhart法则、Campbell法则以及Lucas批判104 第8章 机构的经验传承与统合分析107 8.1 什么是机构的经验传承107 8.2 为什么机构的经验传承有用108 第9章 对照实验中的伦理111 9.1 背景111 9.2 数据收集116 9.3 文化与流程117 9.4 补充材料:用户标识符117 第三部分 补充及替代技法 第10章 补充技法121 10.1 补充技法的空间121 10.2 基于日志的分析122 10.3 人工评估124 10.4 用户体验调研125 10.5 焦点小组125 10.6 问卷调查126 10.7 外部数据127 10.8 总结129 第11章 观察性因果研究131 11.1 对照实验不可行的情况131 11.2 观察性因果研究的设计133 11.3 陷阱138 11.4 补充材料:被驳斥的观察性因果研究141 第四部分 实验平台搭建 第12章 客户端实验145 12.1 服务器端和客户端的差异145 12.2 对实验的潜在影响148 12.3 结论152 第13章 工具化日志记录153 13.1 客户端与服务器端的工具化日志记录153 13.2 处理多源的日志155 13.3 工具化日志记录的文化156 第14章 选择随机化单元157 14.1 随机化单元和分析单元159 14.2 用户级别的随机化160 第15章 实验放量:权衡速度、质量与风险163 15.1 什么是放量163 15.2 SQR放量框架164 15.3 四个放量阶段165 15.4 最终放量之后168 第16章 规模化实验分析169 16.1 数据处理169 16.2 数据计算170 16.3 结果汇总和可视化172 第五部分 实验分析 第17章 线上对照实验中的统计学知识177 17.1 双样本t检验177 17.2 p值和置信区间178 17.3 正态性假设179 17.4 第一/二型错误和统计功效181 17.5 偏差183 17.6 多重检验183 17.7 费舍尔统合分析184 第18章 方差估计和提高灵敏度:陷阱及解决方法185 18.1 常见陷阱186 18.2 提高灵敏度189 18.3 其他统计量的方差190 第19章 A/A测试193 19.1 为什么运行A/A测试193 19.2 如何运行A/A测试198 19.3 A/A测试失败时199 第20章 以触发来提高实验灵敏度201 20.1 触发示例201 20.2 数值示例204 20.3 最佳的和保守的触发205 20.4 总体实验效应206 20.5 可信赖的触发207 20.6 常见的陷阱207 20.7 开放性问题209 第21章 样本比率不匹配与其他可信度相关的护栏指标211 21.1 样本比率不匹配212 21.2 调试SRM214 第22章 实验变体之间的泄露和干扰219 22.1 示例220 22.2 一些实际的解决方案223 22.3 检测和监控干扰227 第23章 测量实验的长期效应229 23.1 什么是长期效应229 23.2 短期效应和长期效应可能不同的原因230 23.3 为什么要测量长期效应232 23.4 长期运行的实验233 23.5 长期运行实验的替代方法235 参考文献241 索引261 |
| 编辑推荐 |
| 关键迭代 可信赖的线上对照实验 TRUSTWORTHY ONLINE CONTROLLED EXPERIMENTS A Practical Guide to A/B Testing [美]?罗恩·科哈维(Ron Kohavi) 黛安·唐(Diane Tang) 著 许亚(Ya Xu) 韩玮 胡鹃娟 等译 硅谷创业教父 ?Steve Blank 微软前执行副总裁?沈向洋 脸书前首席技术官?Adam D''Angelo 谷歌高级院士?Jeff Dean 等37位专家 联/袂/推/荐 微软、亚马逊、谷歌和领英等公司 互联网产品成功的秘诀! |
📑 章节目录
- 线上对照实验概述:术语、动机与有效元素
- 运行和分析实验:全程案例剖析
- 特威曼定律与实验的可信赖度
- 实验平台和文化:成熟度模型与基础设施
- 速度很重要:性能实验案例剖析
- 机构指标:分类、制定与评估
- 实验指标和综合评估标准(OEC)
- 机构的经验传承与统合分析
- 对照实验中的伦理问题
- 补充技法与观察性因果研究
- 实验平台搭建:客户端实验与日志记录
- 规模化实验分析与实验放量策略