一篇报道
故事是这样的。
2022 年 7 月,界面新闻发过一篇写字节教育业务的报道1,英文标题我翻一下,大数据给字节创造过奇迹,现在它成了诅咒。
里面讲的事是这样的。字节在教育上投了大概一万人,做了二十来款教育 App。做法跟做抖音一样,数据驱动,快速迭代,OKR 周期很短,隔一阵就要拿数据过一次评审。
有一个叫 Aixue 的产品,做的是 AI 生成定制题库,卖给学校。报道里的说法是,这个团队从来没有足够的时间在下一次 OKR 评审之前签下足够多的学校来做 AB 测试。
你把这句话放到前五课的框架里看,它每一个字都对得上。
第 1 课讲,实验需要够多的用户随机切两半。教育产品的用户是学校,签一个学校要几个月,你没有「够多」。第 1 课还讲,要等一段时间看那个数。教学效果要一个学期才看得出来,但 OKR 评审隔一阵就来一次,你没有「等」。第 3 课讲,判官要代表长期目标。学习效果怎么量化?报道里的说法是,公司没法量化「社区活力」「内容质量」这种东西,于是员工倾向于挑容易量化的、肤浅的任务去做。
还有一句更直接的,一个前员工说,高级管理者也不知道自己在做什么。
我读到这篇的时候,说实话,有点被震到。不是因为字节犯了错,是因为这个错太工整了。它不是方法用错了,是同一套方法原封不动搬到了一个它的三个前提都不成立的地方。
三个前提
用户够多,反馈周期够短,结果能量化。抖音三样全有,一天几亿人打开,划一下就是一次反馈,看了多久点没点赞全是数。教育三样全没有。同一把尺子,在抖音量得又快又准,在教育量出来的全是噪音,而且噪音还会被拿去过 OKR。
这件事,能不能靠 AB 拍板
拖三个滑杆,把你手头的一个决策放进来。右边告诉你第一次能看出结果大概要多久,以及该不该拿 AB 当判官。
2023 年 2 月,字节 CEO 梁汝波发了封内部信,把双月 OKR 改成了季度2。媒体报道的解读是,双月的数据驱动考核周期给员工带来了不安全感。这个只能算旁证,信本身没提 AB 测试,但方向是一致的,把节奏放慢一点。
一线懂不懂,三层答案
好,回到你问的那个问题,字节一线业务人员懂不懂 AB 测试。前五课下来,我的答案是三层。
我觉得第三层才是这整套课真正想讲的东西。
再绕回第 5 课那个故事。抖音取名,数据说第二,人选了它。那群产品经理做对的事,恰恰是第三层,他们知道下载量这把尺子量不到「长期认知」,所以他们没有让尺子替他们做决定。而教育那条线做错的,也恰恰是第三层,学习效果这把尺子根本还没造出来,就已经拿着数据在过 OKR 了。
同一家公司,同一套平台,同一批方法。差别全在人懂不懂边界。
回到第 1 课那把尺子
第 1 课我说,对照组是尺子,不是凑数的。现在我想把这句话补完。
尺子量不到的东西,不是不存在。
下面三个决策,哪个最不该靠 AB 测试拍板?
B。它三个前提都缺,用户少、周期长、结果难量化。A 和 C 都是抖音式的决策,用户多反馈快,正是 AB 的主场。这不是说 B 就不该做决策,是说 B 的决策得靠别的东西,访谈、小范围试点、专业判断,而且要承认它比 A 和 C 更没把握。
六课压成一段话。AB 测试是把同一时间来的用户随机切两半、只改一件事、比一个数、问这个差是不是运气。十个想法一个赢,所以它的大头是拦输家,顺带把「谁说了算」从级别变成数据。赢要看对判官、守住护栏,小胜会累加成复利,但每个实验自报的赢加起来一定比真实多。字节把这套东西做成了平台,分层正交让几万个实验同时跑,门槛压到运营自己能开,于是一线人员几乎一定在用。但抖音这个名字是第二名,教育业务是反面教材,这两件事讲的是同一个道理,数据给排名,人做决定,而人真正要懂的,不是显著性怎么算,是这把尺子量不到什么。
第 1 课对照组 · 随机分流 · 显著性
第 2 课胜率 · HiPPO
第 3 课OEC · 护栏 · holdout · 新奇效应 · Twyman
第 4 课分层 · 互斥 · 正交 · Libra
第 5 课万物皆可 AB
第 6 课三个前提
这一课的数字从哪来
- 字节教育业务约 1 万人、约 20 款应用、OKR 短周期评审、Aixue 团队来不及在评审前签够学校做 AB、无法量化「社区活力」「内容质量」、前员工「高级管理者也不知道自己在做什么」:界面新闻 2022-07-04,单一来源的深度报道,正文已写明「报道里的说法」。
- 梁汝波 2023 年 2 月内部信双月 OKR 改季度、双月考核带来不安全感的解读:腾讯新闻 2023-02-22。
- 「用户够多 / 反馈够短 / 结果能量化」三前提是从第 1、3 课原理归纳的教学框架,不是字节或 Kohavi 的原话。「三层答案」是对全课证据的判断,正文已逐层说明强弱。动手块里的时间估算是示意。
六课讲完了。想再看一遍整条线,回目录。