SIGNAL ONLINE 系统性偏差 SYSTEMATIC BIAS // 精确地错

系统性偏差

SYSTEMATIC BIAS // 精确地错

> 随机误差是散,系统偏差是整体挪——弹着点散成一团还能靠多发平均找靶心;弹着点密集地偏离靶心,打再多发也只是更精确地错。这就是 1936 年《文学文摘》的墓志铭:240 万样本、统计边际小到 ±0.01 个百分点,预测却错 20 个百分点输掉整场大选——同一天,Gallup 用 5 万样本方向正确。样本量只救精度,不救正确性;MSE = 偏差² + 方差 写明了这笔账。仪器没校准、抽样框漏人、问卷诱导、观察者在场——都不需要任何人的恶意,只需要一个方向一致的错。

SUBJECT: 统计学 · 测量误差 FILE: cards/systematic-bias SINCE: 测量学传统 / 1936 标志案例 BUILD v1.0

Principle — 原理与来源

系统性偏差 SYSTEMATIC ERROR // 与随机误差的两分法
样本量救精度,不救正确性
MSE = 偏差² + σ²/n (n→∞ 时只剩 偏差²)
随机误差随 1/√n 消失;系统误差纹丝不动——它不在那一项里。

两分法:测量误差分两族——随机误差(random error):无方向、不可重复、多发平均后趋零,决定精度(precision);系统误差(systematic error / bias):同向、可重复、平均多少次都不动,决定正确性(accuracy)。两者组合出靶盘四象限:又准又稳(理想)/ 准而不稳(可救:加样本)/ 稳而不准(最危险:数字极可信但整体是错的) / 双差。

三大来源(流行病学标准分类):选择偏差——谁进了样本(抽样框遗漏、自愿参与、失访差异);② 信息偏差——怎么测的(回忆偏差、仪器未校准、错分;观察者悖论是它的子类:被观察本身改变了测量值);③ 混杂——第三变量把效应搅在一起(严格说这是解释错误而非测量错误,三大类是实用分类,不是数学完备划分)。

标志案例(1936 美国大选):《文学文摘》(Literary Digest)寄出约 1000 万份问卷(电话簿+车主+订阅名单),回收 240 万份,预测 Landon 57% 胜——实际 Roosevelt 61% 大胜,错约 20pp。双重系统偏差:抽样框偏向富人(大萧条时期电话/汽车持有者更共和党)+ 非回复偏差(仅 24% 回收,反罗斯福者更愿寄回)。同场 Gallup 用约 5 万配额样本方向正确——甚至提前用 3000 份"样本的样本"预言了 Digest 的翻车。240 万输给 5 万,这一晚确立了现代抽样调查。

对策在设计期,不在分析期:随机化(分配不可预测)、盲法(测量者不知组别)、配对/分层(压混杂)、金标准校准(仪器与标注都比对真值)、以及审数据谱系——先问怎么收集的,再谈怎么分析。事后"修正偏差"几乎总是补丁摞补丁。

正名:"系统性偏差"(systematic error,测量/统计概念)≠ "制度性偏差"(systemic bias,结构性不公)——英文二者也常被混用,中文语境更糊;统计文献用前者。 ② "大样本能消除误差"是最危险的误解——n 只压缩 σ/√n 那一项,偏差地板纹丝不动;样本越大,错得越自信(Digest 的置信区间 ±0.01pp,错误 20pp)。 ③ "偏差源于人的恶意"是讹传——校准缺失、抽样框遗漏、编码错分、观察者在场,全是设计缺陷而非道德问题;对策是修流程不是抓坏人。 ④ Digest 翻车的流行归因被简化了——常被说成"错在富人抽样框";Squire 1988 复检发现该样本框在 1936 年本可正确预测(电话普及已扩散),非回复偏差才是主凶——双重系统偏差,主次常被讲反。 ⑤ 精确 ≠ 准确——高精度+有偏差是"最可信的错"(小数点后两位的自信);报告里只给 p 值和置信区间、不谈偏差来源,就是把精度当正确性卖。 ⑥ 三大类分类不是教条——混杂在严格意义上是"效应混合"的解释错误而非测量误差(Oxford 方法学教材的 nuance);教科书三分法是实用工具箱,不是数学定理。

Apply — 用在哪里

实验设计随机分组、盲法、预注册——设计期杀偏;跑完再"控制变量"是分析期打补丁,混杂一旦混进数据就剥不干净。A/B 测试同理:先审分流器,再看 p 值。
度量与仪器代码扫描规则偏严/偏松、日志丢失率随高峰漂移、时钟不同步——度量工具自身的系统偏差要用金标准对照校准;指标突然整体漂移先怀疑偏移,不是噪声。
数据分析拿到数据第一问是"怎么收集的"(数据谱系):谁被漏了、谁更愿意回答、测量的定义变过没有——幸存者、观察者、非回复,全是选择/信息偏差的皮肤。
模型与 AI训练数据的历史偏见被模型学习并放大——数据里的系统偏差不是噪声,加数据量只会学得更像;需要的是重加权、重采样、公平性约束这些设计期干预。
个人决策信息源同温层=认知版抽样框偏差——交叉验证要选"偏差方向不同"的源,而不是同源多看几遍(那是加 n 不减 b);对立面读一份,胜过同侧读十份。

Simulate — 靶盘四象限 × 样本量失效实验

双视角实验室 // 打靶看两类误差;样本量曲线撞上偏差地板
视角 A:靶盘射击——偏移(系统)与散布(随机)独立调节,四象限随手可造;视角 B:n 从 16 拉到 240 万,看随机误差塌缩而总误差停在偏差地板
弹着(随机+偏移) 平均弹着点 × 偏移向量 │ 靶心 = 真值

Personal Takeaways — 个人启示 · 03

01

先问偏不偏,再问准不准

看到一个精确到小数点后两位的结论,第一反应不该是佩服,而是追问偏差从哪来——样本怎么抽的、仪器校过没有、谁有动机不说真话。精度是算出来的,正确性是设计出来的;前者会自己变好,后者不会。

02

重复得不到新信息

同一个方法测一百次、同一类来源读一百篇,压掉的都是随机项,系统项原样保留——这就是"加数据不等于加证据"。真正的新信息来自换方法、换仪器、换偏差方向的源:一次异源交叉,胜过十次同源重复。

03

最贵的错误穿着高精度的外衣

散乱的错容易被发现(看起来就不靠谱),精确的错最难察觉——数字稳定、可复现、有置信区间,团队会基于它铺路。定期做金标准对照(拿少量"真值"审计度量链),就是给整套测量系统拍 X 光。