系统性偏差
SYSTEMATIC BIAS // 精确地错
> 随机误差是散,系统偏差是整体挪——弹着点散成一团还能靠多发平均找靶心;弹着点密集地偏离靶心,打再多发也只是更精确地错。这就是 1936 年《文学文摘》的墓志铭:240 万样本、统计边际小到 ±0.01 个百分点,预测却错 20 个百分点输掉整场大选——同一天,Gallup 用 5 万样本方向正确。样本量只救精度,不救正确性;MSE = 偏差² + 方差 写明了这笔账。仪器没校准、抽样框漏人、问卷诱导、观察者在场——都不需要任何人的恶意,只需要一个方向一致的错。
Principle — 原理与来源
两分法:测量误差分两族——随机误差(random error):无方向、不可重复、多发平均后趋零,决定精度(precision);系统误差(systematic error / bias):同向、可重复、平均多少次都不动,决定正确性(accuracy)。两者组合出靶盘四象限:又准又稳(理想)/ 准而不稳(可救:加样本)/ 稳而不准(最危险:数字极可信但整体是错的) / 双差。
三大来源(流行病学标准分类):① 选择偏差——谁进了样本(抽样框遗漏、自愿参与、失访差异);② 信息偏差——怎么测的(回忆偏差、仪器未校准、错分;观察者悖论是它的子类:被观察本身改变了测量值);③ 混杂——第三变量把效应搅在一起(严格说这是解释错误而非测量错误,三大类是实用分类,不是数学完备划分)。
标志案例(1936 美国大选):《文学文摘》(Literary Digest)寄出约 1000 万份问卷(电话簿+车主+订阅名单),回收 240 万份,预测 Landon 57% 胜——实际 Roosevelt 61% 大胜,错约 20pp。双重系统偏差:抽样框偏向富人(大萧条时期电话/汽车持有者更共和党)+ 非回复偏差(仅 24% 回收,反罗斯福者更愿寄回)。同场 Gallup 用约 5 万配额样本方向正确——甚至提前用 3000 份"样本的样本"预言了 Digest 的翻车。240 万输给 5 万,这一晚确立了现代抽样调查。
对策在设计期,不在分析期:随机化(分配不可预测)、盲法(测量者不知组别)、配对/分层(压混杂)、金标准校准(仪器与标注都比对真值)、以及审数据谱系——先问怎么收集的,再谈怎么分析。事后"修正偏差"几乎总是补丁摞补丁。
Apply — 用在哪里
Simulate — 靶盘四象限 × 样本量失效实验
Personal Takeaways — 个人启示 · 03
先问偏不偏,再问准不准
看到一个精确到小数点后两位的结论,第一反应不该是佩服,而是追问偏差从哪来——样本怎么抽的、仪器校过没有、谁有动机不说真话。精度是算出来的,正确性是设计出来的;前者会自己变好,后者不会。
重复得不到新信息
同一个方法测一百次、同一类来源读一百篇,压掉的都是随机项,系统项原样保留——这就是"加数据不等于加证据"。真正的新信息来自换方法、换仪器、换偏差方向的源:一次异源交叉,胜过十次同源重复。
最贵的错误穿着高精度的外衣
散乱的错容易被发现(看起来就不靠谱),精确的错最难察觉——数字稳定、可复现、有置信区间,团队会基于它铺路。定期做金标准对照(拿少量"真值"审计度量链),就是给整套测量系统拍 X 光。