原理
如果测量值是某个粒度 g 的倍数(问卷计分、量表分、计数等通常是整数, 即 g=1),那么样本量 n 的真实总和必然也是 g 的整数倍。 论文报告的均值保留 d 位小数,意味着真实均值落在 M ± 0.5×10⁻ᵈ 之间——于是真实总和必然落在 n × (M − 0.5×10⁻ᵈ) 到 n × (M + 0.5×10⁻ᵈ) 之间。
如果这个区间内不存在任何 g 的整数倍,那么无论参与者给出什么数据, 都不可能得到这个均值——均值、样本量或小数位数中至少有一个是错的。
一个例子
某论文报告:n = 20,均值 M = 3.42(整数计分)。
- 均值的舍入容差:±0.005
- 可行总和区间:20 × (3.415, 3.425) = (68.30, 68.50)
- 该区间内没有整数——GRIM 不自洽:20 个整数之和只能是整数,68.3–68.5 之间无整数。
而若报告 M = 3.45:区间为 (68.90, 69.10),包含整数 69 → 自洽。
适用前提
- 测量值为给定粒度的倍数(整数计分/量表/计数最常见)
- n 是最终纳入计算的样本量(剔样后需用剔除后的 n)
- 均值为算术平均,而非中位数或几何均值
- 对连续物理测量(粒度远小于报告精度)不适用
GRIM 检出异常说明什么?
GRIM 指出的是数学不自洽,不是造假实锤。可能的原因包括: 数据捏造、事后剔除样本未更新 n、笔误、非标准舍入、或者你猜错了测量粒度。 它在学术上的定位是「值得追问的线索」——配合末位数字分析、Benford 定律等 统计指纹方法交叉使用,才有筛查价值。
方法出处
Brown NJL, Heathers JAJ (2017). The GRIM Test: A Simple Technique Detects Numerous Anomalies in the Reporting of Results in Psychology. Social Psychological and Personality Science, 8(4), 363–369.
相关方法:GRIMMER(检验 SD 的自洽性)、SPRITE(从汇总统计量重建可能的数据集)、 statcheck(重算报告的 p 值)。
⚠️ 重要:GRIM 与本站所有方法均为「辅助筛查」,任何单一异常都不足以判定数据造假。 最终判断应由具备资质的机构按正当程序做出。