跳到主要内容

常见陷阱

陷阱 1:自由度总是忘记减 1

问题描述: 在卡方拟合优度检验中,学生常将自由度写为 kk 而非 k1k-1(或 k1pk-1-p)。

后果: 查表得到错误的临界值,可能导致错误拒绝 H0H_0。MS 会扣 B1

解决方案: 时刻自问:"我一共有几个类别?有没有从数据中估计参数?"

df=(类别数)1(估计参数个数)\text{df} = (\text{类别数}) - 1 - (\text{估计参数个数})

陷阱 2:单尾与双尾检验的选择错误

问题描述:

  • H1:μμ0H_1: \mu \neq \mu_0(双尾)与 H1:μ>μ0H_1: \mu > \mu_0(单尾)的临界值不同
  • 双尾检验在 5% 显著性水平下,每尾各 2.5%

后果: 使用了错误的临界值,导致结论错误。

题目表述H1H_1检验类型
"test if there is a difference"\neq双尾
"test if it has increased/greater">>单尾(上尾)
"test if it has decreased/less"<<单尾(下尾)

陷阱 3:配对数据与独立数据混淆

问题描述: 面对配对数据(同一组人前后测、双胞胎、左右眼等)时错误使用独立双样本 t 检验而非配对 t 检验。

后果: 自由度错误(2n22n-2 而非 n1n-1),标准误计算错误,pp 值错误。

判断标准:

  • 配对设计:数据天然成对,两组之间不是独立的(同一人或匹配对象)
  • 独立设计:两组之间无任何关联

陷阱 4:合并方差公式记错

问题描述: 记忆 sp2s_p^2 公式时出错,如写成 sp2=s12+s222s_p^2 = \frac{s_1^2+s_2^2}{2}

后果: 检验统计量计算错误,失去 M1A1

解决方案: 记忆公式时注意这是加权平均,权重是自由度:

sp2=(n11)s12+(n21)s22n1+n22s_p^2 = \frac{(n_1-1)s_1^2 + (n_2-1)s_2^2}{n_1+n_2-2}

陷阱 5:连续性校正忘记使用

问题描述:2×22 \times 2 列联表卡方检验中未使用 Yates 连续性校正。

后果: 卡方统计量偏大,更易拒绝 H0H_0。MS 会扣 B1

χcorrected2=(OiEi0.5)2Ei\chi^2_{\text{corrected}} = \sum \frac{(|O_i - E_i| - 0.5)^2}{E_i}

常见陷阱

仅在 2×22\times 2 列联表中必须使用 Yates 校正。如果行或列数大于 2,则不需要连续性校正。

陷阱 6:期望频数小于 5 时未合并

问题描述: 卡方检验中保留期望频数 E<5E<5 的类别未合并。

后果: χ2\chi^2 统计量不服从 χ2\chi^2 分布,检验无效。MS 会扣 M1

解决方案:

  • 计算所有期望频数
  • E<5E<5 的格子超过总格数的 20%,合并相邻类别
  • 合并后重新计算自由度和 χ2\chi^2

陷阱 7:Wilcoxon 符号秩检验中符号与秩对应错误

问题描述: 计算 Wilcoxon 符号秩检验时,正确排序了绝对值,但将正负号赋予错误的秩。

后果: T+T^+TT^- 计算错误,统计量错误。

解决方案:

  1. 计算差值 did_i
  2. 取绝对值 di|d_i|
  3. 忽略符号对绝对值排序(从小到大)
  4. 将原始符号重新赋予排序后的秩
  5. 分别求和

陷阱 8:正态近似中忘记连续性校正

问题描述: 大样本非参数检验使用正态近似时,未加 0.5 的连续性校正。

后果: ZZ 统计量偏大,可能导致错误拒绝 H0H_0

Wilcoxon 符号秩: Z=Tn(n+1)40.5n(n+1)(2n+1)24Z = \frac{T - \frac{n(n+1)}{4} - 0.5}{\sqrt{\frac{n(n+1)(2n+1)}{24}}}

Mann-Whitney: Z=Un1n220.5n1n2(n1+n2+1)12Z = \frac{U - \frac{n_1 n_2}{2} - 0.5}{\sqrt{\frac{n_1 n_2 (n_1+n_2+1)}{12}}}

(分子减 0.5 适用于 TTUU 小于期望值的情况;若大于期望值则加 0.5)

陷阱 9:PGF 方差公式遗漏 GX(1)G_X'(1)

问题描述: 计算 Var(X)\operatorname{Var}(X) 时错误地使用 GX(1)[GX(1)]2G_X''(1) - [G_X'(1)]^2

后果: 方差计算结果错误。

正确公式: Var(X)=GX(1)+GX(1)[GX(1)]2\operatorname{Var}(X) = G_X''(1) + G_X'(1) - [G_X'(1)]^2

原因是 Var(X)=E(X2)[E(X)]2\operatorname{Var}(X) = E(X^2) - [E(X)]^2,而 E(X2)=GX(1)+GX(1)E(X^2) = G_X''(1) + G_X'(1)

陷阱 10:随机和公式错用为独立和

问题描述: 面对随机和 SN=X1+X2++XNS_N = X_1 + X_2 + \cdots + X_NNN 是随机变量),使用 GSN(t)=[GX(t)]NG_{S_N}(t) = [G_X(t)]^{N},而非 GSN(t)=GN(GX(t))G_{S_N}(t) = G_N(G_X(t))

后果: 整个 PGF 错误,后续求期望方差全错。

区分记忆:

  • 独立和(固定个数 nn):GX1++Xn(t)=[GX(t)]nG_{X_1+\cdots+X_n}(t) = [G_X(t)]^n
  • 随机和(个数 NN 随机):GSN(t)=GN(GX(t))G_{S_N}(t) = G_N(G_X(t))

陷阱 11:CRV 分段函数积分限错误

问题描述: PDF 为分段函数,求期望或概率时漏掉某一段的积分或用了错误的积分限。

后果: 计算错误,失去 A1

解决方案:

  1. 画出 PDF 的定义域示意
  2. 分段积分时清晰标出每段的积分区间
  3. 最后求和

陷阱 12:置信区间误解为 "95% probability"

问题描述: 将 95% 置信区间解释为 "总体参数有 95% 的概率落在该区间内"。

后果: 统计学概念错误,在 MS 中会扣解释分。

正确解释: "如果重复抽样多次,每次构造一个 CI,约 95% 的 CI 会包含真实的总体参数。"(置信水平是针对方法而言的,不是针对参数)

陷阱 13:pp 值含义误解

问题描述: 认为 pp 值是 H0H_0 为真的概率。

后果: 统计概念错误。

正确解释: pp 值是在 H0H_0 成立的假设下,观察到当前或更极端结果的概率。pp 值越小,证据越强地支持拒绝 H0H_0

陷阱 14:符号检验中零差值的处理

问题描述: 符号检验中有零差值(差值 = 0)时,将其计入样本量。

后果: 样本量偏大,临界值可能错误。

正确做法: 零差值从样本中剔除,仅对非零差值计算正负号个数。样本量 nn 仅计非零差值个数。

陷阱 15:CDF 在边界点的值

问题描述: 写 CDF 时忘记 F(x)=0F(x) = 0xx 小于定义域下界,F(x)=1F(x) = 1xx 大于定义域上界。

正确 CDF 写法:

0 & x < 0 \\ x^2 & 0 \le x \le 1 \\ 1 & x > 1 \end{cases}$$ ## 陷阱 16:PGF 求 $P(X=x)$ 时忘记除以 $x!$ $$P(X=x) = \frac{G_X^{(x)}(0)}{x!} \quad \text{而不是} \quad G_X^{(x)}(0)$$ ## 陷阱 17:列联表期望频数行列搞反 $$E_{ij} = \frac{R_i \times C_j}{n}$$ 注意 $R_i$ 是**第 $i$ 行的合计**,$C_j$ 是**第 $j$ 列的合计**。行列位置不要颠倒。 ## 陷阱 18:$t$ 检验假设条件未检查 t 检验的前提条件: - 数据近似正态分布(小样本时尤为重要) - 样本相互独立 - 双样本 t 检验还要求两总体方差相等(方差齐性) 若不满足,应考虑非参数检验。