如何解读你的 t 检验结果
本计算器采用常规的双侧显著性阈值 α = 0.05,这是科研中最常用的默认值。
| 双侧 p 值 | α = 0.05 下的结论 |
|---|---|
| p < 0.05 | 具有统计学显著性 — 拒绝“无差异”的原假设 |
| p ≥ 0.05 | 不具有统计学显著性 — 不能拒绝原假设 |
- 统计学显著性不等同于实际重要性:只要样本足够大,即便是一个微小、在实际中毫无意义的差异,也可能得出低于 0.05 的 p 值。
- 这里使用的双样本检验是 Welch t 检验,它不假设两组方差相等;结果可能与使用经典合并方差(Student)t 检验的工具略有不同。
- t 检验假设样本数据是独立观测,且均值的抽样分布近似正态——这一点既可以通过原始数据本身大致正态来满足,也可以通过中心极限定理,在样本量足够大时得到满足。
- 这是一个基于汇总统计量的计算器:它使用的是你已经从数据中算好的均值、标准差和样本量,而不是原始数据列表。
什么是 t 检验?
t 检验是一种统计假设检验,用于判断观察到的均值差异,是否大于单纯由随机抽样波动所能解释的程度。本计算器支持两种形式:单样本 t 检验,把一个样本均值与某个固定的假设值比较;以及双样本 t 检验,比较两个独立样本的均值。
对于双样本情形,本计算器采用 Welch t 检验,它不假设两组方差相等。Welch 检验用 Welch–Satterthwaite 方程计算一个经过调整、通常不是整数的自由度,当两个样本的标准差不同时,这种方法通常比经典的合并方差(Student)t 检验给出更可靠的结果。
两种检验给出的都是双侧 p 值,意味着它衡量的是差异在任一方向(更高或更低)上的证据强度,结果会与常规显著性阈值 α = 0.05 进行比较:p 值低于 0.05 通常被标记为具有统计学显著性,等于或高于 0.05 则不是。
如何使用本 t 检验计算器
- 选择检验类型:单样本(把样本均值与固定值比较)或双样本(比较两个独立样本的均值)。
- 进行单样本检验时,输入样本均值、标准差和样本量,以及你要检验的假设总体均值(μ₀)。
- 进行双样本检验时,输入两个样本各自的均值、标准差和样本量。
- 查看 t 统计量、自由度和双侧 p 值,并把 p 值与你选定的显著性水平(通常为 α = 0.05)进行比较。
t 检验背后的公式
单样本 t 统计量:t = (x̄ − μ₀) / (s / √n),自由度 df = n − 1,其中 x̄ 是样本均值,s 是样本标准差,μ₀ 是假设总体均值。
双样本 Welch t 统计量:t = (x̄₁ − x̄₂) / √(s₁² / n₁ + s₂² / n₂)。自由度用 Welch–Satterthwaite 方程估算:df = (s₁²/n₁ + s₂²/n₂)² / [ (s₁²/n₁)² / (n₁ − 1) + (s₂²/n₂)² / (n₂ − 1) ],该方程不假设两个总体方差相等。
双侧 p 值为 p = 2 × (1 − T(|t|, df)),其中 T 是自由度为所计算值的 Student t 分布的累积分布函数。
算例(单样本):均值 = 52.1,标准差 = 4.5,n = 30,假设均值 μ₀ = 50。t = (52.1 − 50) / (4.5 / √30) ≈ 2.556,df = 29,双侧 p 值低于 0.05,因此该差异在 5% 水平下具有统计学显著性。
常见错误
- 把统计学显著性当作实际重要性——极小的 p 值只说明该差异不太可能是偶然造成的,并不代表这个差异在实际中很大或有意义。
- 以为本计算器会合并两个样本的方差——它使用的是 Welch 检验,允许两个方差不同,因此其自由度和 p 值可能与合并方差计算的结果不同。
- 把双侧 p 值套用到单侧的判定规则上,这实际上会把预期的显著性阈值减半,人为夸大了显著性。
- 把独立样本 t 检验用在配对或重复测量数据上(例如对同一批受试者的前后测量),这类数据应使用配对 t 检验。
- 在同一份数据上反复做多次 t 检验而不调整显著性阈值,这会使至少出现一次假阳性的概率远高于 5%。
常见问题
单样本 t 检验和双样本 t 检验有什么区别?
单样本 t 检验把单个样本的均值与一个固定的假设值(μ₀)比较。双样本 t 检验把两个独立样本各自的均值相互比较,检验它们的差异是否大于单纯由随机波动所能解释的程度。
为什么本计算器使用 Welch t 检验而不是 Student t 检验?
Welch t 检验不假设两个样本方差相等,这使它在两个样本标准差不同(实践中很常见)的情况下更稳健。它用 Welch–Satterthwaite 方程计算一个经过调整、通常不是整数的自由度,而不是经典合并方差检验所用的简单 n₁ + n₂ − 2。
p 值低于 0.05 意味着什么?
这意味着,假设“不存在真实差异”的原假设成立,仅由抽样波动造成这么大或更大差异的情况,发生概率会低于 5%。按常规的 α = 0.05 阈值,这被标记为具有统计学显著性,但这并不能说明差异的大小或实际重要性。
统计学显著性等于实际重要性吗?
不等于。统计学显著(p < 0.05)的结果只说明观察到的差异不太可能是偶然造成的。只要样本量足够大,即便是一个非常小、实际上并不重要的差异,也可能达到统计学显著,因此效应量应始终与 p 值一并报告和考虑。
为什么双样本检验的自由度不是整数?
Welch t 检验用 Welch–Satterthwaite 方程计算自由度,该方程结合两个样本的方差和样本量的方式,通常会得出一个非整数结果。正是这种调整,使得该检验在两组方差不相等时仍能保持准确。
这个 t 检验对样本量有什么要求?
每个样本至少需要 2 个观测值,才能定义其标准差和自由度。实践中,当数据近似正态,或者根据中心极限定理在样本量足够大时(通常以每组 n 为 30 或以上作为粗略参考),即便原始数据不太正态,t 检验的表现也最好。
参考文献
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods — two-sample t-test for equal means. nist.gov.
- Welch BL. The generalization of 'Student's' problem when several different population variances are involved. Biometrika 1947; 34(1-2): 28-35.
- Satterthwaite FE. An approximate distribution of estimates of variance components. Biometrics Bulletin 1946; 2(6): 110-114.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (one- and two-sample t procedures).
- Student (Gosset WS). The probable error of a mean. Biometrika 1908; 6(1): 1-25 (origin of the t-distribution).