CCalculate.Studio

🧾 t 检验计算器

本 t 检验计算器可以计算单样本 t 检验(把样本均值与某个假设值比较)或双样本 Welch t 检验(在不假设方差相等的前提下比较两个独立样本的均值)。它会给出 t 统计量、自由度和双侧 p 值,并标注结果在常规 α = 0.05 水平下是否具有统计学显著性。例如,一个均值为 52.1、标准差为 4.5、n = 30 的样本,与假设均值 50 进行检验,得到 t ≈ 2.556,p < 0.05。

最后审核: 2026-07-07
Add as preferred on Google

如何解读你的 t 检验结果

本计算器采用常规的双侧显著性阈值 α = 0.05,这是科研中最常用的默认值。

双侧 p 值α = 0.05 下的结论
p < 0.05具有统计学显著性 — 拒绝“无差异”的原假设
p ≥ 0.05不具有统计学显著性 — 不能拒绝原假设
  • 统计学显著性不等同于实际重要性:只要样本足够大,即便是一个微小、在实际中毫无意义的差异,也可能得出低于 0.05 的 p 值。
  • 这里使用的双样本检验是 Welch t 检验,它不假设两组方差相等;结果可能与使用经典合并方差(Student)t 检验的工具略有不同。
  • t 检验假设样本数据是独立观测,且均值的抽样分布近似正态——这一点既可以通过原始数据本身大致正态来满足,也可以通过中心极限定理,在样本量足够大时得到满足。
  • 这是一个基于汇总统计量的计算器:它使用的是你已经从数据中算好的均值、标准差和样本量,而不是原始数据列表。

什么是 t 检验?

t 检验是一种统计假设检验,用于判断观察到的均值差异,是否大于单纯由随机抽样波动所能解释的程度。本计算器支持两种形式:单样本 t 检验,把一个样本均值与某个固定的假设值比较;以及双样本 t 检验,比较两个独立样本的均值。

对于双样本情形,本计算器采用 Welch t 检验,它不假设两组方差相等。Welch 检验用 Welch–Satterthwaite 方程计算一个经过调整、通常不是整数的自由度,当两个样本的标准差不同时,这种方法通常比经典的合并方差(Student)t 检验给出更可靠的结果。

两种检验给出的都是双侧 p 值,意味着它衡量的是差异在任一方向(更高或更低)上的证据强度,结果会与常规显著性阈值 α = 0.05 进行比较:p 值低于 0.05 通常被标记为具有统计学显著性,等于或高于 0.05 则不是。

如何使用本 t 检验计算器

  1. 选择检验类型:单样本(把样本均值与固定值比较)或双样本(比较两个独立样本的均值)。
  2. 进行单样本检验时,输入样本均值、标准差和样本量,以及你要检验的假设总体均值(μ₀)。
  3. 进行双样本检验时,输入两个样本各自的均值、标准差和样本量。
  4. 查看 t 统计量、自由度和双侧 p 值,并把 p 值与你选定的显著性水平(通常为 α = 0.05)进行比较。

t 检验背后的公式

单样本:t = (x̄ − μ₀) / (s / √n),自由度 = n − 1
双样本(Welch 检验):t = (x̄₁ − x̄₂) / √(s₁²/n₁ + s₂²/n₂)
Welch–Satterthwaite df = (s₁²/n₁ + s₂²/n₂)² / [(s₁²/n₁)²/(n₁−1) + (s₂²/n₂)²/(n₂−1)]
双侧 p 值 = 2 × (1 − T(|t|, df))
计算示例:均值=52.1,标准差=4.5,n=30,μ₀=50 → t ≈ 2.556,df=29,p < 0.05

单样本 t 统计量:t = (x̄ − μ₀) / (s / √n),自由度 df = n − 1,其中 x̄ 是样本均值,s 是样本标准差,μ₀ 是假设总体均值。

双样本 Welch t 统计量:t = (x̄₁ − x̄₂) / √(s₁² / n₁ + s₂² / n₂)。自由度用 Welch–Satterthwaite 方程估算:df = (s₁²/n₁ + s₂²/n₂)² / [ (s₁²/n₁)² / (n₁ − 1) + (s₂²/n₂)² / (n₂ − 1) ],该方程不假设两个总体方差相等。

双侧 p 值为 p = 2 × (1 − T(|t|, df)),其中 T 是自由度为所计算值的 Student t 分布的累积分布函数。

算例(单样本):均值 = 52.1,标准差 = 4.5,n = 30,假设均值 μ₀ = 50。t = (52.1 − 50) / (4.5 / √30) ≈ 2.556,df = 29,双侧 p 值低于 0.05,因此该差异在 5% 水平下具有统计学显著性。

常见错误

  • 把统计学显著性当作实际重要性——极小的 p 值只说明该差异不太可能是偶然造成的,并不代表这个差异在实际中很大或有意义。
  • 以为本计算器会合并两个样本的方差——它使用的是 Welch 检验,允许两个方差不同,因此其自由度和 p 值可能与合并方差计算的结果不同。
  • 把双侧 p 值套用到单侧的判定规则上,这实际上会把预期的显著性阈值减半,人为夸大了显著性。
  • 把独立样本 t 检验用在配对或重复测量数据上(例如对同一批受试者的前后测量),这类数据应使用配对 t 检验。
  • 在同一份数据上反复做多次 t 检验而不调整显著性阈值,这会使至少出现一次假阳性的概率远高于 5%。

常见问题

单样本 t 检验和双样本 t 检验有什么区别?

单样本 t 检验把单个样本的均值与一个固定的假设值(μ₀)比较。双样本 t 检验把两个独立样本各自的均值相互比较,检验它们的差异是否大于单纯由随机波动所能解释的程度。

为什么本计算器使用 Welch t 检验而不是 Student t 检验?

Welch t 检验不假设两个样本方差相等,这使它在两个样本标准差不同(实践中很常见)的情况下更稳健。它用 Welch–Satterthwaite 方程计算一个经过调整、通常不是整数的自由度,而不是经典合并方差检验所用的简单 n₁ + n₂ − 2。

p 值低于 0.05 意味着什么?

这意味着,假设“不存在真实差异”的原假设成立,仅由抽样波动造成这么大或更大差异的情况,发生概率会低于 5%。按常规的 α = 0.05 阈值,这被标记为具有统计学显著性,但这并不能说明差异的大小或实际重要性。

统计学显著性等于实际重要性吗?

不等于。统计学显著(p < 0.05)的结果只说明观察到的差异不太可能是偶然造成的。只要样本量足够大,即便是一个非常小、实际上并不重要的差异,也可能达到统计学显著,因此效应量应始终与 p 值一并报告和考虑。

为什么双样本检验的自由度不是整数?

Welch t 检验用 Welch–Satterthwaite 方程计算自由度,该方程结合两个样本的方差和样本量的方式,通常会得出一个非整数结果。正是这种调整,使得该检验在两组方差不相等时仍能保持准确。

这个 t 检验对样本量有什么要求?

每个样本至少需要 2 个观测值,才能定义其标准差和自由度。实践中,当数据近似正态,或者根据中心极限定理在样本量足够大时(通常以每组 n 为 30 或以上作为粗略参考),即便原始数据不太正态,t 检验的表现也最好。

参考文献

  1. National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods — two-sample t-test for equal means. nist.gov.
  2. Welch BL. The generalization of 'Student's' problem when several different population variances are involved. Biometrika 1947; 34(1-2): 28-35.
  3. Satterthwaite FE. An approximate distribution of estimates of variance components. Biometrics Bulletin 1946; 2(6): 110-114.
  4. Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (one- and two-sample t procedures).
  5. Student (Gosset WS). The probable error of a mean. Biometrika 1908; 6(1): 1-25 (origin of the t-distribution).

统计学 · 全部计算器

相关计算器