如何解读你的二项分布结果
下表总结了每种计算模式的定义,以及各自适用的场景。
| 模式 | 回答的问题 | 公式 |
|---|---|---|
| 恰好 k 次 | 恰好出现 k 次成功的概率是多少? | P(X = k) |
| 至多 k 次 | 出现 k 次或更少成功的概率是多少? | P(X ≤ k) |
| 至少 k 次 | 出现 k 次或更多成功的概率是多少? | P(X ≥ k) |
- 一条常见的经验法则(标准统计学教材中都有记载)是:当 n × p 和 n × (1 − p) 都至少为 5 时,可以用正态分布合理近似二项分布,加上连续性校正后近似效果会更好。
- 二项模型要求试验相互独立、成功概率恒定;从较小的有限总体中不放回抽样会破坏独立性假设,此时应改用超几何分布。
- k 必须是 0 到 n(含两端)之间的整数;非整数或超出范围的 k 值不是有效的二项结果。
- “至多 k 次”和“至少 k + 1 次”互为补事件,两者概率之和为 100%(同理,“至多 k − 1 次”和“至少 k 次”之和也为 100%)。
什么是二项分布?
二项分布对固定次数的独立试验(n 次)中成功次数进行建模,每次试验成功概率相同(p),且每次试验只有两种可能结果——成功或失败。经典例子包括固定次数抛硬币中出现正面的次数,或从生产线固定样本中出现的次品数量,前提是成功概率在各次试验中保持不变。
该分布是离散的:成功次数 k 只能取 0 到 n 之间的整数值。它的形状同时取决于 n 和 p——当 p = 0.5 时呈对称形,当 p 趋近于 0 或 1 时会越来越偏斜。
两个决定性假设是独立性(一次试验的结果不影响另一次)和成功概率在所有试验中保持恒定。当从一个较小的有限总体中不放回抽样时,这些假设可能被违反,此时更适合使用相关的超几何分布。
如何使用本二项分布计算器
- 输入试验次数 n。
- 以百分比形式输入每次试验的成功概率 p。
- 输入成功次数 k(0 到 n 之间的整数)。
- 选择计算模式:恰好 k 次成功、至多 k 次成功,或至少 k 次成功,查看计算出的概率,以及该分布的期望值和标准差。
二项概率背后的公式
n 次试验中恰好出现 k 次成功的概率,由二项概率质量函数给出:P(X = k) = C(n, k) × pᵏ × (1 − p)ⁿ⁻ᵏ,其中 C(n, k) = n! / (k!(n − k)!) 表示在 n 次试验中选出 k 次成功的排列方式数。
“至多 k 次”是把从 0 到 k 的每种结果的概率相加;“至少 k 次”是把从 k 到 n 的概率相加(等价于 1 减去“至多 k − 1 次”的概率)。
该分布的期望值(平均成功次数)为 n × p,标准差为 √(n × p × (1 − p))。
算例:n = 20 次试验,p = 50%,恰好 k = 8 次成功。P(X = 8) = C(20, 8) × 0.5⁸ × 0.5¹² ≈ 12.01%。期望值为 20 × 0.5 = 10,标准差为 √(20 × 0.5 × 0.5) = √5 ≈ 2.2361。
常见错误
- 把二项分布用于并非相互独立、或成功概率在各次试验间发生变化的情形,例如从较小总体中不放回抽样。
- 在不同模式之间出现“差一”错误——“至少 4 次”并不是“至多 4 次”的补事件;“至多 4 次”的补事件是“至少 5 次”。
- 在需要输入百分比的地方,把成功概率输入为小数(0.5)而不是百分比(50)。
- 把二项分布套用到连续型结果上,或套用到每次试验有两种以上可能结果的计数上(这种情况需要多项分布模型)。
- 忘记了二项分布假设 p 在全部 n 次试验中保持恒定——如果概率随时间漂移,模型就不再适用。
常见问题
怎么计算二项概率?
使用 P(X = k) = C(n, k) × pᵏ × (1 − p)ⁿ⁻ᵏ,其中 n 是试验次数,p 是成功概率,C(n, k) 表示在 n 次试验中排列出 k 次成功的方式数。求“至多”或“至少”时,把这个公式在相应的 k 值范围内求和即可。
使用二项分布需要满足哪些条件?
必须有固定的试验次数(n),每次试验只能有两种可能结果(成功或失败),成功概率(p)在各次试验中必须保持恒定,并且各次试验必须相互独立。
预期的成功次数是多少?
二项分布的期望值(均值)为 n × p。例如,进行 20 次试验、成功概率为 50% 时,预期成功次数为 20 × 0.5 = 10。
“恰好”“至多”和“至少”有什么区别?
“恰好 k 次”是精确出现 k 次成功的概率。“至多 k 次”是把 0 到 k 次成功的概率相加。“至少 k 次”是把 k 到 n 次成功的概率相加;它等于 1 减去“至多 k − 1 次”成功的概率。
什么时候可以用正态分布来近似二项分布?
一条常用的经验法则是:当 n × p 和 n × (1 − p) 都至少为 5 时,这种近似是合理的。超出这个范围,尤其是 n 较小或 p 远离 0.5 时,精确的二项计算会更可靠。
参考文献
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods — binomial distribution. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (binomial setting and probability formula).
- Casella G, Berger RL. Statistical Inference (2nd ed). Duxbury, 2002 (binomial distribution, mean and variance).
- Ross SM. A First Course in Probability. Pearson (binomial random variables and the normal approximation).