信頼区間とは何か
信頼区間とは、未知の母集団パラメータ——多くの場合は母平均または母比率——に対する、標本データから計算された、もっともらしい値の範囲である。それは標本平均のような点推定値を中心に構築され、その両方向に誤差の許容範囲だけ広がる。これにより、この区間全体は、同じ抽出と計算の手続きを何度も繰り返した場合に、真の未知の母集団の値を指定された割合の頻度で捉えるように設計されている。
選ばれる割合、すなわち信頼水準は、最も一般的には90%、95%、99%である。広い区間はそれが真の値を捉えているという確信をより多く与えるが、その代償として精度が下がる。狭い区間はより精度が高いが、より低い信頼水準を伴うか、同じ信頼水準を維持するためにより大きな標本を必要とする。この精度と信頼のトレードオフは避けられないものであり、報告された区間を正しく解釈するうえで中心的な考え方である。
「95%信頼」のよくある誤解
95%信頼区間を、真の母集団の値がその1つの特定のすでに計算された区間の中に存在する確率が95%であると読むのは、よくある、よく知られた誤解である。この読み方は技術的には正しくない:特定の標本から特定の区間が計算されると、真の母集団の値はその中に存在するか存在しないかのどちらかであり、その1つの区間について確率を付与する残りのランダム性は存在しない。95%という数値は、多数の仮想的な反復標本にわたる、区間を構築するために用いられた方法の長期的な成功率を表すものであり、事後的な1つの区間についての確率の主張ではない。
Hoekstraらの研究者(2014年)は、Psychonomic Bulletin and Review誌に発表した論文の中で、この区別が研究者や統計学の学生を含む多くの人々に広く誤解されていることを記録しており、その多くが95%信頼区間を、真の値がその特定の区間の中に存在する確率を直接表すものと解釈していた。技術的に正しい解釈は、反復抽出全体にわたる方法の信頼性に関するものであり、すでに観測された1つの結果についての確率の主張ではない。
誤差の許容範囲:信頼区間を構成する要素
誤差の許容範囲とは、点推定値の両側に信頼区間が広がる距離であり、臨界値(正規分布に基づく区間の場合はz)に推定値の標準誤差を掛けたものとして計算される。平均の場合、標準誤差は標準偏差を標本サイズの平方根で割ったものである:標準誤差 = 標準偏差 / sqrt(n)。標本が大きいほど標準誤差は縮小し、それに伴って誤差の許容範囲と区間全体の幅もnの平方根に比例して縮小する。
臨界値zは選択された信頼水準に依存する:90%信頼では1.6449、95%信頼では1.96、99%信頼では2.5758であり、それぞれ標準正規分布上で対応する確率の合計を両側の裾に残す点を表している。信頼水準が高いほど臨界値は大きくなる必要があり、これにより他の条件が同じであれば誤差の許容範囲、ひいては結果として得られる区間が広がる。
計算例:平均に対する95%信頼区間を構築する
n = 100個の観測値からなる標本の平均が50、標準偏差が8であり、母平均に対する95%信頼区間が必要であるとする。ステップ1:標準誤差を計算する、8 / sqrt(100) = 8 / 10 = 0.8。ステップ2:95%の臨界値を用いて誤差の許容範囲を計算する、1.96 x 0.8 = 1.568。ステップ3:標本平均に誤差の許容範囲を加減する:50 - 1.568 = 48.432、および50 + 1.568 = 51.568。
得られる95%信頼区間は48.432から51.568である。正しい解釈は、同じ抽出と計算の手続きを、同じ母集団から得られた100個の新しい標本に対して何度も繰り返した場合、この方法で構築された区間のおよそ95%が真の母平均を含むということであり、この1回の事例において真の平均が48.432から51.568の間に具体的に存在する確率が95%であるということではない。
信頼水準と標本サイズが区間をどう変えるか
標本を固定した状態で(平均50、標準偏差8、n = 100)、以下の表は、選択された信頼水準のみによって、同じ基礎データがどのように異なる区間幅を生み出すかを示している。信頼水準が高いほど区間は常に広くなる。これは、より信頼できる方法(反復標本全体でより高い頻度で成功する方法)は、その構造上、より広い範囲のもっともらしい値をカバーしなければならないためである。
| 信頼水準 | z臨界値 | 誤差の許容範囲 | 結果として得られる区間 |
|---|---|---|---|
| 90% | 1.6449 | 1.316 | 48.684 から 51.316 |
| 95% | 1.96 | 1.568 | 48.432 から 51.568 |
| 99% | 2.5758 | 2.061 | 47.939 から 52.061 |
よくある質問
95%信頼区間は実際には何を意味するか?
同じ抽出と計算の手続きを何度も繰り返した場合、得られる区間のおよそ95%が真の母集団の値を含むことを意味する。これは、この1つの特定のすでに計算された区間の中に真の値が存在する確率が95%であるという意味ではない——この区別は、Hoekstraらの研究者(2014年)によってPsychonomic Bulletin and Review誌で広く見られる誤解として記録されている。
平均に対する95%信頼区間はどのように計算するか?
標準誤差(標準偏差を標本サイズの平方根で割ったもの)を計算し、それに95%の臨界値1.96を掛けて誤差の許容範囲を求め、その許容範囲を標本平均に加減する。平均50、標準偏差8、n = 100の標本の場合:標準誤差 = 0.8、誤差の許容範囲 = 1.568、区間は48.432から51.568となる。
誤差の許容範囲とは何か?
誤差の許容範囲とは、標本平均のような点推定値に加算・減算されて信頼区間を形成する量である。それは、選択された信頼水準に依存する臨界値に、推定値の標準誤差を掛けたものとして計算される。誤差の許容範囲が大きいほど、区間は広く精度が低くなる。誤差の許容範囲が小さいほど、区間は狭く精度が高くなる。
この区間に真の値が存在する確率が95%であると言うのがなぜ誤りなのか?
特定の標本から特定の区間がひとたび計算されると、真の母集団の値はその中に存在するか存在しないかのどちらかであり、確率を割り当てる残りのランダム性は存在しないためである。95%とは、区間を構築するために用いられた方法の性質であり、多数の仮想的な反復標本にわたってその方法がどれだけの頻度で成功するかを表すものであって、すでに計算された1つの区間についての確率の主張ではない。
標本サイズが大きいほど信頼区間は狭くなるか?
はい。標準誤差、そしてそれに伴う誤差の許容範囲と区間全体の幅は、標準偏差を標本サイズの平方根で割ることで計算される。標本サイズは平方根の中に入るため、標本サイズを4倍にすると区間の幅は半分になり、逆に標本が小さいほど、同じ信頼水準に対して比例的に広く精度の低い区間になる。
なぜ信頼水準が高いほど区間が広くなるのか?
95%ではなく99%のようなより高い信頼水準は、より大きな臨界値(1.96に対して2.5758)を必要とし、これが誤差の許容範囲を増大させ、結果として得られる区間を広げる。これは避けられないトレードオフを反映している:反復標本全体でより高い頻度で成功する必要がある方法は、そのためにより広い範囲のもっともらしい値をカバーしなければならない。
参考文献
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 7.1: Confidence intervals. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (confidence intervals for a mean; z vs t procedures).
- Hoekstra R, Morey RD, Rouder JN, Wagenmakers EJ. "Robust misinterpretation of confidence intervals." Psychonomic Bulletin and Review, 2014;21(5):1157-1164.