信頼区間が実際に意味すること
信頼区間とは、サンプルデータから計算される値の範囲であり、繰り返し抽出したサンプルのうち指定された割合(最も一般的には95%)で真の母集団パラメータを捕捉すると期待される方法を用いて構築されます。95%信頼区間は、計算されたその1つの特定の区間に真の母集団の値が含まれる確率が95%であることを意味するものではありません。真の値は、与えられたどの区間についても含まれているか含まれていないかのいずれかであり、確率が当てはまるのは、繰り返し抽出を行った場合のその方法の長期的な性能に対してであって、すでに計算された1つの固定された区間に対してではありません。
Hoekstraらは2014年にPsychonomic Bulletin and Review誌で、この違いが研究者や統計学の学生を含む多くの人々の間で広く誤解されていることを報告しました。その多くが、95%信頼区間を、真の値がその特定の区間に含まれる確率を直接表すものであるかのように解釈していました。技術的に正しい解釈は、多数の仮想的な繰り返し抽出にわたって区間を構築する際に用いた方法の信頼性についての言明であり、すでに観測された1つの区間についての確率の言明ではありません。
信頼区間の幅を決めるものは何か
信頼区間の幅は主に3つの要因によって決まります。望ましい信頼水準(一般的には90%、95%、99%)、基礎となるデータのばらつき(通常は標準偏差、割合の場合は推定割合pによって測定されます)、そしてサンプルサイズです。信頼水準を上げると区間は広がります。これは、繰り返し抽出において真の値をより確実に捕捉するには、より広い範囲が必要になるためです。サンプルサイズを増やすと区間は狭まります。これは、サンプルが大きいほど母集団の値をより正確に推定できるためです。
割合について、信頼区間の許容誤差は z x sqrt[p(1-p)/n] として計算されます。ここでzは望ましい信頼水準に対応するzスコア(95%信頼の場合1.96)、pは推定割合(真の割合が不明な場合は、最も大きく保守的な許容誤差を生み出すため0.5が用いられます)、nはサンプルサイズです。この式ではサンプルサイズが平方根の中に現れるため、許容誤差を半分にするには、単純に2倍にするのではなく、おおよそ4倍にサンプルサイズを増やす必要があります。
サンプルサイズを求めるコクランの公式
統計学者ウィリアム・コクランが著書『Sampling Techniques』で発表したコクランの公式は、調査や研究に必要な最小サンプルサイズを推定する方法を示すもので、n0 = (z^2 x p(1-p)) / e^2 として計算されます。ここでzは望ましい信頼水準のzスコア、pは推定割合(不明な場合は0.5)、eは小数で表した望ましい許容誤差です。95%の信頼水準(z = 1.96)、5%の許容誤差(e = 0.05)、最大のばらつき(p = 0.5)の場合、この公式は n0 = (1.96^2 x 0.5 x 0.5) / 0.05^2 = 384.16 となり、切り上げて385人の回答者となります。
実質的に無限とみなせる母集団ではなく、既知の有限母集団から抽出する場合、コクランの公式には有限母集団補正が含まれます:n = n0 / (1 + (n0 - 1) / N)。ここでNは母集団全体の規模です。例えば、この補正を2,000人の母集団に適用すると、必要なサンプルサイズは385人から約323人に減少します。これは、母集団全体が小さいほど、同じ許容誤差を達成するために必要な回答者数が比例して少なくなるためです。
サンプルサイズ、信頼水準、許容誤差:計算例による比較
下の表は、大規模または無限とみなせる母集団を対象に、p = 0.5としてコクランの公式で計算した必要サンプルサイズが、望ましい信頼水準と許容誤差の変化に応じてどのように変わるかを示しています。信頼水準を高くすることと許容誤差を小さくすることは、どちらも必要なサンプルサイズを増加させますが、許容誤差は公式の分母で2乗されて現れるため、特に大きな影響を及ぼします。
| 信頼水準 | 許容誤差 | zスコア | 必要なサンプルサイズ(p = 0.5) |
|---|---|---|---|
| 90% | 5% | 1.645 | 271 |
| 95% | 5% | 1.96 | 385 |
| 95% | 3% | 1.96 | 1,068 |
| 99% | 5% | 2.576 | 664 |
「95%信頼」のよくある誤読
上記で説明した核心的な確率の誤解に加えて、信頼区間に関連するいくつかの誤読が、研究報告や一般向けの情報発信で頻繁に見られます。よくある誤りの一つは、95%信頼区間を、サンプル内の個々のデータ点の95%がその範囲に含まれることを意味すると捉えてしまうことです。信頼区間は、平均や割合といった母集団パラメータについての不確実性を表すものであり、個々の観測値のばらつきを表すものではありません。個々の観測値のばらつきは、標準偏差や予測区間によって表されます。
もう一つのよくある誤りは、効果量や推定値そのものの実用的な重要性を考慮せずに、信頼区間が狭いほど常により重要な、あるいはより信頼できる結果を示していると思い込んでしまうことです。非常に大規模なサンプルは、統計的には精密であっても実務上は無視できるほど小さい効果について、狭い信頼区間を生み出すことがあります。3つ目のよくある誤りは、重なり合う2つの信頼区間を見て、その背後にある値に有意な差はないと思い込んだり、逆に重ならない区間であれば常に有意な差が確認されると思い込んだりすることです。2つの推定値の差を正式に検定するには、一般に区間の重なりを視覚的に比較するだけでなく、専用の統計的検定が必要です。
サンプルサイズを選ぶ際の実務的な指針
研究者や調査設計者は通常、そのデータが判断材料となる意思決定に必要な精度に基づいて目標とする信頼水準と許容誤差を選び、データ収集を始める前に、コクランの公式などを用いて対応する最小サンプルサイズを計算します。5%の許容誤差を伴う95%の信頼水準は、調査研究や世論調査における一般的なデフォルト設定であり、それなりに精度の高い推定値と、現実的に達成可能なサンプルサイズとのバランスを取っています。
推定割合(p)が事前にわからない場合、p(1-p)はp = 0.5のときに最大となるため、p = 0.5を用いることで最も保守的で最大のサンプルサイズの見積もりが得られます。先行研究やパイロット調査からより具体的なpの推定値が得られる場合は、それを用いることで、真の割合が50%から大きく離れていると見込まれるときに必要なサンプルサイズを減らすことができます。米国世論調査協会(AAPOR)などの団体は、新たな研究を設計する研究者向けに、調査のサンプルサイズ計画や方法論の報告に関する詳細な指針を公表しています。
よくある質問
95%信頼区間とは実際には何を意味しますか?
95%信頼区間とは、同じ抽出と計算のプロセスを何度も繰り返した場合、得られる区間のうち約95%が真の母集団の値を含むことを意味します。これは、すでに計算されたこの1つの特定の区間に真の値が含まれる確率が95%であることを意味するものではありません。この違いは、Hoekstraら(2014年、Psychonomic Bulletin and Review誌)が広く見られる誤解として報告しており、研究および一般向けの情報発信の両方において、信頼区間に関する最も一般的な誤読の一つです。
95%の信頼水準を得るには何人を調査する必要がありますか?
95%の信頼水準(z = 1.96)、5%の許容誤差、最大のばらつき(p = 0.5)の条件でコクランの公式を用いると、大規模または実質的に無限とみなせる母集団に対して必要なサンプルサイズは約385人の回答者です。より小さな、既知の母集団から抽出する場合は、有限母集団補正によってこの数値は少なくなります。例えば、2,000人の母集団の場合、同じ信頼水準と許容誤差を達成するために必要な回答者数は約323人です。
サンプルサイズを2倍にすると許容誤差は半分になりますか?
いいえ、なりません。許容誤差の公式 z x sqrt[p(1-p)/n] ではサンプルサイズが平方根の中に現れるため、許容誤差を半分にするには、2倍にするのではなく、おおよそ4倍にサンプルサイズを増やす必要があります。この収穫逓減の関係は、ある程度大きなサンプルサイズをすでに持つ研究において、比較的わずかな精度の改善を達成するためには、非常に大きなサンプルサイズの増加が必要になることを意味します。
コクランの公式は何のために使われますか?
ウィリアム・コクランの著書『Sampling Techniques』に由来するコクランの公式は、母集団の割合を推定する際に、望ましい信頼水準と許容誤差を達成するために必要な最小サンプルサイズを推定するものです。n0 = (z^2 x p(1-p)) / e^2 として計算され、データ収集を始める前に何人の回答者や参加者が必要かを決定するために、調査研究、市場調査、公衆衛生研究で広く用いられています。
信頼区間が狭いことは、その結果がより重要であることを意味しますか?
必ずしもそうとは限りません。狭い信頼区間は、多くの場合より大きなサンプルサイズによって達成される、より高い統計的精度を示していますが、精度は実用的な重要性と同じものではありません。非常に大規模な研究は、実務上意味を持つには小さすぎる効果について、統計的に精密で狭い信頼区間を生み出すことがある一方、より小規模な研究は、大きく実務上重要な効果について、より広い区間を生み出すことがあります。信頼区間を解釈するには、その幅と、それが囲んでいる推定値の大きさの両方を考慮する必要があります。
参考文献
- Cochran WG. Sampling Techniques. 3rd ed. Wiley, 1977.
- Hoekstra R, Morey RD, Rouder JN, Wagenmakers EJ. "Robust misinterpretation of confidence intervals." Psychonomic Bulletin and Review, 2014;21(5):1157-1164.
- Kalton G. Introduction to Survey Sampling. Sage Publications, 1983.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. 9th ed. W.H. Freeman, 2017.
- American Association for Public Opinion Research. "Best Practices for Survey Research." AAPOR.org.