数字と報道

たくさん調べて見つけた一つの差は、そのまま信じてよい?

多数の指標や組合せを比べると、差がない場合でも目立つ結果が見つかりやすくなります。一つだけ示されたp値を読む前に、何を何回比べ、いつ問いを決めたかを確認します。探索で見つけた結果は、比較全体を考える方法や、さらに確かめる問いへつなげます。

基本の用語

検定の有意水準は、帰無仮説が真なのに棄却する誤りを、決めた条件の下でどれくらい許すかという基準です。一回の検定に置いた5%などの基準と、多数の検定全体での誤りは同じ問いではありません。

もう少し詳しく知りたいときは、次の基礎で補えます。

一回の検定と、全部の検定の誤検出

一つの指標の平均だけを比べる場合と、多くの地域・年齢・期間の組合せを繰り返し比べる場合では、目立つ結果が現れる機会が違います。各比較に同じ有意水準を使っても、全体として少なくとも一つを誤検出する確率が、その水準に保たれるとは限りません。

下の例はこの違いを、検定が互いに独立という単純化した条件で計算します。20回全体で約64%という数字は、見つかった一つの差が64%の確率で誤りだという意味ではありません。全ての帰無仮説が真と置いたとき、誤検出が一つ以上ある確率です。

実際の指標や地域の比較は、同じ対象や似た情報を共有することがあります。独立した20回の計算を、そのまま実在の研究の誤り率に使えません。それでも、一回の基準と比較全体の基準を分ける必要があることは分かります。

見つけた後の問いを、最初の問いと分ける

データを見てから、差の大きかった期間や集団だけを選ぶと、最初からその一つを調べると決めた場合とは条件が変わります。多数の結果から選んだことを考えない手順では、表示された信頼水準や有意水準の解釈が合わなくなることがあります。

そこで、事前に決めた比較と、結果を見てから生まれた比較を区別します。探索には、まだ知らない関係や次に確かめたい疑問を見つける役割があります。問題は探索したことそのものではなく、選んだ過程を省き、初めから狙って確かめた一つの結果のように示すことです。

米国統計学会の声明も、適切な推論には全体の報告と透明性が必要としています。報告には、どの指標・区分・期間を調べ、何を示したかという情報が必要です。事前に問いを決めただけで、複数の比較の問題がすべて消えるわけでもありません。

比べた全体を考えて確かめ直す

多重比較の方法は、比較する範囲全体を考えて検定や同時の区間を作ります。NISTの手引は、事前に選んだ比較群を対象にするBonferroni法、すべての対の平均差を対象にするTukey法など、目的の異なる方法を示しています。

どの比較群へ、どんな方法を使ったかが大切です。あらゆる分析へ同じ補正を機械的に付ければ十分という話ではありません。比較を絞った理由と、結果を見て増やした比較があるかも合わせて確認します。

探索から得た問いを、別のデータや後の研究で確かめることも考えられます。その際は、今度何を調べるかを明確にします。目立つ結果を見つけることと、その結果が再び得られ、どこまで使えるかを確かめることを分けます。

独立した20回の検定を置く

架空の例

真の差がない、互いに独立した20の検定を考え、それぞれの誤検出確率を5%と置きます。一回で誤検出しない確率は0.95、20回の全部で誤検出しない確率は(0.95)の20乗で約36%です。

一つ以上を誤検出する確率は1 − (0.95)^20で約64%になります。これは独立・全て差なしという条件付きの計算です。指標が関連する実際の調査や、報告された一つの効果が誤りである確率へ読み替えません。

持ち帰る見方

  • 一回の有意水準と、比較全体で一つ以上を誤検出する確率は別です。
  • 事前に決めた問いと、結果を見て見つけた問いを分けます。
  • 比較群と方法、調べた全体を報告し、次に確かめる問いを明確にします。

次に広がる疑問

  • そもそも小さいp値は何を意味する?
  • 報道された一つの結果の前提はどこで確かめる?

順番に読んでいる方へ

学習地図で、ほかの分野とのつながりを見る

出典

  • e-Handbook of Statistical Methods 7.4.7: How can we make multiple comparisons?(米国国立標準技術研究所(NIST)/SEMATECH)https://www.itl.nist.gov/div898/handbook/prc/section4/prc47.htm

    確認日:2026-10-04

  • Statement on Statistical Significance and P-Values の公表文(6原則)(米国統計学会(American Statistical Association))https://www.amstat.org/asa/files/pdfs/P-ValueStatement.pdf

    確認日:2026-10-04

本文の出典・補足

一回の検定と、全部の検定の誤検出

多数の平均や割合を繰り返し比べると、全体としての誤検出の確率は一回だけの比較に設定した有意水準と同じにはならない。

対象
7.4.7 Multiple Comparison test procedures
条件
複数の検定を同一の結論候補群として読む。独立かどうか等で全体の確率は変わる
例外・限界
すべての検定が独立という前提を現実の地域や指標へ自動適用しない
  • e-Handbook of Statistical Methods 7.4.7: How can we make multiple comparisons?(米国国立標準技術研究所(NIST)/SEMATECH)https://www.itl.nist.gov/div898/handbook/prc/section4/prc47.htm

見つけた後の問いを、最初の問いと分ける

データを見てから比較する組合せを選ぶと、その選択を考えない手順の信頼水準とは合わなくなることがある。事前の問いと結果から見つけた問いを区別し、何を調べたか開示する。

対象
NIST Determine contrasts in advance、ASA原則4/選択的公表
条件
比較の決め方・全分析の報告と透明性
例外・限界
探索そのものを無価値としない。事前決定だけで全多重性がなくなるとはしない
  • e-Handbook of Statistical Methods 7.4.7: How can we make multiple comparisons?(米国国立標準技術研究所(NIST)/SEMATECH)https://www.itl.nist.gov/div898/handbook/prc/section4/prc47.htm

  • Statement on Statistical Significance and P-Values の公表文(6原則)(米国統計学会(American Statistical Association))https://www.amstat.org/asa/files/pdfs/P-ValueStatement.pdf

比べた全体を考えて確かめ直す

比較全体を考慮する多重比較法には、事前選択した比較群を対象とするBonferroni法などがあり、比較の目的や範囲に合う方法を使う。

対象
7.4.7 Tests on Means after Experimentation(Tukey/Scheffé/Bonferroni)
条件
手法ごとに対象とする比較群・同時信頼範囲が異なる
例外・限界
どの比較にも同じ補正が最適とはしない。別データ再検証も設計と透明性が必要
  • e-Handbook of Statistical Methods 7.4.7: How can we make multiple comparisons?(米国国立標準技術研究所(NIST)/SEMATECH)https://www.itl.nist.gov/div898/handbook/prc/section4/prc47.htm