数字と報道
回答の内訳が想定した割合と合うか、どう確かめる?
事前に想定したカテゴリ別の割合から期待人数を作り、観測人数とのずれを表全体で調べる方法があります。カイ二乗適合度検定です。二つの分類の独立を調べる検定とは問いが違い、非有意でも想定どおりと証明したわけではありません。
基本の用語
割合を比べるには、対象全体を重複なく分けるカテゴリが必要です。ここでは一つの分類について、各カテゴリの確率を先に指定した基本の模型を扱います。
もう少し詳しく知りたいときは、次の基礎で補えます。
- 統計の数字は、何を数えたもの?対象・分母・期間・平均を確かめる
- 「統計的に有意」なら、効果は大きく確実に役立つ?p値の条件、有意性と効果量・重要性の違い、非有意の読み方を理解する。
想定した比率を人数へ直す
三つの相談窓口に半分、3割、2割が来ると想定したなら、その比率を比較の基準にします。調べた100件に対する期待人数は50、30、20件です。実際の数を見てから似た比率を選ぶことと、先に指定した想定を調べることは同じではありません。
帰無仮説は観測が指定したカテゴリ分布に従うことです。対立仮説は、どこかの割合がその想定と異なることになります。職業と賛否など二変数の関連を見る独立性検定とは、基準となる確率の作り方と問いが違います。
何件を一つの観測としたかも確認します。一人の複数回の相談をすべて数えるなら、その依存が分析に関わります。毎日同じ件数を調べたのか、全期間から選んだのかなど、分布を比べる表がどう作られたかを先に読む必要があります。
ずれを期待人数に対して測る
基本のカイ二乗統計量は、各カテゴリの「観測数−期待数」を二乗し、期待数で割った値を足します。符号を打ち消して全体の合計差ゼロとするのでなく、カテゴリの内訳が想定からどれだけ離れたかをまとめます。
期待数50のカテゴリと期待数5のカテゴリで、同じ5件のずれを同じ重みにはしません。差の二乗を期待数で割るため、ずれが何件かに加え、基準の人数に対してどれくらいかが計算に入ります。最大の差だけを見る方法とは異なります。
統計量が大きいほど、指定した分布と観測内訳のずれが大きい方向です。ただし、どのずれをどれくらい珍しいと見るかには模型と自由度が必要です。数の大小だけで実用上の問題や原因まで決まるわけではなく、元の内訳も併せて説明します。
小さい期待人数を確認する
採用した教材の基本手順では、各セルの期待数を少なくとも5とします。これは観測数の条件と混同しないようにします。想定比率が小さい区分では、全体が大きくても期待数が少ない場合があり、近似の適用を確認する必要があります。
基準比率が前年の観測値などから作られた場合、その比率を固定した既知の確率と扱えるかは別の確認になります。何となく予想した配分と、模型が指定した確率を区別し、基準をどこから得たかを示すと検定の問いを追えます。
確率を先に固定した基本例の自由度はカテゴリ数−1です。同じデータで模型の母数も推定した場合まで、その数式を無条件に使いません。区分をまとめる場合も、何を比較する問いが変わるかを考え、結果に合わせた自由なまとめ直しを避けます。
有意でなければ、このデータと方法で想定を棄却する証拠が十分でなかったと表します。「実際の割合が指定比率と完全に同じ」とは言いません。有意なら、元の内訳を示し、想定のずれと、そのずれを生んだ理由の説明を分けます。
相談先3区分の想定と観測(架空)
相談100件について、事前の比率を50%、30%、20%、観測を40、40、20件とします。期待数は50、30、20件です。差は−10、10、0件で、合計は0でも内訳は異なります。
統計量は100÷50+100÷30+0÷20=約5.33です。カテゴリ3の基本例なので自由度は2です。この計算だけで原因や重要性を決めず、想定比率を何に使いたいかと併せて読みます。
持ち帰る見方
- 想定比率から期待人数を作り、非有意と一致の証明を分ける。
- 母数推定を伴う場合の自由度はこの式をそのまま使えない。
次に広がる疑問
- 全体の検定で違いがあったとき、どの区分を追加で調べる?
順番に読んでいる方へ
出典
Introductory Statistics 2e §11.2 Goodness-of-Fit Test(Barbara Illowsky / Susan Dean(著者原教材、OpenStax))https://openstax.org/books/introductory-statistics-2e/pages/11-2-goodness-of-fit-test
確認日:2026-10-07
本文の出典・補足
想定した比率を人数へ直す
適合度検定は、カテゴリの観測度数を指定した分布から期待される度数と比べる。
- 対象
- 一つのカテゴリ変数の度数と、あらかじめ指定したカテゴリ確率の比較。
- 条件
- カテゴリは重複なく全体を分け、比較比率を先に明示する。
- 例外・限界
- 二変数の独立性を調べる検定とは帰無仮説が違う。
Introductory Statistics 2e §11.2 Goodness-of-Fit Test(Barbara Illowsky / Susan Dean(著者原教材、OpenStax))https://openstax.org/books/introductory-statistics-2e/pages/11-2-goodness-of-fit-test
ずれを期待人数に対して測る
基本のカイ二乗適合度統計量は、各セルの観測度数と期待度数の差の二乗を期待度数で割って合計する。
- 対象
- 同じ標本について数えたカテゴリ別の観測度数と期待度数。
- 条件
- 期待度数は正、固定指定したカテゴリ確率の模型。
- 例外・限界
- 大きな差だけでなく、期待人数に対する差を扱う。
Introductory Statistics 2e §11.2 Goodness-of-Fit Test(Barbara Illowsky / Susan Dean(著者原教材、OpenStax))https://openstax.org/books/introductory-statistics-2e/pages/11-2-goodness-of-fit-test
小さい期待人数を確認する
本教材の基本手順では各セルの期待度数を少なくとも5とし、既知のカテゴリ確率なら自由度をカテゴリ数−1とする。
- 対象
- カテゴリ確率を既知とする基本的なカイ二乗適合度検定。
- 条件
- 確率の母数を同じデータから推定しない基本例。
- 例外・限界
- 母数推定を伴う場合の自由度はこの式をそのまま使えない。
Introductory Statistics 2e §11.2 Goodness-of-Fit Test(Barbara Illowsky / Susan Dean(著者原教材、OpenStax))https://openstax.org/books/introductory-statistics-2e/pages/11-2-goodness-of-fit-test