数字と報道
予測が70%と出た人のうち、本当に7割に起きる?
70%という予測が妥当かは、同じ対象・期間でその予測を出された集団の約7割に出来事が起きるかで調べます。これが確率予測の較正です。起こりやすい人を高く順位付けできる力とは、別に確認する必要があります。
基本の用語
一人の結果は起きるか起きないかの一回です。70%の人一人に起きなかったことだけで、予測確率が間違いとはいえません。繰り返される予測と発生の対応を集団で見ます。
もう少し詳しく知りたいときは、次の基礎で補えます。
- 検査が陽性でも、病気のある人の割合が違うのはなぜ?「病気なら陽性」と「陽性なら病気」は分母が違う。
同じ予測帯の発生割合を比べる
再就職や契約継続の予測で、70%と予測された人の集団を考えます。指定期間内の観測割合が約70%なら、その帯で予測と発生が対応しています。何の出来事をいつまで予測したのかを一致させることが必要です。
同じ70%でも一年以内と一か月以内は異なる問いです。また帯の人数が少なければ発生割合も偶然で動きます。一人ずつの当たり外れを並べるだけでなく、帯ごとの不確かさも含めて評価します。
「70%」を少し広い帯にまとめる場合は、帯の中の予測値と人数も読みます。60%から80%を一つにした発生率を、全員が厳密に70%と予測された結果と混同しません。曲線や帯の作り方が判断の解像度に関わります。
全体平均だけでは帯別のずれが残る
全体の平均予測確率が実際の発生率に合うことを平均較正といいます。これは予測帯ごとの対応より弱い条件です。低い予測帯で過小、高い帯で過大なら、ずれが全体で相殺される場合があります。
そのため平均だけ合う報告から、70%という個々の予測帯も合っているとはいえません。予測値と観測割合を対応させた較正曲線を見れば、どの範囲で高すぎる又は低すぎるかを検討できます。
平均が合うことは無意味ではありません。集団全体の発生見込みを考える一つの条件になります。ただしその証拠で帯ごとの判断まで保証しないことが大切です。どの水準の較正を評価したのかを言葉で指定します。
順位を当てる力とは別に測る
識別は、出来事が起きた人へ起きなかった人より高い得点を付ける力です。AUCはその順位に関係する指標であり、予測の数字が発生確率として合うかとは異なります。
全員の予測が高すぎても、順位自体がよければ識別は良好な場合があります。支援の対象人数や費用を確率から見込むときには、順位が良いだけでは足りません。何を模型の良さと呼んだのかを読む必要があります。
例えば予測値を全部大きくした場合、元の順位が保たれていても確率の意味は変わります。同じ人を上位に置く模型か、何人が発生するかを適切に見込む模型かという二つの問いを、評価指標へ結び付けます。
対象や時期が変われば対応も調べ直す
開発時の集団から地域や時期が変われば、発生率や人の特性、測定・実施条件も変わりえます。集団や政策の時間変化も、較正に関わります。
新しい評価データで十分な観測を確保し、較正を調べ直します。開発データに合う結果を示しただけでは、別の集団や将来に同じ確率を保証しません。良い順位、良い確率、実際の意思決定への有用性をそれぞれ読むことが大切です。
評価した集団を明記すれば、予測を使う集団との違いを考えられます。地域名だけでなく、出来事の定義や追跡期間が同じかも確認します。長い期間の発生割合を短い期間の予測へ当てるような比較は較正の評価になりません。
- 較正
予測70%の帯で、指定期間内の発生割合が約70%に対応するか。
- 識別
起きる人へ、起きない人より高い得点を付けられるか。
全体平均の較正が良くても、帯ごとの較正が良いとは限らない。
全体だけならずれが隠れる
架空の二群各100人に、A群20%、B群80%の発生確率を予測したとします。実際の発生がA群40人、B群60人なら、平均予測も全体発生率も50%です。
しかしA群は20%対40%、B群は80%対60%で、帯ごとには合っていません。この例は平均の一致が、予測帯ごとの較正を保証しないことを示します。
考えるときの注意点
- 確率予測を集団で評価する方法を扱う。個別医療判断は扱わない。
持ち帰る見方
- 較正は予測確率と観測割合の対応。
- 全体平均と帯別の較正を分ける。
- 別の集団や時期でも評価する。
次に広がる疑問
- 検査が陽性でも、病気のある人の割合が違うのはなぜ?
- 過去のデータにぴったり合う予測は、将来も正確?
- 判定の基準を変えると、見逃しと誤判定はどう動く?
順番に読んでいる方へ
出典
Calibration: the Achilles heel of predictive analytics(Ben Van Calster et al./BMC Medicine(原方法論論文))https://link.springer.com/article/10.1186/s12916-019-1466-7
確認日:2026-10-07
本文の出典・補足
同じ予測帯の発生割合を比べる
確率予測の較正は予測リスクと観測した発生割合の対応を問う。例えば予測10%の人々で発生が約10%なら、その帯で対応している。
- 対象
- 2019年論文。確率予測の較正の概念と評価。臨床実測結果は採らない。
- 条件
- 対象と追跡期間をそろえ、新しい評価データで集団として比較。
- 例外・限界
- 個人の結果が一つしかないことから、その人の確率の正否を直接判定できない。
Calibration: the Achilles heel of predictive analytics(Ben Van Calster et al./BMC Medicine(原方法論論文))https://link.springer.com/article/10.1186/s12916-019-1466-7
全体平均だけでは帯別のずれが残る
平均予測と全体発生率が一致する平均較正と、予測値ごとに対応する較正は異なる。
- 対象
- 2019年論文。確率予測の較正の概念と評価。臨床実測結果は採らない。
- 条件
- 確率帯の発生割合/較正曲線も検討。
- 例外・限界
- 平均だけ合っていても高リスク帯や低リスク帯が合うとは限らない。
Calibration: the Achilles heel of predictive analytics(Ben Van Calster et al./BMC Medicine(原方法論論文))https://link.springer.com/article/10.1186/s12916-019-1466-7
順位を当てる力とは別に測る
識別は発生者へ非発生者より高い得点を付ける力であり、良い識別を持つ模型でも予測確率が全体的に高すぎる場合がある。
- 対象
- 2019年論文。確率予測の較正の概念と評価。臨床実測結果は採らない。
- 条件
- AUCと較正を別の軸として評価。
- 例外・限界
- AUCの高さだけで確率の妥当性や施策の有用性を保証しない。
Calibration: the Achilles heel of predictive analytics(Ben Van Calster et al./BMC Medicine(原方法論論文))https://link.springer.com/article/10.1186/s12916-019-1466-7
対象や時期が変われば対応も調べ直す
集団の発生率・特性・測定方法・実施条件が変わると外部の較正が崩れうる。
- 対象
- 2019年論文。確率予測の較正の概念と評価。臨床実測結果は採らない。
- 条件
- 評価標本が十分で、帯別の不確かさも考慮。
- 例外・限界
- 開発データでの一致を別の地域や将来へ保証しない。
Calibration: the Achilles heel of predictive analytics(Ben Van Calster et al./BMC Medicine(原方法論論文))https://link.springer.com/article/10.1186/s12916-019-1466-7