数字と報道

予測の幅は、狭くてよく当たるほどよい?

狭い区間だけを評価すると、外れやすさを見落とします。Winklerスコアは区間の幅に、外れた距離への罰則を加え、同じ確率水準の区間を比較する方法です。点予測の誤差と、区間や分布の成績も分けます。

基本の用語

80%予測区間は模型の条件の下で将来値を含む確率に対応する幅です。当たった割合だけでなく、どれくらい広く、どれくらい外れたかも評価の対象になります。

もう少し詳しく知りたいときは、次の基礎で補えます。

幅と外れを一緒に採点する

区間を極端に広げれば、多くの値を含められます。一方、狭くしすぎれば大きく外れる可能性があります。区間の被覆率と幅はどちらも必要な情報なので、区間内に入ったかの二択だけでは予測の有用性を十分に比べられません。

Winklerスコアは区間幅に、実測値が外れた場合の罰則を加えます。実測値が区間内なら幅だけで採点し、外なら端からの距離に比例した分を追加します。小さいスコアが良い方向で、幅を広げることと外れを減らすことを同じ定義の中で扱います。

同じ単位・対象・予測先の区間を比べます。金額の区間幅と件数の区間幅をそのまま一つの表で順位付けしても、尺度が違います。目的に合う対象をそろえ、予測時点で利用できた情報だけから作った区間を評価します。

同じ確率水準を比べる

区間の確率水準を1−αとすると、区間外の実測値には2/α倍の外れ距離を足します。80%区間ならα=0.2なので10倍です。下限より低い場合は下限との差、上限より高い場合は上限との差を用います。

80%と95%では罰則係数が違います。そのため区間確率をそろえず、スコアの数だけを比較しません。同じ確率水準で狭い幅と大きい外れをどう釣り合わせるかを決めた定義なので、水準を変えると採点の条件も変わります。

一回の観測だけで成績を確定せず、目的に合う評価期間のスコアをまとめます。どの時点で大きく外れたかも併記すると、平均スコアだけで見えない条件を探せます。良い結果になった時点だけを選ぶ評価とは区別します。

一点と分布全体の成績を分ける

点予測は中心の値を評価し、分位点は指定した順位の値、区間は二つの端と幅、予測分布は全体の確率を評価します。MAEなど一点の誤差が小さいという結果だけで、80%区間の幅や確率が妥当と結論しないようにします。

上下限が同じでも、80%として出した区間と95%として出した区間は、採点時のαが違います。評価表には幅だけでなく、確率水準と外れ距離を残します。結果を読んだ人が同じ規則で計算を追える形にすることが、比較の基本です。

また外れた距離は、区間の中心からではなく最も近い端からの距離です。実測115、区間90〜110なら5であって、中心100との差15ではありません。幅と追加罰則を別の列にすると、どこでスコアが大きくなったかを説明できます。

Winklerスコアは区間を採点する方法で、予測の前提が正しいことを直接証明する数値ではありません。どの模型で、どの水準の区間を作ったかを示し、評価の成績と条件の確認を併せて読みます。

報告では上下限、確率水準、実測値、外れの距離を対応させます。「狭いからよい」「すべて含むからよい」という単独の判断を避け、同じ定義の評価へつなげます。予測の目的に合う成績を選ぶことも、採点法を使う前の判断です。

Winklerスコアの幅と外れ罰則
  • 区間内

    区間の幅だけを採点する

  • 下限より低い

    幅+2/α×下側の外れ距離

  • 上限より高い

    幅+2/α×上側の外れ距離

1−αが区間の確率水準です。同じ対象・単位・水準で比較します。

80%区間の幅と5件の外れ(架空)

80%区間Aを90〜110件、Bを80〜120件とします。実測が105件なら両方とも区間内で、スコアは幅の20と40です。Aの方が小さい値になります。

実測を115件とすると、Aは5件外れるため20+10×5=70、Bは区間内なので40です。同じ確率水準の下で、狭さと外れへの罰則の両方が採点に入っています。

持ち帰る見方

  • 同じ確率水準の区間を、幅と外れへの罰則で比較できる。
  • 一点の誤差が小さいだけで分布や区間が優秀とはいえない。

次に広がる疑問

  • 複数方法の予測を合わせた区間も同じ方法で採点できる?

順番に読んでいる方へ

学習地図で、ほかの分野とのつながりを見る

出典

  • Forecasting: Principles and Practice §5.9 Evaluating distributional forecast accuracy(Rob J Hyndman / George Athanasopoulos(著者原教材、OTexts))https://otexts.com/fpp3/distaccuracy.html

    確認日:2026-10-07

本文の出典・補足

幅と外れを一緒に採点する

Winklerスコアは区間幅に、実測値が区間外なら外れの距離に応じた罰則を加える。

対象
同じ確率水準の予測区間の幅と、実測値の区間外への外れを評価するWinklerスコア。
条件
同一確率水準1−α、同じ対象・単位で比較。
例外・限界
区間内に入ったかだけの二択評価ではない。
  • Forecasting: Principles and Practice §5.9 Evaluating distributional forecast accuracy(Rob J Hyndman / George Athanasopoulos(著者原教材、OTexts))https://otexts.com/fpp3/distaccuracy.html

同じ確率水準を比べる

実測値が区間内ならスコアは幅そのもので、区間外なら幅に2/α倍の外れ距離を加える。

対象
上下限と実測値を同じ単位で比べる区間スコア。αは区間に対応する外れ確率。
条件
教材のWinkler定義。αは区間外の確率。
例外・限界
80%と95%は罰則係数が違うため水準をそろえる。
  • Forecasting: Principles and Practice §5.9 Evaluating distributional forecast accuracy(Rob J Hyndman / George Athanasopoulos(著者原教材、OTexts))https://otexts.com/fpp3/distaccuracy.html

一点と分布全体の成績を分ける

点予測の誤差を測る指標と、分位点・区間・予測分布を測る指標は評価する対象が異なる。

対象
点予測、分位点、予測区間、予測分布という異なる評価対象。
条件
目的と評価対象を指定。
例外・限界
一点の誤差が小さいだけで分布や区間が優秀とはいえない。
  • Forecasting: Principles and Practice §5.9 Evaluating distributional forecast accuracy(Rob J Hyndman / George Athanasopoulos(著者原教材、OTexts))https://otexts.com/fpp3/distaccuracy.html