数字と報道

説明する数字を増やすほど、回帰の答えは安定する?

説明変数を増やせば、各係数が必ず安定するわけではありません。同じ情報を重ねると係数を分けられず、強く重なる場合もそれぞれの係数の不確かさが増えます。当てはまりのよさと、個別の係数の精度を分けて考えます。

基本の用語

回帰では、ほかの変数をそろえたときの関連を係数で表します。そのため、変数が一緒に動いていると、それぞれを別々に動かす比較が難しくなります。この説明変数の重なりが多重共線性の問題です。

もう少し詳しく知りたいときは、次の基礎で補えます。

同じ情報を二重に入れると係数を分けられない

ある説明変数が、ほかの説明変数の完全な線形結合になっていると、元の全ての係数を一意に求められません。説明変数をX1とX2、その係数をβ1とβ2とします。X2=2X1なら、β1X1+β2X2は(β1+2β2)X1になり、データから二つの係数を別々に識別できません。

これは観測が少ないから推定が少し揺れるという問題とは異なります。完全な関係を保ったまま観測を追加しても、同じ組合せに何通りもの係数を当てられます。どの変数を残し、何を比較したいかを考える必要があります。

似た数字では各係数の不確かさが増える

完全な線形結合でなくても、説明変数同士の重なりが強いと、各係数の推定が不精確になり得ます。ほかの変数から分けて使える変動が小さくなるためです。個別の係数の標準誤差と、模型全体の当てはまりを混同しないことが要点です。

この比較は、説明変数を固定し、誤差の平均が0、分散が同じで互いに無相関という条件で考えます。誤差分散、観測数、その変数自身のばらつきをそろえると、他の説明変数との重なりが増えるほど係数の分散が大きくなります。

二つずつの相関だけでは見落とす

二つの変数の相関だけを調べても、複数の変数による線形関係を見落とす場合があります。一つの変数がほかの複数の変数を合わせたものに近いかどうかも、別に考える必要があります。

VIFは、ある説明変数をほかの説明変数で説明したときの重なりから、係数の分散がどの程度大きくなるかを見る指標です。よく使う目安の数値があっても、それだけで全ての分析に共通する採否の境界が決まるわけではありません。

係数の解釈と当てはめを分ける

係数の精度が悪い場合でも、観測した範囲で変数が一緒に動く組合せを使う当てはまりが、必ず同じ程度に悪くなるとは限りません。しかし、これまでと違う組合せへの予測まで保証されるという意味ではありません。

また重なる変数を一つ外すことは、係数を計算しやすくする対応でも、因果分析に必要な交絡の調整を満たすとは限りません。どの変数を外してよいかは、説明したい関連や因果の問いと、使えるデータに合わせて判断します。

二つの係数を分けられない例

架空の例

X2=2X1のデータで、同じ切片を使って比べます。β1=2、β2=1なら合計の係数β1+2β2は4です。β1=0、β2=2でも4になります。例えばX1=3、X2=6のとき、2×3+1×6も、0×3+2×6も12です。どのX1でも、二つの係数の組合せは同じ予測値を作ります。

このデータでは、X1だけを変えてX2を固定する組合せはありません。予測値が同じだと分かっても、X1を単独で1だけ変えたときの係数をデータから一つに決めたことにはなりません。完全な関係と、重なりが強いが完全ではない関係も区別します。

持ち帰る見方

  • 完全な線形結合では全係数を分けて求められず、強い重なりも精度に関わる。
  • 個別係数、当てはまり、新しい条件の予測、因果の条件を分ける。

次に広がる疑問

  • ほかの変数をそろえる回帰の意味を読む
  • 二つの変数の相関が表す範囲を確かめる
  • 変数の積で条件別の比較を表す方法を読む

順番に読んでいる方へ

学習地図で、ほかの分野とのつながりを見る

出典

  • Multicollinearity(Marco Taboga / Statlect)https://www.statlect.com/fundamentals-of-statistics/multicollinearity

    確認日:2026-10-05

  • Introduction to Econometrics with R — 6.4 OLS Assumptions in Multiple Regression(Christoph Hanck, Martin Arnold, Alexander Gerber, Martin Schmelzer / University of Duisburg-Essen)https://www.econometrics-with-r.org/6.4-ols-assumptions-in-multiple-regression.html

    確認日:2026-10-05

  • An Introduction to Statistical Learning with Applications in R(Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani / Springer)https://www.statlearning.com/s/ISLR-Seventh-Printing.pdf

    確認日:2026-10-05

本文の出典・補足

同じ情報を二重に入れると係数を分けられない

説明変数の一つが他の説明変数の完全な線形結合になると、通常の最小二乗法では個々の係数を一意に決められない。

対象
切片を含む線形回帰の完全共線性。
条件
係数に別の制約を置かず、同じ観測情報から各係数を分離しようとする。
例外・限界
ソフトが変数を落とすなどの処理をしても、元の全係数が識別できたことにはならない。
  • Multicollinearity(Marco Taboga / Statlect)https://www.statlect.com/fundamentals-of-statistics/multicollinearity

  • Introduction to Econometrics with R — 6.4 OLS Assumptions in Multiple Regression(Christoph Hanck, Martin Arnold, Alexander Gerber, Martin Schmelzer / University of Duisburg-Essen)https://www.econometrics-with-r.org/6.4-ols-assumptions-in-multiple-regression.html

似た数字では各係数の不確かさが増える

完全には一致しなくても説明変数が強く重なると、他の条件を同じにしたとき個別の回帰係数の分散が大きくなり、推定が不安定になる。

対象
最小二乗推定の分散を論じる線形回帰モデル。
条件
説明変数を固定して比べ、誤差の平均は0、分散は同じで互いに無相関とする。誤差分散、観測数、対象の説明変数自身のばらつきをそろえ、完全共線性のない範囲で他の説明変数との重なりが高まる比較。
例外・限界
観測数や誤差分散の違いも精度を変えるため、単なる相関の高低だけで全モデルの精度を順位付けできない。
  • Multicollinearity(Marco Taboga / Statlect)https://www.statlect.com/fundamentals-of-statistics/multicollinearity

  • An Introduction to Statistical Learning with Applications in R(Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani / Springer)https://www.statlearning.com/s/ISLR-Seventh-Printing.pdf

二つずつの相関だけでは見落とす

共線性は二つの変数の相関だけでなく、複数の変数を合わせた線形関係でも起こる。VIFは、ある説明変数を残りの説明変数で説明できる程度に対応する診断量である。

対象
多変量の線形関係とVIFによる係数分散の診断。
条件
対象の説明変数を他の全説明変数へ回帰して重なりを調べる。
例外・限界
VIFが特定の数値を超えれば自動的に変数を削る、という普遍的な基準ではない。
  • Multicollinearity(Marco Taboga / Statlect)https://www.statlect.com/fundamentals-of-statistics/multicollinearity

  • An Introduction to Statistical Learning with Applications in R(Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani / Springer)https://www.statlearning.com/s/ISLR-Seventh-Printing.pdf

係数の解釈と当てはめを分ける

個々の係数を分けて推定することと、説明変数を組み合わせた当てはめ値を計算することは別の問題である。重複する変数を落とすかどうかは、係数を解釈したいのか、予測したいのかにもよる。

対象
同じ説明変数の組合せにおける線形モデルの当てはめ。
条件
例えばX2=2X1なら、線形予測部分は(β1+2β2)X1になる。個別のβ1とβ2が分離できなくても、その組合せは計算できる。
例外・限界
未知の組合せや別の集団でも予測が安定すること、変数削除で因果推定が正しくなることを保証しない。
  • An Introduction to Statistical Learning with Applications in R(Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani / Springer)https://www.statlearning.com/s/ISLR-Seventh-Printing.pdf

  • Multicollinearity(Marco Taboga / Statlect)https://www.statlect.com/fundamentals-of-statistics/multicollinearity