経済の基礎
一度きりなら損な協力も、付き合いが続けば維持できる?
協力を破った今日の得より、今後失う関係の利益が大きいなら、協力を保つ誘因があります。反復ゲームはこの比較を考える模型です。付き合いが続くだけで、どんな協力も必ず維持できるという意味ではありません。
基本の用語
一度きりのゲームでは、その回の利得を比べます。反復ゲームでは、相手が過去の行動を見て次の選択を変えるため、将来の得も現在の行動に関わります。
もう少し詳しく知りたいときは、次の基礎で補えます。
- 相手の出方で最善の選択が変わるのはなぜ?相手の行動を条件に、自分の最適反応を比べる。
- 会社が数社あるのに、競争が弱くなることはある?企業数に加え、相手の反応・参入・共同の行為を読む。
今日の得に、将来の取引を足す
反復ゲームでは、各期の行動を過去の履歴に応じて選び、利得は将来の各期の利得を割り引いて合計する。
履歴に応じた戦略とは、前回協力した相手へ今回は協力し、破った相手へは別の行動を選ぶといった計画です。現在の一手だけでなく、どの履歴の後に何をするかを決めておきます。
将来の一円を今日と同じ価値で数えるとは限りません。割引因子δが大きいほど将来の利得を重く見ます。このページの基本模型は無限回続き、双方が過去の行動を確かめられる条件を置きます。
逸脱の上乗せと、失う継続利益を比べる
一度でも逸脱すれば以後ずっと段階ゲームのNash均衡へ戻る戦略では、一回の逸脱益と将来に失う利益を比較し、将来を十分重く評価する場合に協力を維持できることがある。
毎回の協力利得を3、片方だけ破った回の利得を5、その後の非協力を毎回1と置きます。ずっと協力なら3を積み重ね、今破るなら5の後に1が続きます。今日の2の上乗せと、未来の毎回2の損を比べます。
割引因子が0.6なら、協力の合計は3÷(1−0.6)=7.5です。逸脱なら5+0.6×1÷(1−0.6)=6.5で、協力が有利です。0.4なら合計5と約5.67で逆になります。数字は誘因を比べる架空設定です。
罰を与える側にも、続ける理由が要る
逸脱者への処罰で処罰者自身も損をするなら、処罰者がその行動を続ける誘因も必要である。処罰すると宣言しただけで反復ゲームの均衡になるわけではない。
ここで逸脱後に戻る非協力を、一回のゲームでも互いに最適なナッシュ均衡と置く理由があります。処罰を実行する側が別の行動で得をするなら、その処罰を前提にした協力は支えられないからです。
過去の行動が見えない場合には、逸脱があったかを判断できません。単なる悪い結果と意図的な逸脱を区別できるかも重要です。完全監視の計算を、結果が不確かな取引へそのまま適用しません。
付き合いが長いだけでは、結果は一つにならない
反復ゲームで維持できる利得は一つとは限らず、協力が可能であることは、現実で必ずその協力が選ばれることを意味しない。
協力を維持できる条件が見つかっても、全員がそれを選ぶとは定まりません。最初から非協力を続ける戦略も、段階ゲームの均衡を毎回選ぶなら成立しえます。可能な均衡と実際に選ばれた慣行は別です。
取引先との信頼を読むときは、何が観察でき、継続すると誰が何を得るかを探します。協力そのものが社会に望ましいかも別の評価です。企業間の協調が維持できるという模型だけで、その行動を正当化することはできません。
架空例の合計は無限に先まで続く利得を今日の価値へ直したものです。毎回3の協力なら3+3δ+3δの二乗と続きます。逸脱した回は割り引かず、その後の1だけがδ倍から始まります。二つの合計の時点をそろえると、今日の逸脱益を一回多く数える誤りを防げます。
- 協力を続ける
毎回の利得3
- 一度破る
今期5、以後毎回1
過去の行動を観察でき、非協力が段階ゲームの均衡であると置く。
条件を置いた具体例
架空の例
協力なら毎回3、一度だけ破ればその回5、以後は毎回1になる二者を考えます。非協力は双方がその後選び続けたい均衡だと置きます。
将来を0.6で割り引くなら協力7.5、逸脱6.5です。将来を0.4で割り引くなら協力5、逸脱約5.67です。同じ一回の利得でも、関係の未来をどれだけ重く見るかで比較が変わります。
持ち帰る見方
- 協力を破った今日の得より、今後失う関係の利益が大きいなら、協力を保つ誘因があります。
- 反復ゲームで維持できる利得は一つとは限らず、協力が可能であることは、現実で必ずその協力が選ばれることを意味しない。
次に広がる疑問
- 相手の出方で最善の選択が変わるのはなぜ?
- 仕事を任せると、なぜ監督が必要になる?
順番に読んでいる方へ
出典
Repeated Games, MIT 14.126 (2016)(MIT OpenCourseWare / Mihai Manea)https://ocw.mit.edu/courses/14-126-game-theory-spring-2016/3fc58b6d07a73055a44dcbc5aaacc738_MIT14_126S16_Repeated.pdf
確認日:2026-10-05
本文の出典・補足
今日の得に、将来の取引を足す
反復ゲームでは、各期の行動を過去の履歴に応じて選び、利得は将来の各期の利得を割り引いて合計する。
- 対象
- 無限回続く同じ段階ゲームと完全監視の模型。
- 条件
- 全員が過去の行動を観察し、共通の割引率0<δ<1を持ち、逸脱後は段階ゲームのNash均衡へ戻る。
- 例外・限界
- 将来を十分重く評価することは実際の全関係での協力保証ではない。処罰側にも実行の誘因が要る。
Repeated Games, MIT 14.126 (2016)(MIT OpenCourseWare / Mihai Manea)https://ocw.mit.edu/courses/14-126-game-theory-spring-2016/3fc58b6d07a73055a44dcbc5aaacc738_MIT14_126S16_Repeated.pdf
逸脱の上乗せと、失う継続利益を比べる
一度でも逸脱すれば以後ずっと段階ゲームのNash均衡へ戻る戦略では、一回の逸脱益と将来に失う利益を比較し、将来を十分重く評価する場合に協力を維持できることがある。
- 対象
- 無限回続く同じ段階ゲームと完全監視の模型。
- 条件
- 全員が過去の行動を観察し、共通の割引率0<δ<1を持ち、逸脱後は段階ゲームのNash均衡へ戻る。
- 例外・限界
- 将来を十分重く評価することは実際の全関係での協力保証ではない。処罰側にも実行の誘因が要る。
Repeated Games, MIT 14.126 (2016)(MIT OpenCourseWare / Mihai Manea)https://ocw.mit.edu/courses/14-126-game-theory-spring-2016/3fc58b6d07a73055a44dcbc5aaacc738_MIT14_126S16_Repeated.pdf
罰を与える側にも、続ける理由が要る
逸脱者への処罰で処罰者自身も損をするなら、処罰者がその行動を続ける誘因も必要である。処罰すると宣言しただけで反復ゲームの均衡になるわけではない。
- 対象
- 無限回続く同じ段階ゲームと完全監視の模型。
- 条件
- 全員が過去の行動を観察し、共通の割引率0<δ<1を持ち、逸脱後は段階ゲームのNash均衡へ戻る。
- 例外・限界
- 将来を十分重く評価することは実際の全関係での協力保証ではない。処罰側にも実行の誘因が要る。
Repeated Games, MIT 14.126 (2016)(MIT OpenCourseWare / Mihai Manea)https://ocw.mit.edu/courses/14-126-game-theory-spring-2016/3fc58b6d07a73055a44dcbc5aaacc738_MIT14_126S16_Repeated.pdf
付き合いが長いだけでは、結果は一つにならない
反復ゲームで維持できる利得は一つとは限らず、協力が可能であることは、現実で必ずその協力が選ばれることを意味しない。
- 対象
- 無限回続く同じ段階ゲームと完全監視の模型。
- 条件
- 全員が過去の行動を観察し、共通の割引率0<δ<1を持ち、逸脱後は段階ゲームのNash均衡へ戻る。
- 例外・限界
- 将来を十分重く評価することは実際の全関係での協力保証ではない。処罰側にも実行の誘因が要る。
Repeated Games, MIT 14.126 (2016)(MIT OpenCourseWare / Mihai Manea)https://ocw.mit.edu/courses/14-126-game-theory-spring-2016/3fc58b6d07a73055a44dcbc5aaacc738_MIT14_126S16_Repeated.pdf