数字と報道
調査の途中で何度も結果を見て、効果が出たら止めてよい?
途中で結果を見ることはできます。ただし、毎回ふつうの検定を行い、有意になった回で止めるなら、試験全体で誤って効果ありとする確率が変わります。何回、どの情報量で判断し、どの境界で止めるかを含めて設計します。
基本の用語
一回の検定の有意水準は、効果がない等の帰無仮説の下で誤って棄却する確率を管理するものです。その基準を繰り返す停止規則では、全体として別の問いになります。
もう少し詳しく知りたいときは、次の基礎で補えます。
- たくさん調べて見つけた一つの差は、そのまま信じてよい?一つの検定の有意水準と、多数の比較・結果からの選択による誤検出を分ける。
途中で止める判断も検定の一部
参加者が増えるたびに結果を確認し、ある回のp値が基準を下回ったら終了する、と考えてみます。最初から最後の一回だけで判断する試験に比べ、偶然の大きな差を途中で拾う機会が増えます。各回の名目の有意水準を守っただけでは、全体の誤検出を同じ水準に保てません。
中間と最後のデータには同じ参加者が含まれます。各回は独立した検定ではないため、独立な試行を何回も行った式をそのまま使って計算するのも不適切です。停止する条件まで含めた確率を考えます。
途中解析の回数を報告に書いただけでは十分ではありません。一回ごとの基準を全体の誤り率へどう結び付けたかが必要です。「有意が出たら終了」は単なる事務上の予定ではなく、データから結論を選ぶ規則になります。
全体の誤り率を先に設計する
群逐次法では、効果がない場合に全体としてどれほど誤って成功と判定するかを管理するよう、中間と最終の停止境界を決めます。途中の基準が厳しく見える場合も、試験全体の判断を成立させる設計の一部です。
α消費法は、情報がどれだけ蓄積した段階で誤り確率をどの程度使うかを関数で定める方法です。各回へ自由に同じαを足す仕組みではありません。境界や情報量の定義は、使う検定の確率モデルと対応させます。
予定人数だけでなく、結果の情報がどれくらい集まったかを基準にする設計もあります。そのときは人数と情報量がどう対応するかを説明します。どの設計でも、境界を指定したという記録と実際に使った境界が対応していることが鍵です。
都合のよいタイミングを選ばない
FDAの方法ガイダンスは、α消費法でも比較結果を見て中間解析の時期を選ぶと、誤検出確率が増えうると説明します。例えば今回の結果が停止境界に近いので次の解析を早める、といった変更です。
募集の進み方に合わせた日程の調整と、効果が出そうな結果に合わせた変更は別の条件です。許される柔軟性を理解するには、解析時期がどの情報に基づいて決まる設計かを読む必要があります。
解析担当が比較結果を見られるのかも、変更規則を読む一つの観点です。「柔軟に調整できる」という説明だけでは、結果を使ってよい範囲が分かりません。原方法にある条件を省いて、いつ見てもよいと結論しないようにします。
効果の大きさにも停止の影響がある
有意かどうかを適切に管理しても、効果の大きさまで自動的に正しく推定できるとは限りません。大きな差が出たところで止める規則では、その適応を考慮しない通常の推定値が効果を過大にする場合があります。
報告では中間解析、停止条件、停止に対応する推定と区間の扱いを探します。早く終了した事実だけで不正と決めつけず、計画した判断と実際の判断が対応しているかを確かめます。
早期終了の試験と最後まで続けた試験の点推定を比べる場合も、終了規則を確認します。大きく見えた時点を選んだことに推定が対応しているかが問題であり、終了までに集まった人数を表示するだけでは解決しません。
同じ5%を三回使う計画
架空の学習支援試験で、50人、100人、150人の時点に通常の5%基準で検定し、一度でも有意なら終了する計画を考えます。これは150人になった時点だけで5%基準を使う計画と異なります。
途中の検定が互いに独立ではないので、ここでは全体の確率を数値で決めません。三回の基準を一体として設計することが、途中確認を有効に使う前提です。
考えるときの注意点
- 逐次推論の方法を扱う。個別の医薬品の有効性や承認条件を判断するものではない。
持ち帰る見方
- 停止する規則も検定に含める。
- α消費の柔軟性には条件がある。
- 誤検出の管理と効果推定を併せて読む。
次に広がる疑問
- たくさん調べて見つけた一つの差は、そのまま信じてよい?
- 研究の結果を見る前に、何を登録しておくの?
- 見つけたい差に応じて、調べる人数をどう決める?
順番に読んでいる方へ
出典
Adaptive Designs for Clinical Trials of Drugs and Biologics(米国FDA)https://www.fda.gov/media/78495/download
確認日:2026-10-07
本文の出典・補足
途中で止める判断も検定の一部
同じ蓄積データを中間と最後で検定し、どこかで有意なら成功とする規則は、各回の名目有意水準より全体の第一種過誤を大きくしうる。
- 対象
- 2019年最終ガイダンス。逐次推論の方法説明のみ、医薬品の効果/現行承認条件の説明には転用しない。
- 条件
- 固定標本検定の基準を反復して用いる停止規則。
- 例外・限界
- 中間データは共有されるので独立検定の式は使わない。
Adaptive Designs for Clinical Trials of Drugs and Biologics(米国FDA)https://www.fda.gov/media/78495/download
全体の誤り率を先に設計する
群逐次法では中間・最終の停止境界を決め、試験全体の第一種過誤を管理する。α消費法は情報の蓄積に沿って誤り確率の使い方を指定する。
- 対象
- 2019年最終ガイダンス。逐次推論の方法説明のみ、医薬品の効果/現行承認条件の説明には転用しない。
- 条件
- 検定法の確率モデルに合う境界・消費関数を事前指定。
- 例外・限界
- 各回に同じαを自由に追加する意味ではない。
Adaptive Designs for Clinical Trials of Drugs and Biologics(米国FDA)https://www.fda.gov/media/78495/download
都合のよいタイミングを選ばない
α消費法でも、中間の比較結果が停止境界に近いという理由で次回解析を早めると第一種過誤を増やしうる。
- 対象
- 2019年最終ガイダンス。逐次推論の方法説明のみ、医薬品の効果/現行承認条件の説明には転用しない。
- 条件
- 解析時期変更の規則を計画する。
- 例外・限界
- カレンダー日程の柔軟性と、結果に合わせた時期選択は同じではない。
Adaptive Designs for Clinical Trials of Drugs and Biologics(米国FDA)https://www.fda.gov/media/78495/download
効果の大きさにも停止の影響がある
早期停止等の適応を考慮しない通常の最終推定は効果を過大にし、信頼区間の被覆率も合わない場合がある。
- 対象
- 2019年最終ガイダンス。逐次推論の方法説明のみ、医薬品の効果/現行承認条件の説明には転用しない。
- 条件
- 停止規則に対応する推定・区間を併せて検討。
- 例外・限界
- 第一種過誤管理の成功が通常の効果推定の無偏りを保証しない。
Adaptive Designs for Clinical Trials of Drugs and Biologics(米国FDA)https://www.fda.gov/media/78495/download