ひと目でわかる仕組み
使う場面
- 新規の社会介入・政策プログラムの効果を介入前から計画的に検証したい
- 比較条件と割当を事前に設計し、介入の因果効果を検討したい
- 参加者が十分に多く、無作為割付が技術的・倫理的に実施可能な場面
- 開発援助・社会政策の資金配分の根拠として強力なエビデンスを求められている
向かない場面
- 過去に受けた介入を後から無作為割当に変更することはできない。既存事業でも新規参加者や追加施策の割当を設計できる場合は別途検討する。
- 介入の恩恵を対照群から差し控えることが倫理的に許容されない場面(緊急人道支援など)
- 介入が地域・社会全体を対象とし、対照群を設定できない大規模政策(段階的実施による準実験的工夫を検討)
参加者・体制と成果物
主任評価者・統計専門家・フィールドコーディネーター・倫理審査委員会。規模によっては専門評価機関(J-PAL等)との連携が現実的
主な成果物
- 評価報告書(ITT分析結果・効果量・信頼区間)
- ベースライン・エンドライン調査データセット
- 事前登録済み試験計画書
- 外的妥当性・政策含意の考察
実施手順
- 評価クエスチョンと効果の仮説を設定対象者、介入、比較条件、主要アウトカム、追跡期間と推定したい効果を事前に決める。複数指標の扱いと分析計画を記録する。
- サンプルサイズ計算と検出力分析実務上意味のある効果、分散、有意水準、検出力、脱落見込みから必要数を設計する。クラスター割当ではクラスター数・大きさ・群内相関も考慮する。数値の設定理由を示す。
- 倫理審査と事前登録対象者の権利、利益と負担、同意、比較条件を検討し、適用される倫理審査・登録手続を確認する。適切な登録先や分析計画の公開方法を選ぶ。UMIN-CTRを全ての社会実験の共通要件としない。
- ベースライン調査と無作為割付割当方法と実施記録を残し、割当の予見や操作を防ぐ。事前の特性を記録するが、群の平均が完全一致することや基準時点の検定が有意でないことを無作為化成功の証明にしない。
- 介入の実施と追跡介入群への介入内容・対照群の処置を忠実に記録する。脱落(attrition)の発生状況をモニタリングし、脱落が偏っていないか確認する。
- エンドライン調査と分析介入終了後にエンドライン調査を実施。分析はIntention-to-Treat(ITT)を基本とし、割付通りに実施されたかどうかに関わらず割付グループで比較する。
- 結果報告と外的妥当性の検討効果量と信頼区間を報告する。効果が示された条件・対象集団を明記し、他のコンテキストへの一般化可能性の限界を率直に議論する。
長所と限界
長所
- 適切な無作為割当は、介入前の特性による割当の偏りを防ぎ、群間比較による因果推論の基礎になる
- 観測・未観測の特性は割当によって期待値上で均衡するが、個々の試験で同一になる保証はない
- 事前のプロトコルと分析計画、変更記録の公開が透明性と批判的検討を助ける
- 蓄積されたRCT結果はメタ分析・系統的レビューに統合しやすく、エビデンスの累積に貢献する
限界
- 内的妥当性は高くても、特定の文脈・集団から得られた結果が別の文脈に当てはまるか(外的妥当性・一般化可能性)は別問題
- 実施可能性の制約:十分な参加者の確保、長期的な追跡調査、対照群への介入差し控えが難しい場面は多い
- 平均的な効果の推定だけでは作用機序が分からないことがある。プロセス評価等を併設して検討する。
- 既に終えた割当は変更できない。継続事業への適用可能性は、新たに無作為化できる介入や対象の有無による。
⚠ よくある落とし穴
- 脱落(attrition)の差異を見落とす——介入群と対照群で追跡できなかった人の特性が異なる場合、比較が歪む。脱落率と脱落者の属性を必ず両群で比較すること
- Hawthorne効果(観察されていることへの反応)——参加者が「試験中」と認識することで行動を変える可能性がある。ブラインド化が難しい社会実験では特に注意
- 「統計的有意」と「実質的意義のある効果量」の混同——大きなサンプルでは小さな効果も有意になる。効果量と信頼区間を必ず報告する
- 倫理手続きの軽視——誰かを介入から除外することへの倫理的説明責任を怠ると、実施拒否・レピュテーションリスクを招く
適用条件と根拠
案内方法を無作為に割り付ける
説明用の仮想例です。通常案内と追加の個別案内へ各100人を無作為割付し、全員の申込状況を確認した仮想計算です。100人は必要標本数の推奨値ではありません。
| 割付群 | 申込人数/割付人数 | 申込率 |
|---|---|---|
| 追加案内 | 60/100 | 60% |
| 通常案内 | 45/100 | 45% |
| ITTの差 | 60%−45% | 15パーセントポイント |
この例から判断できること
差は案内を割り付けた効果の点推定です。実際に案内を読んだ人だけを選び直しません。統計的不確実性と必要標本数はこの算式例からは判断できません。
判断で間違えやすいこと
案内を読んだ人だけで比較する
見直し方: 割付群によるITTを事前に定め、実際の利用状況は別に示す
理由: 利用者だけを選ぶと無作為化で得た比較可能性が失われるためです。
RCTなら欠測を除けば偏りがないとする
見直し方: 群別の欠測数と理由を調べ感度分析を行う
理由: 無作為割付は追跡される確率まで等しくする保証ではないためです。
参照資料と確認箇所
- The elements of a randomized evaluationMichael Gibson・Anja Sautmann/J-PAL
- 参照箇所
- 3. Designing the evaluation / 4. Randomization / 5. Data analysis
- 本文との対応
- 無作為化後も脱落、不遵守、波及が内的妥当性を脅かし、別の集団への一般化には追加の検討が必要です。
- Magenta Book Annex A: Analytical methods for use within an evaluationHM Treasury / Evaluation Task Force · 2026
- 参照箇所
- A2.1 pp.20–21, How is it used? / Pros and cons: design before implementation, statistical power, control group exposure, ethics
- 本文との対応
- 無作為割付を介入実施前の設計へ組み込めるか、十分な検出力を確保できるか、比較群へ介入の影響が及ばないという前提と倫理上のリスクを確認します。
このページの引用情報
評価コンパス編集.「ランダム化比較試験」. 評価コンパス, 2026-10-07更新. https://evalcompass.jun-nakatani.com/methods/rct/
閲覧日は利用者が追記してください。本サイトが作成した本文の再利用はCC BY 4.0。引用・外部資料・同梱フォントには、それぞれの利用条件が適用されます。再利用時は出所とライセンスへのリンクを示し、変更した場合はその旨を表示してください。
更新履歴
- — 定義と適用条件の出典を確認し、仮想事例、判断理由、全欄の記入例を追加。未確認の歴史・普及に関する断定を整理。 既存の手順・留意点も点検し、固定的な人数・閾値や制度の一般化を調整。 入力欄の位置・型・個数を保ち、フォームの固定条件や閾値の表記を修正。
- — Magenta Book Annex A(May 2026)のA2.1を、介入実施前の無作為割付設計・検出力・比較群への影響・倫理の確認に限定して追加。既存の定義、有限標本・欠測への注意、J-PAL出典、ワークシートと記入例は維持。

