分析・統合統制変数予測交絡制御量的分析因果推論

回帰分析

Regression Analysis
別名: 重回帰分析、ロジスティック回帰、多変量解析

結果変数と説明変数の関係をモデルで表す方法です。予測、関連の記述、効果推定の目的を分け、結果の種類に合うモデルと仮定を確認します。 [2] [1]

内容更新: 資料確認日: (AI照合を含む)人の監修記録なし説明用の仮想例あり編集方針・確認範囲このページを引用訂正したい箇所を伝える
難易度 中級 費用 低 期間 作業計画の参考例(共通の標準時間ではありません):1〜2週間(データ整備・モデル構築・解釈を含む)

ひと目でわかる仕組み

  1. リサーチクエスチョンとモデルの目的の設定
  2. 変数の準備とデータクリーニング
  3. 基礎的な相関・関連の確認
  4. 回帰モデルの構築と投入
  5. モデル適合度と診断
  6. 係数の解釈と報告
実施手順の流れ。各段階の内容は「実施手順」で確認できます。

線形回帰では、説明変数の値に応じた結果の平均を式で表します。二値の結果や件数では、ロジスティック回帰など異なるモデルを検討します。 [2] [1]

係数の解釈はモデル、単位、調整した変数によって変わります。残差や外れ値、誤差の依存を診断し、観察データの回帰で調整しても未観測交絡が残ることを明記します。 [2] [1]

使う場面

  • 複数の背景要因を統制した上で、特定のプログラム変数が成果指標に与える影響を推定したいとき
  • 成果に影響する要因を特定し、どこに介入すれば効果が大きいかを判断したいとき
  • ロジスティック回帰でサービス到達・脱落・目標達成などの二値アウトカムの予測因子を探索したいとき
  • 大規模行政データや統計調査データを使って事業の費用・効果パターンを分析したいとき

向かない場面

  • データ量と変動に対してモデルが複雑すぎ、安定した推定や検証ができない場合。必要数は説明変数の数だけで決められない。
  • 回帰に変数を加えただけで因果効果を確定したい場合。問い、割当過程、交絡と測定を検討する設計が必要で、手法名だけで因果推論の強さは決まらない。
  • 非線形や相互作用があるのに、それを表さない単純な線形モデルだけを用いる場合。回帰自体は非線形を扱う設計にも拡張できる。

参加者・体制と成果物

統計・データ分析の知識を持つ評価担当者1〜2名。RやPython・SPSSなどの統計ソフト使用スキルが必要。

主な成果物

  • 回帰係数表(非標準化係数・標準化係数・p値・95%信頼区間)
  • モデル診断プロット(残差分布・Q-Qプロット)
  • 結果の解釈レポート(効果量・実質的意味・限界の明示)

実施手順

  1. リサーチクエスチョンとモデルの目的の設定
    予測か効果推定かを明確にする。効果推定の場合は交絡変数の理論的特定(DAG:有向非巡回グラフの作成が推奨)を先に行う。
  2. 変数の準備とデータクリーニング
    従属変数・独立変数・統制変数を特定し、欠損値・外れ値を処理する。カテゴリ変数はダミー変数化(基準カテゴリを明示)、連続変数は分布を確認する。
  3. 基礎的な相関・関連の確認
    変数の分布と相互関係を確認する。多重共線性は二変数の相関だけでは捉えられないため、設計行列や係数の不安定さを含めて診断する。
  4. 回帰モデルの構築と投入
    理論に基づいて独立変数を投入する(Enter法)。変数増減を繰り返すステップワイズ法はデータドリブンな選択になりやすく、理論的根拠のない変数を統制変数に加えない。
  5. モデル適合度と診断
    目的とモデルに応じた適合・予測性能を調べる。線形回帰では残差の形や分散、依存、影響の強い観測を確認する。ロジスティック回帰に同じ残差正規性やR²をそのまま要求しない。VIFの固定閾値だけで変数を採否しない。
  6. 係数の解釈と報告
    係数の単位と条件付けた変数、推定の不確実性を示す。ロジスティック回帰のオッズ比をリスク比と混同しない。標準化係数の大小を因果的な重要度順位としない。

長所と限界

長所

  • 他の変数を条件にした関連や予測をモデル化できる。因果効果の解釈には別途、設計と仮定が必要。
  • ExcelやR・Python・SPSSなど多くのツールで実施でき、政策・実務への応用例が豊富
  • 変数と成果の関連を検討できるが、係数の大きさだけで介入の優先順位を決めない。
  • ロジスティック回帰は医療・社会政策でのリスク因子分析・ターゲティングに広く使われる実績がある

限界

  • 観察データでは内生性(独立変数と誤差項の相関)が排除できず、因果的解釈には常に留保が必要
  • 測定されていない交絡変数(未観測交絡)がある限り、推定は関連の記述に留まる
  • モデルの誤特定(変数の選び間違い・非線形を線形で近似)が結果を歪める
  • 多数の変数を試みる探索的分析では偽陽性の問題が生じる

⚠ よくある落とし穴

  • 統計的に有意なので、プログラムが効果を持つという因果的解釈の飛躍 — 観察回帰では関連があるとのみ述べ、因果については設計上の限界を必ず明記する
  • 過剰な変数投入(Overfitting)— サンプルサイズに対して変数が多すぎるとモデルがデータに過適合し、汎化性能が低下する
  • 共線性を無視すると個々の係数が不安定になる。診断指標と領域知識、推定したい問いを合わせて対応を検討する。

適用条件と根拠

  • 誤差や関数形に関する仮定を点検し、予測の適合と因果の根拠を区別します。 [1]
仮想例・実績ではありません

相談時間から待ち時間を予測する

説明用の仮想例です。仮想的な線形モデルを「予測待ち時間=5+2×先行相談件数」と設定します。

先行相談件数予測値意味
2件9分5+2×2
5件15分5+2×5

この例から判断できること

係数2はこのモデルで先行相談が1件多い時の平均待ち時間の差です。相談件数を1件減らせば必ず2分短縮するという因果効果ではありません。

判断で間違えやすいこと

係数が有意なので原因だとする

見直し方: 識別設計と未観測交絡を検討する

理由: 統計的関連と因果効果は別だからです。

R²が高いので新しい拠点でも当たるとする

見直し方: 対象外のデータや期間で予測誤差を確認する

理由: 学習データへの適合は一般化性能を保証しないためです。

参照資料と確認箇所

  1. NIST/SEMATECH e-Handbook: What are the typical underlying assumptions in process modeling?
    NIST
    参照箇所
    Underlying assumptions
    本文との対応
    誤差や関数形に関する仮定を点検し、予測の適合と因果の根拠を区別します。
    資料確認日: (AI照合を含む)
  2. NIST/SEMATECH e-Handbook: Linear Least Squares Regression
    NIST/SEMATECH
    参照箇所
    Definition of a Linear Least Squares Model / Disadvantages of Linear Least Squares
    本文との対応
    回帰モデルと線形最小二乗法、外れ値・外挿の限界
    資料確認日: (AI照合を含む)

このページの引用情報

評価コンパス編集.「回帰分析」. 評価コンパス, 2026-10-07更新. https://evalcompass.jun-nakatani.com/methods/regression-analysis/
閲覧日は利用者が追記してください。本サイトが作成した本文の再利用はCC BY 4.0。引用・外部資料・同梱フォントには、それぞれの利用条件が適用されます。再利用時は出所とライセンスへのリンクを示し、変更した場合はその旨を表示してください。

このページの訂正・改善を伝える

更新履歴
  • — 定義と適用条件の出典を確認し、仮想事例、判断理由、全欄の記入例を追加。未確認の歴史・普及に関する断定を整理。 既存の手順・留意点も点検し、固定的な人数・閾値や制度の一般化を調整。 入力欄の位置・型・個数を保ち、フォームの固定条件や閾値の表記を修正。
  • — 独立内容点検(content-check-causal)に基づく訂正。VIFを変数ペアの指標と誤読しないよう、表の見出しと説明を修正。入力位置・数は維持。