ひと目でわかる仕組み
- リサーチクエスチョンとモデルの目的の設定
- 変数の準備とデータクリーニング
- 基礎的な相関・関連の確認
- 回帰モデルの構築と投入
- モデル適合度と診断
- 係数の解釈と報告
使う場面
- 複数の背景要因を統制した上で、特定のプログラム変数が成果指標に与える影響を推定したいとき
- 成果に影響する要因を特定し、どこに介入すれば効果が大きいかを判断したいとき
- ロジスティック回帰でサービス到達・脱落・目標達成などの二値アウトカムの予測因子を探索したいとき
- 大規模行政データや統計調査データを使って事業の費用・効果パターンを分析したいとき
向かない場面
- データ量と変動に対してモデルが複雑すぎ、安定した推定や検証ができない場合。必要数は説明変数の数だけで決められない。
- 回帰に変数を加えただけで因果効果を確定したい場合。問い、割当過程、交絡と測定を検討する設計が必要で、手法名だけで因果推論の強さは決まらない。
- 非線形や相互作用があるのに、それを表さない単純な線形モデルだけを用いる場合。回帰自体は非線形を扱う設計にも拡張できる。
参加者・体制と成果物
統計・データ分析の知識を持つ評価担当者1〜2名。RやPython・SPSSなどの統計ソフト使用スキルが必要。
主な成果物
- 回帰係数表(非標準化係数・標準化係数・p値・95%信頼区間)
- モデル診断プロット(残差分布・Q-Qプロット)
- 結果の解釈レポート(効果量・実質的意味・限界の明示)
実施手順
- リサーチクエスチョンとモデルの目的の設定予測か効果推定かを明確にする。効果推定の場合は交絡変数の理論的特定(DAG:有向非巡回グラフの作成が推奨)を先に行う。
- 変数の準備とデータクリーニング従属変数・独立変数・統制変数を特定し、欠損値・外れ値を処理する。カテゴリ変数はダミー変数化(基準カテゴリを明示)、連続変数は分布を確認する。
- 基礎的な相関・関連の確認変数の分布と相互関係を確認する。多重共線性は二変数の相関だけでは捉えられないため、設計行列や係数の不安定さを含めて診断する。
- 回帰モデルの構築と投入理論に基づいて独立変数を投入する(Enter法)。変数増減を繰り返すステップワイズ法はデータドリブンな選択になりやすく、理論的根拠のない変数を統制変数に加えない。
- モデル適合度と診断目的とモデルに応じた適合・予測性能を調べる。線形回帰では残差の形や分散、依存、影響の強い観測を確認する。ロジスティック回帰に同じ残差正規性やR²をそのまま要求しない。VIFの固定閾値だけで変数を採否しない。
- 係数の解釈と報告係数の単位と条件付けた変数、推定の不確実性を示す。ロジスティック回帰のオッズ比をリスク比と混同しない。標準化係数の大小を因果的な重要度順位としない。
長所と限界
長所
- 他の変数を条件にした関連や予測をモデル化できる。因果効果の解釈には別途、設計と仮定が必要。
- ExcelやR・Python・SPSSなど多くのツールで実施でき、政策・実務への応用例が豊富
- 変数と成果の関連を検討できるが、係数の大きさだけで介入の優先順位を決めない。
- ロジスティック回帰は医療・社会政策でのリスク因子分析・ターゲティングに広く使われる実績がある
限界
- 観察データでは内生性(独立変数と誤差項の相関)が排除できず、因果的解釈には常に留保が必要
- 測定されていない交絡変数(未観測交絡)がある限り、推定は関連の記述に留まる
- モデルの誤特定(変数の選び間違い・非線形を線形で近似)が結果を歪める
- 多数の変数を試みる探索的分析では偽陽性の問題が生じる
⚠ よくある落とし穴
- 統計的に有意なので、プログラムが効果を持つという因果的解釈の飛躍 — 観察回帰では関連があるとのみ述べ、因果については設計上の限界を必ず明記する
- 過剰な変数投入(Overfitting)— サンプルサイズに対して変数が多すぎるとモデルがデータに過適合し、汎化性能が低下する
- 共線性を無視すると個々の係数が不安定になる。診断指標と領域知識、推定したい問いを合わせて対応を検討する。
適用条件と根拠
- 誤差や関数形に関する仮定を点検し、予測の適合と因果の根拠を区別します。 [1]
相談時間から待ち時間を予測する
説明用の仮想例です。仮想的な線形モデルを「予測待ち時間=5+2×先行相談件数」と設定します。
| 先行相談件数 | 予測値 | 意味 |
|---|---|---|
| 2件 | 9分 | 5+2×2 |
| 5件 | 15分 | 5+2×5 |
この例から判断できること
係数2はこのモデルで先行相談が1件多い時の平均待ち時間の差です。相談件数を1件減らせば必ず2分短縮するという因果効果ではありません。
判断で間違えやすいこと
係数が有意なので原因だとする
見直し方: 識別設計と未観測交絡を検討する
理由: 統計的関連と因果効果は別だからです。
R²が高いので新しい拠点でも当たるとする
見直し方: 対象外のデータや期間で予測誤差を確認する
理由: 学習データへの適合は一般化性能を保証しないためです。
参照資料と確認箇所
- NIST/SEMATECH e-Handbook: What are the typical underlying assumptions in process modeling?NIST
- 参照箇所
- Underlying assumptions
- 本文との対応
- 誤差や関数形に関する仮定を点検し、予測の適合と因果の根拠を区別します。
- NIST/SEMATECH e-Handbook: Linear Least Squares RegressionNIST/SEMATECH
- 参照箇所
- Definition of a Linear Least Squares Model / Disadvantages of Linear Least Squares
- 本文との対応
- 回帰モデルと線形最小二乗法、外れ値・外挿の限界
このページの引用情報
評価コンパス編集.「回帰分析」. 評価コンパス, 2026-10-07更新. https://evalcompass.jun-nakatani.com/methods/regression-analysis/
閲覧日は利用者が追記してください。本サイトが作成した本文の再利用はCC BY 4.0。引用・外部資料・同梱フォントには、それぞれの利用条件が適用されます。再利用時は出所とライセンスへのリンクを示し、変更した場合はその旨を表示してください。
更新履歴
- — 定義と適用条件の出典を確認し、仮想事例、判断理由、全欄の記入例を追加。未確認の歴史・普及に関する断定を整理。 既存の手順・留意点も点検し、固定的な人数・閾値や制度の一般化を調整。 入力欄の位置・型・個数を保ち、フォームの固定条件や閾値の表記を修正。
- — 独立内容点検(content-check-causal)に基づく訂正。VIFを変数ペアの指標と誤読しないよう、表の見出しと説明を修正。入力位置・数は維持。

