評価用語集

評価実務で頻出する用語を日英併記で解説します。関連する手法ページへのリンクつき。

アウトカムOutcome

活動や産出を経て生じる対象者・組織などの変化。本サイトでは行動や状態の変化を整理する語として用いるが、知識・技能の変化をアウトプットに含める資料もある。利用する制度・資料の定義を先に確認する。

アウトプット(産出)Output

活動が直接生み出すサービスや成果物。回数・人数だけでなく質も確認する。成果の分類は資料によって異なるため、「何を提供したか」と「誰にどんな変化があったか」を区別して定義する。

アトリビューション(帰属)Attribution

観察された変化と介入の因果関係を判断すること。他の要因の影響を検討し、変化の全てを一つの事業の成果と決めつけない。貢献(Contribution)は他要因そのものを意味する語ではない。

エビデンスEvidence

問いや判断を支える情報・根拠。データの質、集め方、分析方法、問いへの関連性を確かめる。手法名だけで強さを決めず、何についての証拠かを明確にする。

EBPMEvidence-Based Policy Making

政策目的を明確にし、合理的な根拠に基づいて政策を企画・検討すること。評価結果や統計を判断につなげ、資料が支持する範囲と不確実性を説明する。

参照: 内閣府におけるEBPMへの取組 — EBPMの定義
インパクトImpact

介入がもたらす重要な上位の影響。正負や意図しない影響も含む。DAC基準での意味と、因果効果を指すインパクト評価での用法は同じではなく、単に遠い将来の成果だけを指すとも限らない。

インセプションレポートInception Report

評価開始段階に、評価者がTORへの理解と具体的な進め方を示す文書。評価の枠組み、方法、制約、作業計画などを発注者と共有し、調査に入る前に認識を合わせる。内容・提出時期は契約や評価の体制に合わせる。

インパクト評価Impact Evaluation

介入が生んだ因果的な変化や、上位の目標への到達を検討する評価。実験・準実験のほか、理論に基づく非実験的な方法もある。明示的な反事実比較による効果推定だけを指す用法もあるため、採用する意味を示す。

内的妥当性Internal Validity

観察された差を他の要因と区別し、介入の因果効果として適切に推定できている程度。比較対象の選び方や交絡、実施中の変化などを点検する。研究手法の名前だけで妥当性が保証されるわけではない。

参照: Gertlerほか(2016)Impact Evaluation in Practice, Second Edition(World Bank/IDB) — 第4章 pp.71–74:内的・外的妥当性とFigure 4.2
外的妥当性External Validity

評価で得た結果を、対象とする母集団や別の集団・文脈へどこまで一般化できるかという観点。内的妥当性が高くても一般化できるとは限らない。サンプルの代表性に加え、適用先との条件の違いを確認する。

参照: HM Treasury(2026)Magenta Book — 脚注25:内的・外的妥当性/3.5 Experimental and quasi-experimental impact evaluation methods
外部評価External Evaluation

資金提供組織と実施組織の外部にいる個人・組織による評価。外部所属だけで独立性が保証されるわけではない。情報へのアクセス、調査・報告の自律性、資金や報告系統による圧力も確認する。

カウンターファクチュアル(反事実)Counterfactual

介入を受けなかった場合にどうなっていたかという比較上の状態。同一対象の介入あり・なしを同時には観察できないため、設計と仮定に基づいて推定する。

学習(ラーニング)Learning

評価で得た情報を理解し、個人や組織の判断・実践に反映する過程。報告を読んだだけで利用されたとみなさず、何を変えたかを記録する。

参照: CDC Program Evaluation Framework, 2024 — Cross-Cutting Actions:Learn From and Use Insights
形成的評価Formative Evaluation

事業の本格実施に向けた適切さ・実現可能性などを確認し、設計や運営の改善に使う評価。実施中の改善も含め、具体的な適用範囲は採用する枠組みで確認する。

参照: CDC Program Evaluation Framework, 2024 — Types of Evaluation:Formative evaluation
効果量Effect Size

差や関連の大きさを示す指標。平均値差のような元の単位の指標と、Hedgesのgなど標準化した指標がある。数値の意味は尺度・比較対象・不確実性と一緒に読む。

参照: Lakens(2013)Calculating and reporting effect sizes to facilitate cumulative science — 本文pp.1–3:効果量と区間推定/Differences and similarities between effect sizes
効率性Efficiency

DAC評価基準の一つ。資源を使って成果を経済的かつ適時に生み出しているか、またはその見込みがあるかを問う。実行可能な代替案との比較や、状況変化を踏まえた実施時期、運営の効率も検討する。

交絡Confounding

介入への参加と結果の両方に関係する別の要因が、因果効果の推定をゆがめること。例えば研修参加者の元々の意欲が参加にも収入にも影響するなら、参加者と非参加者の収入差を研修だけの効果とみなせない。

参照: Gertlerほか(2016)Impact Evaluation in Practice, Second Edition(World Bank/IDB) — 第3章 pp.58–59:参加への意欲と収入が関係する職業訓練の例
コーディング(質的分析)Coding (Qualitative Analysis)

語りや記録の意味にラベルを付け、問いに関連するパターンを検討する作業。評価者間一致を重視する流派もあるが、リフレクシブ・テーマ分析などに一律の一致率基準を課さない。

参照: Braun & Clarke — Thematic Analysis FAQs — What’s the difference between a code and a theme?/Why don’t we advocate multiple-coders and inter-rater reliability for reflexive TA?
コントリビューション(貢献)Contribution

他の要因とともに変化を生み出すうえで、事業が果たす役割。貢献分析では変化の仮説を証拠と照合する。貢献の説明から一律の寄与率が計算できるわけではない。

自己評価Self-evaluation

事業の設計・実施に責任を持つ人が、自らその事業を評価すること。組織内の別部門による内部評価とは区別する。学習への活用を計画するとともに、判断基準や不利な証拠の扱いを明らかにする。

事後評価Ex-post Evaluation

介入の完了後に行う評価。終了後の影響や便益の継続などを確認する。実施時期に共通の年数ルールを置かず、成果が現れる時期と評価目的から決める。

事前評価Ex-ante Evaluation

介入の実施前に行う評価。評価目的に応じて、必要性や設計、実現可能性、想定リスクなどを検討する。特定の図や手法を必須とせず、実施の判断や設計改善に必要な問いを設定する。

持続性Sustainability

DAC評価基準の一つ。介入による純便益が続いているか、または続く見込みがあるかを問う。財政・制度・社会・環境などの能力に加え、継続を脅かすリスクや便益間のトレードオフを検討する。

指標Indicator

介入、その成果、周囲の状況に関する状態や進捗を捉える量的・質的な項目。指標だけで対象の全てを表せるとは限らない。実務では定義、情報源、測定時期、数値なら単位や必要な分母を記録し、目標値と分ける。

受益者Beneficiary

介入によって直接または間接に便益を受ける人・集団・組織。予定した対象以外を含むこともある。サービスを受けた人全員に便益が生じたとは限らないため、想定した受益者と実際に便益を得た人を区別する。

信頼性Reliability

データや評価判断の一貫性・安定性。類似した条件と手順で繰り返した際に、同様の結果を得られるかを確認する。何を測れているかという妥当性とは別で、一貫していても目的に合う測定とは限らない。

選択バイアスSelection Bias

参加・対象選定に関係する要因と結果が結びつき、単純比較が因果効果を正しく表さなくなる偏り。偏りは過大・過小のどちらにもなり得る。割付後の脱落も点検する。

参照: Gertlerほか(2016)Impact Evaluation in Practice, Second Edition(World Bank/IDB) — 第3章 pp.58–59:Counterfeit Counterfactual Estimate 2(Self-Selected Groups)
セオリー評価Theory-based Evaluation

事業の成果メカニズムに関する理論(プログラムセオリー・セオリー・オブ・チェンジ)を評価の枠組みとして用いるアプローチ。「なぜ機能するか(または機能しないか)」を明らかにすることを重視し、箱と矢印の仮説を実証的に検証する。

参照: HM Treasury(2026)Magenta Book Annex A — A1. Theory-based methods for impact evaluation/A1.2. Realist evaluation
説明責任(アカウンタビリティ)Accountability

活動・判断・資源の利用などを関係者に説明し、その責任を果たすこと。報告書の提出だけでなく、根拠や判断過程を追える記録と対話を含めて考える。

総括的評価Summative Evaluation

介入やその段階の終了時に、期待した成果がどの程度生じたかを調べ、価値や重要性を判断するための評価。改善に使う形成的評価と目的を区別して考えるが、結果を次の設計改善にも利用できる。

第三者評価Third-party Evaluation

実施者などから距離を置いた第三者の立場で行う評価を指す一般語。本サイトでは特定制度の資格・独立性要件を意味しない。独立性は名称だけで判断せず、情報へのアクセスや調査・報告への圧力を確認する。

参照: OECD(2023)Glossary of Key Terms in Evaluation and Results-Based Management for Sustainable Development, Second Edition — p.32 External evaluation/p.38 Independent evaluation(本サイトの一般語への対応)
ターゲット(目標値)Target

指標について、特定の時点までに達成を目指す値や水準。ベースラインは現状を表し、目標値は目指す状態を表す。実務では設定の根拠、期限、利用できる資源を記録する。

DAC評価基準DAC Evaluation Criteria

OECD-DACの評価基準。妥当性、整合性、有効性、効率性、インパクト、持続性の6観点から価値を検討する。すべてを同じ重さで採点する一律の手順ではない。

参照: OECD — Evaluation criteria — Principles for using evaluation criteria/Six lenses to analyse an intervention and its results
デッドウェイトDeadweight

介入がなくても起きたと見込まれる変化。SROIなどで過大な成果主張を避けるために推定する。他者の寄与や置換も別に検討し、差し引くだけで因果関係が証明されたとはみなさない。

参照: A guide to Social Return on Investment(2012) — Stage 4:4.1 Deadweight and displacement/4.2 Attribution(pp.56–61)
統計的有意性Statistical Significance

統計的検定で、p値が定めた有意水準を下回るなどの基準を満たすこと。効果の大きさや実務上の重要性とは異なる。p値は「偶然だけで結果が生じた確率」や「仮説が正しい確率」ではなく、設計・効果量・区間推定と併せて判断する。

参照: ASA(2016)Statement on Statistical Significance and P-Values 発表資料 — p.2:6原則と区間推定などの補完的手法
投入(インプット)Input

事業に用いる人材、資金、設備、情報、時間などの資源。ロジックモデルでは活動との関係を記すが、図の特定の列に置くこと自体が定義ではない。

トライアンギュレーションTriangulation

情報源・方法・分析者・理論などを組み合わせ、結果の一致と不一致を検討すること。一致だけを集めず、食い違いが生じた対象や条件も分析する。

参照: BetterEvaluation — Triangulation — Types/Reasons for triangulation
内部評価Internal Evaluation

評価対象の組織に属する部門や個人による評価。事業の設計・実施担当者自身が行う自己評価を含むが、内部の別部門が担う場合もある。担当者の役割、報告先、利益相反への対応を明示する。

ハウソーン効果(ホーソン効果)Hawthorne Effect

観察や研究への参加が、対象者の行動・回答に影響する可能性を表す語。影響の大きさや方向は文脈によって異なり、常に行動が改善する普遍法則として扱わない。

バイアス(偏り)Bias

推定や測定を真の値から一定方向へずらす系統的な偏り。意図的な不正や先入観がなくても生じ、単にデータを増やせば解消するとは限らない。評価では対象選定、質問の仕方、分析手順などを点検する。

参照: NIST OSAC Lexicon — Bias, Statistical — 定義本文/NOTE 1–2
ベースラインBaseline

介入前または測定期間の始まりにおける状態・データ。後の変化を比較する起点になる。未測定を0と置かず、代替資料を使う場合も時期・対象・定義の違いを記す。前後差だけで因果効果は決まらない。

プロセス評価Process Evaluation

事業が計画通りに実施されているか、活動・産出の質・量・対象への到達度はどうかを評価する。「何を・誰に・どのように・どの程度届けたか」を明らかにし、成果評価の解釈を補完する。実施の忠実度(Fidelity)の確認にも用いられる。

参照: CDC Program Evaluation Framework, 2024 — Types of Evaluation:Process or implementation evaluation
参加型評価Participatory Evaluation

対象者などの関係者が、計画、データ収集・解釈、結論や提言、結果の活用に共同で関与する評価アプローチ。実務では誰がどの段階の判断に参加するかを明記し、意見を聞くだけの参加と区別する。

サンプリングSampling

調査対象となる全体(母集団)から、一部の人・組織などを選ぶ手続き。確率抽出と非確率抽出があり、有意抽出や便宜抽出は非確率抽出の例。目的と選び方に応じて、結果をどこまで一般化できるかを検討する。

参照: AAPOR Best Practices for Survey Research — 2. Designing Your Sample:How to Design Your Sample
社会的望ましさバイアスSocial Desirability Bias

回答者が社会的に望ましい、または聞き手に好まれると考える回答を選ぶことで生じる偏り。無意識に起こることもある。質問の表現や調査員の影響、対面と本人だけで回答する方式の違いを検討する。

参照: AAPOR Best Practices for Survey Research — 3. Designing your questionnaire:What are some best practices for writing survey questions?/How can I measure change over time?
ステークホルダーStakeholder

介入やそのモニタリング・評価に、直接または間接に利害・関心を持つ人、集団、組織。受益者、実施者、資金提供者などが含まれる。実務では影響を受ける側の声が抜けていないかも確認する。

中間評価Mid-term Evaluation

介入の実施期間のおおむね中間に行う評価。進捗の確認や設計・運営の見直しなど、目的に合わせて問いを設定する。実施の要否や時期は事業・制度ごとに確認する。

TOR(業務指示書)Terms of Reference

評価の目的・範囲、方法、判断基準、資源、期間、報告要件などを定める文書。発注者と評価者が作業内容を共有する基礎になる。実務では、開始段階で具体化した方法や変更点も記録する。

妥当性Validity

評価の論理や事実上の根拠が適切である程度。測定については、意図したものを指標や調査方法が捉えているかを指す。結果が一貫しているという信頼性だけで、妥当性が確認されたとはいえない。

妥当性(relevance)Relevance

DAC評価基準の一つ。介入の目的や設計が、受益者・社会・関係組織などのニーズ、方針、優先事項に応えているかを問う。優先事項間の違いや、状況が変わった後も適切であるかを検討する。

第三者評価基準(評価スタンダード)Evaluation Standards

評価の質を点検するための規範や基準。JCSEEのプログラム評価基準は、有用性・実行可能性・適切性・正確性・評価の説明責任という観点を示す。各基準の適用方法は原文と評価の状況を照合する。

参照: JCSEE Program Evaluation Standards — Utility/Feasibility/Propriety/Accuracy/Evaluation Accountability Standards
飽和Saturation (Theoretical Saturation)

追加データが概念や分析に新たな理解を加えなくなる状態を検討する考え方。理論的飽和とコード・データの飽和は区別し、採用する質的分析の立場に応じて用いる。一律の必要人数ではない。

有意抽出Purposive Sampling

研究目的に合う情報を持つと考えられる対象を、特徴や条件に基づいて意図的に選ぶ方法。最大多様性、基準に合う事例、反証的な事例などを選ぶ。確率抽出による統計的一般化とは区別し、選定理由と結論の適用範囲を示す。

参照: BetterEvaluation — Sample — p.1:Purposive (or Purposeful)
有効性Effectiveness

DAC評価基準の一つ。介入が目標や成果をどの程度達成したか、または達成する見込みかを問う。目標の重要度や集団間での成果の違いも検討する。資源の経済的・適時な利用を問う効率性とは区別する。

ルーブリックRubric

判断する観点ごとに、質や達成度の段階とその状態を記述した枠組み。得られた証拠をどの水準と判断するかを共有し、総合的な結論を導くために使う。表があるだけで判断が自動的に一致するわけではない。

無作為抽出Random Sampling

母集団から確率的な仕組みで調査対象を選ぶこと。単純無作為抽出では各対象の選ばれる確率が等しい。介入を振り分ける無作為割付とは目的が異なり、非回答や抽出台帳の漏れにも注意する。

参照: Gertlerほか(2016)Impact Evaluation in Practice, Second Edition(World Bank/IDB) — 第15章 pp.261–266:Drawing a Sample/Box 15.1
メタ評価Meta-evaluation

評価それ自体の質・信頼性・有用性を評価する行為(評価の評価)。個別の評価が評価基準や倫理に照らして適切に実施されたかを検証する。複数の評価・研究を統計的に統合するメタ分析(Meta-analysis)とは概念が異なる点に注意が必要。

参照: JCSEE Program Evaluation Standards — Evaluation Accountability Standards:E2 Internal Metaevaluation/E3 External Metaevaluation
ミックスドメソッズMixed Methods

量的・質的データの収集・分析と、その結果の統合を組み合わせる研究・評価の設計。調査を並行するだけで終えず、どこで結果を結びつけて問いに答えるかを計画する。

参照: Creswellほか/NIH OBSSR(2011)Best Practices for Mixed Methods Research in the Health Sciences — 本文p.4:What is Mixed Methods Research?/pp.8–9:研究設計と統合
モニタリングMonitoring

指標や関連情報を継続的・体系的に集め、実施の進捗、意図した成果、予期しない変化、資源の利用や周囲の状況を把握する過程。活動数の記録だけに限定せず、管理や評価での利用につなげる。

M&EMonitoring and Evaluation

継続的な追跡・記録であるモニタリングと、価値や変化の理由を体系的に検討する評価を組み合わせること。目的・情報源・役割・利用時期を調整し、日々の管理と判断に必要な情報を得る。

参照: HM Treasury(2026)Magenta Book — 1.7 Aligning evaluation with business planning/1.7.1 Relationship between benefits management and evaluation
評価クエスチョンEvaluation Question

評価が答えるべき核心的な問い。「この事業は対象者の生計を改善したか」「なぜ一部地域で効果が出なかったか」などの形で明示化される。評価クエスチョンは評価目的・利用者のニーズ・利用可能な資源に基づいて選定し、方法論・指標・分析の設計を規定する。

参照: CDC Program Evaluation Framework, 2024 — Focus the Evaluation Questions and Design
評価能力開発(ECB)Evaluation Capacity Building

個人や組織が評価を実施し、結果を理解・活用する力を高める取り組み。知識・技能だけでなく、資源、情報共有の仕組み、評価を支える組織文化も対象になる。評価への参加そのものを学習機会にする場合もある。

参照: CDC Program Evaluation Framework, 2024 — Learn From and Use Insights/Step 1—Assess Context:Evaluation capacity
評価マトリクスEvaluation Matrix

評価クエスチョンと、それに答える情報源や調査方法を対応させた表。必要な証拠の抜けや、複数の情報源で照合できるかを確認する。実務では指標・分析方法・担当・時期など、計画に必要な列を追加する。

参照: BetterEvaluation — Triangulation — Using an evaluation matrix to check triangulation
エンドラインEndline

介入後または測定期間の終わりにおける状態・データ。ベースラインとの変化を把握するために使う。必ず新しい調査を意味するわけではなく、比較する対象・時期・定義を揃える。前後差の全てを事業効果とはみなさない。

用語の定義を共有する

日本語説明は実務のための要約と注意点です。制度や資料によって分類が異なるため、提出先の定義を優先してください。用語名のリンクでその項目を直接共有でき、各項目から参照資料に進めます。

アウトカムとアウトプットの使い分け

このページの引用情報

評価コンパス編集.「評価用語集」. 評価コンパス, 2026-10-07更新. https://evalcompass.jun-nakatani.com/glossary
閲覧日は利用者が追記してください。本サイトが作成した本文の再利用はCC BY 4.0。引用・外部資料・同梱フォントには、それぞれの利用条件が適用されます。再利用時は出所とライセンスへのリンクを示し、変更した場合はその旨を表示してください。

このページの訂正・改善を伝える

更新履歴
  • — 静的本文を利用し、不要なデータ読込を削減。
  • — 全角半角・中黒などの表記揺れと複数語の検索に対応。
  • — 64語の定義を見直し、各用語の固定リンクと参照資料を追加。