分析・統合量的分析データ要約クロス集計効果量評価報告

記述統計・クロス集計

Descriptive Statistics and Cross-tabulation
別名: 基本統計、単純集計、クロス表、度数分布

度数や割合、平均・中央値などでデータの分布を要約する方法です。単位、分母、欠測を示し、一つの代表値で全体を言い切らないようにします。 [1] [2]

内容更新: 資料確認日: (AI照合を含む)人の監修記録なし説明用の仮想例あり編集方針・確認範囲このページを引用訂正したい箇所を伝える
難易度 初級 費用 低 期間 作業計画の参考例(共通の標準時間ではありません):数時間〜2日(データクリーニングと集計・グラフ作成を含む)

ひと目でわかる仕組み

  1. データクリーニングと変数の確認
  2. 度数分布・パーセンテージの作成
  3. 代表値・散布度の算出
  4. クロス集計表の作成
  5. 効果量の算出(必要に応じて)
  6. 図表の作成と結果の解釈
実施手順の流れ。各段階の内容は「実施手順」で確認できます。

平均は合計を件数で割った値、中央値は並べたデータの中央の値です。分布の歪みや極端値があると、両者は異なる情報を示します。 [1]

クロス集計では属性の組合せごとに件数と割合を整理します。このページの実務例では、行・列のどちらを分母にしたかと対象期間を明記し、観察した差を因果効果と区別します。 [2]

使う場面

  • アンケート調査やモニタリングデータを収集した後、まず全体像を把握・報告したいとき
  • 受益者の属性別(性別・年齢・地域等)にサービス到達状況や満足度を比較したいとき
  • 評価報告書の基礎データとして、数値の要約と図表を作成するとき
  • 介入前後の変化を平均値・中央値などで示し、効果量で変化の大きさを伝えたいとき

向かない場面

  • 因果関係(介入が成果を引き起こしたか)を実証したい場合 — 記述統計は関係を記述するだけで因果は示せない
  • ごく少数のデータから母集団へ一般化したい場合は限界が大きい。少数でも個々の値を記述すること自体は可能。
  • 質的データのみで構成される評価(自由記述・インタビュー) — テーマ分析や内容分析が適する

参加者・体制と成果物

評価担当者1〜2名。データ収集担当との連携が必要。統計担当が別にいる場合は共同作業。

主な成果物

  • 度数分布表・記述統計量一覧
  • クロス集計表(属性別・グループ別)
  • 効果量算出シート(介入前後比較)
  • 図表を含む基礎集計報告書

実施手順

  1. データクリーニングと変数の確認
    欠損値・外れ値・入力誤りを確認し、変数の尺度(名義・順序・間隔・比率)を把握する。尺度に応じて使用できる統計量が異なるため、この工程は省略できない。
  2. 度数分布・パーセンテージの作成
    各変数の度数(件数)と有効パーセントを集計する。カテゴリ変数は度数表、連続変数はヒストグラムや値の列記など件数と目的に合う方法で分布形状を確認する。欠損値の扱いを明示する。
  3. 代表値・散布度の算出
    分布形状と伝えたい内容に応じ、平均、中央値、標準偏差、四分位範囲などを選ぶ。平均の利用に正規分布を必須とせず、偏りや外れ値がどう影響するかを示す。
  4. クロス集計表の作成
    関心のある2変数(例:グループ×満足度)の組み合わせで集計表を作る。行パーセントか列パーセントかを統一し、注釈に明示する。カイ二乗検定で関連の有無を確認してもよい。
  5. 効果量の算出(必要に応じて)
    差を要約する場合は元の単位の差や目的に合う尺度を示し、分母と対象を明記する。推測統計を行う場合は標本設計と仮定に合う区間等を加える。記述統計にp値を必須とせず、効果量の固定区分で重要性を決めない。
  6. 図表の作成と結果の解釈
    棒グラフ・折れ線・円グラフ・箱ひげ図を用途に合わせて選択し、視覚化する。数値を事実として提示するだけでなく、評価クエスチョンに照らした解釈コメントを付記する。

長所と限界

長所

  • 専門的な統計知識が少なくてもExcelや表計算ソフトで実施でき、参入障壁が低い
  • 評価報告書の基礎として読者が理解しやすい形でデータを提示できる
  • 効果量を加えることで、サンプルサイズの大小に左右される有意性検定の限界を補える
  • クロス集計でサブグループ間の差異を可視化でき、公平性の評価にも使える

限界

  • 相関・関連は記述できても因果関係の実証はできない
  • 外れ値1つで平均値が大きく変動するなど、代表値の選択を誤ると実態を誤解させる
  • 大量の変数を機械的にクロス集計すると偶然有意な関係が生じる多重比較問題が起きる
  • 自由記述や観察など質的データの豊かさを捉えられない

⚠ よくある落とし穴

  • 平均値だけ報告して分布の形(偏り・外れ値)を確認しない — ヒストグラムや箱ひげ図も必ず確認し、必要なら中央値を補足する
  • p値が小さい=重要な発見という混同 — 大規模データではわずかな差でも有意になる。効果量と信頼区間を必ず合わせて報告する
  • 人数だけで規模の異なる群を比べない。人数と分母、割合を併記し、少人数の割合の不安定さも示す。

適用条件と根拠

  • 極端値や歪みがある場合、平均と中央値の違いを見て代表値を解釈します。 [1]
仮想例・実績ではありません

相談の待ち時間を要約する

説明用の仮想例です。仮想の5件の待ち時間が5、5、10、10、70分だったとします。

指標値読み方
平均20分合計100分÷5件
中央値10分並べた中央の3件目
最小〜最大5〜70分長い待ちが一件ある

この例から判断できること

平均20分だけでは多くの人の待ち方と長時間待った人の経験が分かりません。分布と長い待ちの理由を合わせて確認します。

判断で間違えやすいこと

未回答を0で埋めて平均する

見直し方: 欠測数と扱いを示し、有効回答を分母とする

理由: 0が実測値である場合と欠測は違うためです。

属性別の割合で分母を混ぜる

見直し方: 行割合か列割合かを表に記す

理由: 同じ件数でも分母によって答える問いが異なるためです。

参照資料と確認箇所

  1. NIST/SEMATECH e-Handbook: Measures of Location
    NIST
    参照箇所
    Definition of Location / Why Different Measures
    本文との対応
    極端値や歪みがある場合、平均と中央値の違いを見て代表値を解釈します。
    資料確認日: (AI照合を含む)
  2. NIST/SEMATECH e-Handbook 7.4.5: How can we compare the results of classifying according to several categories?
    NIST
    参照箇所
    Contingency Table approach / Contingency table classifying defects / Column and Row probabilities
    本文との対応
    複数の分類を行・列に組み合わせ、各セルに該当件数を整理する分割表の基本構造。
    資料確認日: (AI照合を含む)

このページの引用情報

評価コンパス編集.「記述統計・クロス集計」. 評価コンパス, 2026-09-13更新. https://evalcompass.jun-nakatani.com/methods/descriptive-statistics/
閲覧日は利用者が追記してください。本サイトが作成した本文の再利用はCC BY 4.0。引用・外部資料・同梱フォントには、それぞれの利用条件が適用されます。再利用時は出所とライセンスへのリンクを示し、変更した場合はその旨を表示してください。

このページの訂正・改善を伝える

更新履歴
  • — 定義と適用条件の出典を確認し、仮想事例、判断理由、全欄の記入例を追加。未確認の歴史・普及に関する断定を整理。 既存の手順・留意点も点検し、固定的な人数・閾値や制度の一般化を調整。 分布の完成チェックを、少数値の列記による確認とも整合する表記へ修正。 記入例と完成確認の対応、条件付きの手順を再点検。 クロス集計の定義には、平均・中央値とは別のNIST分割表の該当節を対応付けた。