ひと目でわかる仕組み
- テキストデータの準備と前処理
- 形態素解析と語の単位の調整
- 頻出語の確認と除外語の設定
- 共起ネットワーク・クラスター分析の実施
- コーディングとの統合(必要に応じて)
- 解釈と人間による検証
使う場面
- アンケートの自由記述が数百件以上あり、全て手動でテーマ分析・内容分析するには時間的に困難な場合
- 複数年度の自由記述データを比較し、語彙・テーマの経時的変化を探索したいとき
- インタビュー記録・会議議事録の大量データから、主要テーマ・頻出キーワードの分布を把握したいとき
- 生成AIをコーディング補助・要約の初稿作成に活用し、評価者が結果を検証・修正する体制が整っているとき
向かない場面
- データの量や語彙のばらつきが分析目的に対して不足する場合。文書数の一律閾値では決めず、原文を読める規模なら質的分析も検討する。
- 語句の出現頻度ではなく、語りの文脈・ニュアンス・矛盾の深い解釈が主目的の場合 — テキストマイニングは表層的なパターン抽出であり、解釈的質的分析の代替にはならない
- 必要なデータを適切な権限と保護の下で扱う環境がない場合。外部AIへの送信はテキストマイニングの必須工程ではない。
参加者・体制と成果物
テキストの前処理・集計・原文確認を担う担当者。使用するソフトの分析単位と設定を理解し、データの取扱条件を確認する。
主な成果物
- 頻出語一覧・語彙統計表
- 共起ネットワーク図(クラスター・サブグラフ)
- テキストマイニング補助コードブック(頻出語とテーマの対応)
- テキストマイニング方法・設定の記述(前処理設定・ツールバージョン等)
実施手順
- テキストデータの準備と前処理収集したテキスト(自由記述・トランスクリプト等)をCSVまたはプレーンテキスト形式に整形する。KH Coderでは文字コードをUTF-8に統一する。前処理として、分析に不要なノイズ(URL・記号・無関係な定型文)を除去する。
- 形態素解析と語の単位の調整KH Coderの形態素解析(MeCab等)を実行し、テキストを単語に分割する。固有名詞・複合語(例:「プログラム評価」を1語として扱う)は「強制抽出語」として登録する。品詞フィルター(名詞・動詞・形容詞を主な分析対象にする等)を設定する。
- 頻出語の確認と除外語の設定頻出語一覧を確認し、分析上意味のない高頻出語(「思う」「ある」「する」等の機能語)を除外語リストに登録する。残った頻出語が「この調査で何が語られているか」の概観を与える。
- 共起ネットワーク・クラスター分析の実施共起ネットワーク分析(Jaccard係数等で共起の強さを測定)を実行し、頻出語のネットワーク図を生成する。ネットワークのクラスター(意味の塊)を確認し、評価クエスチョンに関連するテーマの候補を特定する。
- コーディングとの統合(必要に応じて)テキストマイニングで特定したテーマ候補を、KH Coderのコーディング機能で元テキストに紐づける。または、テーマ分析・内容分析のコードブック開発の補助として、頻出語・共起パターンを活用する。
- 解釈と人間による検証テキストマイニングの結果は出発点であり、結論ではない。頻出語・共起ネットワークが示すパターンを元のテキスト(原文)に立ち返って解釈・検証する。「ツールが見つけたテーマ」を評価者が批判的に解釈することが不可欠。
長所と限界
長所
- 多くの文書の語や出現パターンを集計し、原文を検討する手がかりを得られる
- 頻度・共起の可視化により、分析者が見落としがちなテーマや予想外のパターンを発見できる
- KH Coderは日本語対応・無料・学術実績が豊富で、評価実務者でも習得可能
- テーマ分析・内容分析の事前探索(どのテーマが重要か)の補助として活用でき、効率化に貢献する
限界
- 単語の頻度や共起だけでは文脈、皮肉、暗示的な意味を捉えきれず、原文の確認が必要
- 分析結果の解釈には相応の質的分析の知識が必要であり、ツールが出力するネットワーク図を「そのまま結果」として報告することはできない
- 生成AI(LLM)によるコーディング補助は再現性・検証可能性・プライバシー管理の面で未解決の課題が多い
- 前処理の設定(形態素解析の設定・除外語・最小頻度)によって結果が変わるため、設定の透明な記録が必要
⚠ よくある落とし穴
- 共起ネットワーク図を提示して終わる報告 — 図は分析の入口。各クラスターが何を意味するか、評価クエスチョンとどう関連するかという解釈なしには分析として成立しない
- 生成AIに個人情報・機密情報を入力する — 受益者の自由記述をそのままクラウドの生成AIサービスに送信すると、個人情報保護・機密保持に違反するリスクがある。データの匿名化と組織規定の確認が必須
- 生成AIの出力を検証なしに分析結果として使用する — LLMのコーディング出力はハルシネーション(事実でない内容)を含む可能性があり、必ず原文との照合・人間による検証が必要
適用条件と根拠
- 共起ネットワークは共起単位と語・辺の選定条件に依存するため、設定と原文を確認します。 [1]
「時間」が表す異なる困りごとを確認する
説明用の仮想例です。仮想の自由記述から時間という語を抽出します。
| 仮想原文 | 語の集計だけでは不明な点 | 文脈での整理 |
|---|---|---|
| 時間が足りず入力をやめた | 何の時間か | 申込作業の負担 |
| 時間に余裕ができた | 困りごとか成果か | 支援後の変化 |
| 時間はかからなかった | 否定の扱い | 負担が小さい経験 |
この例から判断できること
時間の頻度だけで全てを時間不足と分類しません。否定と対象、前後関係を読み、手作業の解釈と機械集計を往復します。
判断で間違えやすいこと
共起している語を因果関係と読む
見直し方: 同じ単位で出現した関係として扱う
理由: 共起は原因の方向を示さないためです。
AIのテーマ名をそのまま確定する
見直し方: 各テーマの根拠となる原文と反例を確認する
理由: 要約は否定や少数の声を落とす可能性があるためです。
参照資料と確認箇所
- KH Coder 3 Reference ManualKoichi Higuchi
- 参照箇所
- Part A: Co-Occurrence Network of Words
- 本文との対応
- 共起ネットワークは共起単位と語・辺の選定条件に依存するため、設定と原文を確認します。
このページの引用情報
評価コンパス編集.「テキストマイニング・AI支援分析」. 評価コンパス, 2026-09-13更新. https://evalcompass.jun-nakatani.com/methods/text-mining/
閲覧日は利用者が追記してください。本サイトが作成した本文の再利用はCC BY 4.0。引用・外部資料・同梱フォントには、それぞれの利用条件が適用されます。再利用時は出所とライセンスへのリンクを示し、変更した場合はその旨を表示してください。
更新履歴
- — 定義と適用条件の出典を確認し、仮想事例、判断理由、全欄の記入例を追加。未確認の歴史・普及に関する断定を整理。 既存の手順・留意点も点検し、固定的な人数・閾値や制度の一般化を調整。

