分析・統合自由記述分析共起ネットワークKH Coder生成AI大量テキスト

テキストマイニング・AI支援分析

Text Mining and AI-Assisted Analysis
別名: 計量テキスト分析、KH Coder、自然言語処理、NLP

文章を語や文書単位で処理し、頻度や共起などのパターンを調べる方法です。分析単位と前処理を記録し、結果を原文へ戻して解釈します。 [1]

内容更新: 資料確認日: (AI照合を含む)人の監修記録なし説明用の仮想例あり編集方針・確認範囲このページを引用訂正したい箇所を伝える
難易度 中級 費用 低 期間 作業計画の参考例(共通の標準時間ではありません):1〜4週間(前処理・分析・解釈・検証を含む)

ひと目でわかる仕組み

  1. テキストデータの準備と前処理
  2. 形態素解析と語の単位の調整
  3. 頻出語の確認と除外語の設定
  4. 共起ネットワーク・クラスター分析の実施
  5. コーディングとの統合(必要に応じて)
  6. 解釈と人間による検証
実施手順の流れ。各段階の内容は「実施手順」で確認できます。

語を抽出し、表記ゆれや除外語、複合語の扱いを決めます。共起は同じ文や文書に現れる関係であり、設定する単位や語の選択で図が変わります。 [1]

頻出語や共起図だけで発言の意味は確定しません。生成AIによる分類や要約を補助に使う場合も、これは当サイトの運用提案として、原文照合、機密情報の扱い、修正記録を必要とします。 [1]

使う場面

  • アンケートの自由記述が数百件以上あり、全て手動でテーマ分析・内容分析するには時間的に困難な場合
  • 複数年度の自由記述データを比較し、語彙・テーマの経時的変化を探索したいとき
  • インタビュー記録・会議議事録の大量データから、主要テーマ・頻出キーワードの分布を把握したいとき
  • 生成AIをコーディング補助・要約の初稿作成に活用し、評価者が結果を検証・修正する体制が整っているとき

向かない場面

  • データの量や語彙のばらつきが分析目的に対して不足する場合。文書数の一律閾値では決めず、原文を読める規模なら質的分析も検討する。
  • 語句の出現頻度ではなく、語りの文脈・ニュアンス・矛盾の深い解釈が主目的の場合 — テキストマイニングは表層的なパターン抽出であり、解釈的質的分析の代替にはならない
  • 必要なデータを適切な権限と保護の下で扱う環境がない場合。外部AIへの送信はテキストマイニングの必須工程ではない。

参加者・体制と成果物

テキストの前処理・集計・原文確認を担う担当者。使用するソフトの分析単位と設定を理解し、データの取扱条件を確認する。

主な成果物

  • 頻出語一覧・語彙統計表
  • 共起ネットワーク図(クラスター・サブグラフ)
  • テキストマイニング補助コードブック(頻出語とテーマの対応)
  • テキストマイニング方法・設定の記述(前処理設定・ツールバージョン等)

実施手順

  1. テキストデータの準備と前処理
    収集したテキスト(自由記述・トランスクリプト等)をCSVまたはプレーンテキスト形式に整形する。KH Coderでは文字コードをUTF-8に統一する。前処理として、分析に不要なノイズ(URL・記号・無関係な定型文)を除去する。
  2. 形態素解析と語の単位の調整
    KH Coderの形態素解析(MeCab等)を実行し、テキストを単語に分割する。固有名詞・複合語(例:「プログラム評価」を1語として扱う)は「強制抽出語」として登録する。品詞フィルター(名詞・動詞・形容詞を主な分析対象にする等)を設定する。
  3. 頻出語の確認と除外語の設定
    頻出語一覧を確認し、分析上意味のない高頻出語(「思う」「ある」「する」等の機能語)を除外語リストに登録する。残った頻出語が「この調査で何が語られているか」の概観を与える。
  4. 共起ネットワーク・クラスター分析の実施
    共起ネットワーク分析(Jaccard係数等で共起の強さを測定)を実行し、頻出語のネットワーク図を生成する。ネットワークのクラスター(意味の塊)を確認し、評価クエスチョンに関連するテーマの候補を特定する。
  5. コーディングとの統合(必要に応じて)
    テキストマイニングで特定したテーマ候補を、KH Coderのコーディング機能で元テキストに紐づける。または、テーマ分析・内容分析のコードブック開発の補助として、頻出語・共起パターンを活用する。
  6. 解釈と人間による検証
    テキストマイニングの結果は出発点であり、結論ではない。頻出語・共起ネットワークが示すパターンを元のテキスト(原文)に立ち返って解釈・検証する。「ツールが見つけたテーマ」を評価者が批判的に解釈することが不可欠。

長所と限界

長所

  • 多くの文書の語や出現パターンを集計し、原文を検討する手がかりを得られる
  • 頻度・共起の可視化により、分析者が見落としがちなテーマや予想外のパターンを発見できる
  • KH Coderは日本語対応・無料・学術実績が豊富で、評価実務者でも習得可能
  • テーマ分析・内容分析の事前探索(どのテーマが重要か)の補助として活用でき、効率化に貢献する

限界

  • 単語の頻度や共起だけでは文脈、皮肉、暗示的な意味を捉えきれず、原文の確認が必要
  • 分析結果の解釈には相応の質的分析の知識が必要であり、ツールが出力するネットワーク図を「そのまま結果」として報告することはできない
  • 生成AI(LLM)によるコーディング補助は再現性・検証可能性・プライバシー管理の面で未解決の課題が多い
  • 前処理の設定(形態素解析の設定・除外語・最小頻度)によって結果が変わるため、設定の透明な記録が必要

⚠ よくある落とし穴

  • 共起ネットワーク図を提示して終わる報告 — 図は分析の入口。各クラスターが何を意味するか、評価クエスチョンとどう関連するかという解釈なしには分析として成立しない
  • 生成AIに個人情報・機密情報を入力する — 受益者の自由記述をそのままクラウドの生成AIサービスに送信すると、個人情報保護・機密保持に違反するリスクがある。データの匿名化と組織規定の確認が必須
  • 生成AIの出力を検証なしに分析結果として使用する — LLMのコーディング出力はハルシネーション(事実でない内容)を含む可能性があり、必ず原文との照合・人間による検証が必要

適用条件と根拠

  • 共起ネットワークは共起単位と語・辺の選定条件に依存するため、設定と原文を確認します。 [1]
仮想例・実績ではありません

「時間」が表す異なる困りごとを確認する

説明用の仮想例です。仮想の自由記述から時間という語を抽出します。

仮想原文語の集計だけでは不明な点文脈での整理
時間が足りず入力をやめた何の時間か申込作業の負担
時間に余裕ができた困りごとか成果か支援後の変化
時間はかからなかった否定の扱い負担が小さい経験

この例から判断できること

時間の頻度だけで全てを時間不足と分類しません。否定と対象、前後関係を読み、手作業の解釈と機械集計を往復します。

判断で間違えやすいこと

共起している語を因果関係と読む

見直し方: 同じ単位で出現した関係として扱う

理由: 共起は原因の方向を示さないためです。

AIのテーマ名をそのまま確定する

見直し方: 各テーマの根拠となる原文と反例を確認する

理由: 要約は否定や少数の声を落とす可能性があるためです。

参照資料と確認箇所

  1. KH Coder 3 Reference Manual
    Koichi Higuchi
    参照箇所
    Part A: Co-Occurrence Network of Words
    本文との対応
    共起ネットワークは共起単位と語・辺の選定条件に依存するため、設定と原文を確認します。
    資料確認日: (AI照合を含む)

このページの引用情報

評価コンパス編集.「テキストマイニング・AI支援分析」. 評価コンパス, 2026-09-13更新. https://evalcompass.jun-nakatani.com/methods/text-mining/
閲覧日は利用者が追記してください。本サイトが作成した本文の再利用はCC BY 4.0。引用・外部資料・同梱フォントには、それぞれの利用条件が適用されます。再利用時は出所とライセンスへのリンクを示し、変更した場合はその旨を表示してください。

このページの訂正・改善を伝える

更新履歴
  • — 定義と適用条件の出典を確認し、仮想事例、判断理由、全欄の記入例を追加。未確認の歴史・普及に関する断定を整理。 既存の手順・留意点も点検し、固定的な人数・閾値や制度の一般化を調整。