テキストマイニング 実施計画・検証シート
テキストマイニングの結果は探索の起点であり、人間による解釈と原文への立ち返りで完成します。生成AIを使う場合は事前に個人情報・機密情報の有無を確認し、組織規定に従ってください。
テキストマイニング 実施計画・検証シート
基本情報
分析の枠組みを確定する
この項目の記入例(仮想例)
説明用の仮想例です。ご自身の事業に合わせて記入してください。入力内容は変わりません。
- 事業名・評価課題
- 申込自由記述の探索
- 分析するデータの種類と件数(例:自由記述500件)
- 説明用3文(仮想)
- 使用ツール(KH Coder/Rのtidytext等)
- KH Coder 3を候補とする
- 個人情報・機密情報の有無と対応
- 例は創作。実データでは識別情報の除去と利用条件を確認
- 担当者・分析期間
- 担当A/2026年7月(仮想)
記入理由: 短い3文を実用上十分なコーパスとはしません。
前処理の設定記録
分析の再現性のために前処理設定を記録する
この項目の記入例(仮想例)
説明用の仮想例です。ご自身の事業に合わせて記入してください。入力内容は変わりません。
| 設定項目 | 設定内容 | 設定の根拠 |
|---|---|---|
| 共起単位 | 回答文書単位を採用予定 | 回答者をまたぐ関係を作らない |
| 否定 | 原文照合で確認 | 語の有無だけでは意味が逆になるため |
記入理由: 設定を後から再現できる形に残します。
| 設定項目 | 設定内容 | 設定の根拠 |
|---|---|---|
強制抽出語・除外語リスト
分析精度を上げるための語の設定を記録する
この項目の記入例(仮想例)
説明用の仮想例です。ご自身の事業に合わせて記入してください。入力内容は変わりません。
| 語 | 種別(強制抽出/除外) | 設定理由 |
|---|---|---|
| 相談窓口 | 強制抽出の候補 | 概念を分割しない |
| 時間 | 除外しない | 異なる意味を原文で比較する重要語 |
記入理由: 頻度が高いからだけで除外しません。
| 語 | 種別(強制抽出/除外) | 設定理由 |
|---|---|---|
テーマ解釈メモ
共起ネットワークのクラスターと評価クエスチョンの対応を記録する。必ず原文を参照して解釈する
この項目の記入例(仮想例)
説明用の仮想例です。ご自身の事業に合わせて記入してください。入力内容は変わりません。
| クラスター/テーマ候補 | 含まれる頻出語 | 評価クエスチョンとの対応 | 原文から確認した解釈の根拠 |
|---|---|---|---|
| 手続きの時間負担 | 時間・入力 | 申込を妨げる条件 | 時間が足りず入力をやめた(仮想)。他2文は同じテーマにしない |
記入理由: 代表語と根拠文を対応させます。
| クラスター/テーマ候補 | 含まれる頻出語 | 評価クエスチョンとの対応 | 原文から確認した解釈の根拠 |
|---|---|---|---|
完成チェック
この項目の記入例(仮想例)
説明用の仮想例です。ご自身の事業に合わせて記入してください。入力内容は変わりません。
- ☑ 確認済み: 個人情報・機密情報の扱いを組織規定に従って確認した
- ☑ 確認済み: 前処理設定(除外語・最小頻度等)を記録した
- ☑ 確認済み: 共起ネットワーク図を元テキストに立ち返って解釈した
- ☐ 未確認: 生成AIを使った場合は出力を原文照合で検証した
- ☑ 確認済み: テキストマイニングの限界(表層的パターン分析)を報告書に明示した
- ☐ 未確認: ツール名・バージョン・分析設定を方法論セクションに記載した
記入理由: 生成AIはこの例では未使用です。実際のソフトのバージョンと設定値は実行時に記録します。
記入前に、使いどころと完成条件を確認
テキストマイニング 実施計画・検証シートは、テキストマイニング・AI支援分析を会議や個人作業で実行に移すための入力シートです。手法全体の期間は「計画例:1〜4週間(前処理・分析・解釈・検証を含む)」を参考に、規模・体制に合わせて見積もります。分かる欄から仮置きし、未確定事項を次の確認課題として残してください。
このシートが役立つ場面
- アンケートの自由記述が数百件以上あり、全て手動でテーマ分析・内容分析するには時間的に困難な場合
- 複数年度の自由記述データを比較し、語彙・テーマの経時的変化を探索したいとき
- インタビュー記録・会議議事録の大量データから、主要テーマ・頻出キーワードの分布を把握したいとき
参加者と準備
テキストの前処理・集計・原文確認を担う担当者。使用するソフトの分析単位と設定を理解し、データの取扱条件を確認する。
判断に使う資料、既存データ、関係者の認識差を持ち寄ると記入が進みます。
記入の順番
- 1. 基本情報分析の枠組みを確定する
- 2. 前処理の設定記録分析の再現性のために前処理設定を記録する
- 3. 強制抽出語・除外語リスト分析精度を上げるための語の設定を記録する
- 4. テーマ解釈メモ共起ネットワークのクラスターと評価クエスチョンの対応を記録する。必ず原文を参照して解釈する
- 5. 完成チェック
完成の目安
- 頻出語一覧・語彙統計表
- 共起ネットワーク図(クラスター・サブグラフ)
- テキストマイニング補助コードブック(頻出語とテーマの対応)
レビュー時の注意
- 共起ネットワーク図を提示して終わる報告 — 図は分析の入口。各クラスターが何を意味するか、評価クエスチョンとどう関連するかという解釈なしには分析として成立しない
- 生成AIに個人情報・機密情報を入力する — 受益者の自由記述をそのままクラウドの生成AIサービスに送信すると、個人情報保護・機密保持に違反するリスクがある。データの匿名化と組織規定の確認が必須
- 生成AIの出力を検証なしに分析結果として使用する — LLMのコーディング出力はハルシネーション(事実でない内容)を含む可能性があり、必ず原文との照合・人間による検証が必要
記入済みの仮想例を読む(入力内容は変わりません)
説明用の仮想例です。仮想の自由記述から時間という語を抽出します。
基本情報
- 事業名・評価課題
- 申込自由記述の探索
- 分析するデータの種類と件数(例:自由記述500件)
- 説明用3文(仮想)
- 使用ツール(KH Coder/Rのtidytext等)
- KH Coder 3を候補とする
- 個人情報・機密情報の有無と対応
- 例は創作。実データでは識別情報の除去と利用条件を確認
- 担当者・分析期間
- 担当A/2026年7月(仮想)
記入理由: 短い3文を実用上十分なコーパスとはしません。
前処理の設定記録
| 設定項目 | 設定内容 | 設定の根拠 |
|---|---|---|
| 共起単位 | 回答文書単位を採用予定 | 回答者をまたぐ関係を作らない |
| 否定 | 原文照合で確認 | 語の有無だけでは意味が逆になるため |
記入理由: 設定を後から再現できる形に残します。
強制抽出語・除外語リスト
| 語 | 種別(強制抽出/除外) | 設定理由 |
|---|---|---|
| 相談窓口 | 強制抽出の候補 | 概念を分割しない |
| 時間 | 除外しない | 異なる意味を原文で比較する重要語 |
記入理由: 頻度が高いからだけで除外しません。
テーマ解釈メモ
| クラスター/テーマ候補 | 含まれる頻出語 | 評価クエスチョンとの対応 | 原文から確認した解釈の根拠 |
|---|---|---|---|
| 手続きの時間負担 | 時間・入力 | 申込を妨げる条件 | 時間が足りず入力をやめた(仮想)。他2文は同じテーマにしない |
記入理由: 代表語と根拠文を対応させます。
完成チェック
- ☑ 確認済み: 個人情報・機密情報の扱いを組織規定に従って確認した
- ☑ 確認済み: 前処理設定(除外語・最小頻度等)を記録した
- ☑ 確認済み: 共起ネットワーク図を元テキストに立ち返って解釈した
- ☐ 未確認: 生成AIを使った場合は出力を原文照合で検証した
- ☑ 確認済み: テキストマイニングの限界(表層的パターン分析)を報告書に明示した
- ☐ 未確認: ツール名・バージョン・分析設定を方法論セクションに記載した
記入理由: 生成AIはこの例では未使用です。実際のソフトのバージョンと設定値は実行時に記録します。
判断で間違えやすいこと
共起している語を因果関係と読む
見直し方: 同じ単位で出現した関係として扱う
理由: 共起は原因の方向を示さないためです。
AIのテーマ名をそのまま確定する
見直し方: 各テーマの根拠となる原文と反例を確認する
理由: 要約は否定や少数の声を落とす可能性があるためです。
参照資料と確認箇所
- KH Coder 3 Reference ManualKoichi Higuchi
- 参照箇所
- Part A: Co-Occurrence Network of Words
- 本文との対応
- 共起ネットワークは共起単位と語・辺の選定条件に依存するため、設定と原文を確認します。
このページの引用情報
更新履歴
- — 定義と適用条件の出典を確認し、仮想事例、判断理由、全欄の記入例を追加。未確認の歴史・普及に関する断定を整理。 既存の手順・留意点も点検し、固定的な人数・閾値や制度の一般化を調整。


