テキストマイニングのやり方2026|自由記述・逐語録を計量的に分析する手順と限界

テキストマイニングとは、自由記述や逐語録などの文章を単語単位に分解し、出現頻度や語と語のつながりを計量的に分析する手法です。日本語は語の区切りがないため、形態素解析という前処理が最初に必要になります。

データ整形から前処理・形態素解析・集計・解釈までの5工程の図
作業量の大半は分析ではなく前処理に費やされる

どんなときに使うのか?

向いているのは、読み切れない量の自由文があり、全体の傾向をつかみたい場合です。

  • アンケートの自由記述が数百件あり、手作業の分類では偏りが心配なとき
  • インタビュー逐語録を横断して、共通して語られる語を把握したいとき
  • 年度や属性で語られ方が変わったかを比較したいとき

逆に、件数が数十件程度なら手作業のコーディングのほうが精度も解釈も上です。テキストマイニングは量に対する対処法であり、質的分析の上位互換ではありません。手作業の分類手順は 質的データの分析方法2026 にまとめています。

手順はどうなるのか?

  1. データを1行1レコードに整える。回答IDと属性(学年・性別など)を同じ表に持たせておくと、後で比較ができます。
  2. 前処理を行う。ここが本体です(次節で詳述)。
  3. 形態素解析で語に分割する。日本語は分かち書きされないため、この工程で名詞・動詞・形容詞などに分解します。
  4. 集計・可視化する。頻出語の一覧、属性別の比較、語と語の共起関係などを出します。
  5. 元の文に戻って解釈する。頻度表だけで解釈しないことが最重要です。

5番目を省略すると必ず読み違えます。「不安」という語が頻出しても、それが「不安だった」なのか「不安はなかった」なのかは、頻度表からは分かりません。気になった語は、必ずその語を含む原文を読み直してください。

前処理で何をするのか?

結果の質はほぼここで決まります。分析そのものより時間がかかると考えてください。

作業 内容 放置するとどうなるか
表記ゆれの統一 「レポート」「レポ」「report」を揃える 同じ概念が別々に数えられ、頻度が過小になる
不要語の除去 「する」「こと」「思う」など内容を持たない語 頻出語の上位が中身のない語で埋まる
複合語の登録 「卒業論文」が「卒業/論文」に割れるのを防ぐ 意味の単位が壊れる
専門用語の辞書追加 分野固有の語を辞書に登録する 重要語ほど正しく切り出されない
否定表現の確認 「ない」が直前の語にかかる関係 肯定と否定が同じに集計される

複合語の分割は日本語特有の落とし穴です。「研究計画書」が「研究/計画/書」に分かれると、頻度表では「研究」が水増しされ、肝心の「研究計画書」は消えます。分析前に必ず分割結果そのものを目で確認してください。

そして前処理の内容は論文に書きます。どの語を除去し、どの複合語を登録したかは、結果を左右する分析上の判断です。書かなければ再現できません。

アンケートの自由記述回答を整形し表記ゆれを確認する作業
表記ゆれの統一は地味だが、結果を最も動かす工程

結果をどう読むのか?

よく使われる出力は3種類です。

  • 頻出語リスト——最も基本的。ただし「多く語られた=重要」ではありません。全員が触れる当たり前の語ほど上位に来ます。
  • 共起ネットワーク——同じ回答内に一緒に現れやすい語を線で結んだ図。線は「一緒に出た」ことしか示さず、因果も肯定否定も表しません。
  • 属性別の比較——学年や群で語の使われ方を比べる。傾向の差を見るには最も実用的です。

共起ネットワークの読み違いが最も多く見られます。「課題」と「不安」が結ばれていても、「課題が不安だ」とは限りません。「課題は多いが不安はない」という文でも同じ線が引かれます。図から言えるのは共起までで、関係の内容は原文を読んで初めて書けます。

論文にはどう書くのか?

方法の章に、次を明示してください。

  • 対象データ(件数、収集方法、期間)
  • 使用したソフトウェアと、形態素解析に用いた辞書
  • 前処理の内容(統一した表記、除去した語、登録した複合語)
  • 集計の基準(対象とした品詞、最低出現回数など)

結果の章では数値と原文を必ず併記します。頻度表を示したうえで、代表的な原文を引用すると、読者は解釈の妥当性を確認できます。逐語録を引用する際の匿名化と同意の扱いは 私信・インタビューデータの引用の書き方2026 にまとめています。

考察では、テキストマイニングが示せる範囲を超えないでください。この手法が示すのは語の分布であって、意味の深さではありません。量的な傾向と質的な読みを組み合わせる設計として整理するなら 混合研究法(Mixed Methods)とは が参考になります。

データはどう集めるのか?

自由記述を分析対象にするなら、設問の作り方から設計してください。「ご意見をお書きください」だけでは、書く人と書かない人の差が大きくなり、回答が偏ります。質問設計の原則は 研究用アンケート(質問紙)の作り方2026、オンライン配付と集計の実務は Googleフォームでアンケートを作る手順2026 にあります。

インタビューを対象にする場合は、逐語録の作り方が前提になります。半構造化インタビューのやり方2026 と、文字起こしの手段は 研究インタビューの文字起こしAI比較2026 を参照してください。属性別の集計そのものは Excelでクロス集計表を作るやり方2026 が使えます。

よくある質問

テキストマイニングは何件くらいのデータから有効ですか?

明確な下限はありませんが、数十件程度なら手作業のコーディングのほうが精度も解釈も上回ります。手で読み切れない量になったときに検討する手法だと考えてください。

形態素解析とは何ですか?

文章を意味を持つ最小単位(形態素)に分解し、品詞を判定する処理です。日本語は英語と違って語が区切られていないため、集計の前に必ずこの工程が必要になります。

共起ネットワークの線は関係の強さを表しますか?

同じ文書内に一緒に現れやすいことを示すだけです。因果関係も、肯定か否定かも表しません。「課題は多いが不安はない」という文でも「課題」と「不安」は結ばれます。解釈には原文の確認が必要です。

前処理は論文に書く必要がありますか?

必要です。除去した語や登録した複合語は結果を左右する分析上の判断であり、書かなければ再現できません。使用ソフトと辞書もあわせて明記してください。

頻出語が多い=重要な論点ということですか?

限りません。全員が当然のように触れる語ほど上位に来ます。少数しか語っていない語のほうが、研究上重要な論点を示していることもあります。頻度は出発点であって結論ではありません。

複合語が分割されてしまいます。どうすればよいですか?

ユーザー辞書に登録して1語として扱わせます。「研究計画書」が「研究/計画/書」に割れると頻度が歪むため、分析前に分割結果そのものを目視で確認し、分野の専門用語を登録してください。

AIで論文を書き上げる

章立ての構成から執筆、SIST 02形式の参考文献整理まで——学術的誠実性を守りながら。無料登録、クレジットカード不要。

Tesifyを無料で始める →

カテゴリー