作業フローを簡素化:miniwebtoolを検索。
追加
関連ツール
AIデータ可視化ツールCSV貼り付けアナグラム生成器見出しアナライザーAI言語検出ツール読書時間電卓逆テキスト文の長さばらつき分析ツールスピーチ時間電卓音節カウンター
ホームページ > テキストツール > テキスト統計ツール > 単語頻度アナライザー
 

単語頻度アナライザー

任意のテキストを貼り付けるだけで、どの単語が最も頻繁に登場するかを即座に確認できます。ランキング形式の頻度テーブル、アニメーション付き棒グラフ、インタラクティブなワードクラウド、語彙多様性スコア、および6言語に対応したオプションのストップワード(除外検索語)フィルタリング機能を提供します。結果はCSVとしてエクスポート可能です。

単語頻度アナライザー
📚 サンプルを試す
記事、エッセイ、書き起こし、小説の章など、あらゆる文章を貼り付けてください。1回あたり最大200,000文字まで対応しています。
登場人物名、ブランド名、除外したい単語などをカンマまたはスペースで区切って入力してください。

Embed 単語頻度アナライザー Widget

単語頻度アナライザー

単語頻度アナライザーは、「このテキストの中で、実際に最もよく使われている単語はどれか?」というシンプルな疑問に驚くほど深く答えます。ブログ記事、書き起こし、小説の章、職務記述書、スピーチなど、あらゆる文章ブロックを貼り付けるだけで、重複しないすべての単語を出現頻度順にランク付けし、分布図を作成し、頻度に応じたサイズのインタラクティブなワードクラウドをレンダリングします。このツールは、意図しない単語の繰り返しをチェックしたい執筆者、自然なキーワード密度を確認したいSEO専門家、著者の語彙を研究している学生、語彙の多様性を迅速に検証したい研究者、見慣れないテキストを調査する翻訳者や言語学者向けに構築されています。すべての処理はブラウザ内または当社のサーバー上で行われ、保存されることはありません。

このアナライザーの特徴

  • 入力中のライブプレビュー。 「分析」ボタンをクリックしなくても、サイドパネルに重複しない単語数、総単語数、TTR(語彙の多様性)、および上位5単語のデータが即座に反映されます。フィルターの調整も数秒で行えます。
  • 6言語のストップワードリスト。 英語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語に対応。膨大で無駄なデータではなく、厳選されたリストを用意しています。さらに、登場人物名、ブランド名、定型文などを除外するための自由形式のカスタムストップワードフィールドも備えています。
  • 平方根スケールのワードクラウド。 多くのワードクラウド生成ツールは生のカウント数でサイズを決定するため、最頻出の単語が中位の単語の50倍もの大きさになり、クラウド全体が視覚的に潰れてしまいます。平方根スケール(sqrt)を採用することで、クラウドの読みやすさを維持でき、これはWordle(2009年)以来の業界標準アプローチとなっています。
  • トップ3の「表彰台」表示。 金・銀・銅のカードを一目見るだけで、テキストが最も依存している単語がわかります。偶発的な繰り返しが疑われる場合に、最初にチェックすべき項目です。
  • 語彙多様性の指標。 異なり語数比(TTR)とハパックス・レゴメノンのカウントにより、単なる頻度の羅列ではなく、語彙の豊かさを表すスコアを提供します。TTRが0.6を超える短い文章は語彙が豊かであり、長い文書で0.2未満の場合は繰り返しが多いことを示します。
  • ワンクリックのCSVエクスポート。 スプレッドシートでの分析用に、ランク付けされた完全な表をダウンロードまたはコピーできます。

このツールの使い方

  1. テキストを貼り付ける。 最大200,000文字まで対応。これは約30,000語に相当し、長い小説の1章分、あるいは複数のブログ記事を組み合わせた長さに匹敵します。
  2. ストップワードの言語を選択する。 ストップワードをフィルターしない場合、表の上位は「the」、「of」、「and」などで占められ、一度確認すれば十分な情報ばかりになってしまいます。テキストの言語を選択するか、真の生の頻度をカウントする場合は「なし」を選択してください。
  3. 最小単語長を設定する。 「a」、「I」、「it」、「no」などの短い語をスキップしたい場合は、3または4に設定します。すべてを保持する場合は1に設定します。
  4. 表示する結果の数を選択する。 ほとんどの文章では「上位50」が最適ですが、「上位500」を選択すれば、出現頻度の低いロングテールの単語まで完全に把握できます。
  5. オプションの切り替え。 「Paris」と「paris」を区別したい場合は「大文字・小文字を区別する」をオンにします。「runs」、「ran」、「running」を「run」に統合したい場合は「基本的な原型化」をオンにします。バージョン番号、年、統計データがテキストにおいて意味を持つ場合は「数字をカウントする」をオンにします。
  6. 「単語頻度を分析する」をクリック。 表彰台を確認し、バーチャート表をスクロールし、クラウドを眺め、さらに詳細に調査したい場合はCSVをエクスポートします。

指標の背後にある計算方法

頻度とパーセンテージ

重複しない各単語 \( w \) について、カウント数は保持されたトークンリストにその単語が登場する回数であり、パーセンテージは \( \text{count}(w) / N \)( \( N \) は保持されたトークンの総数)です。バーの幅は最も頻出する単語を基準とした相対値であるため、分布の形状を一目で把握できます。

異なり語数比(TTR)

\( \text{TTR} = U / N \) で定義され、 \( U \) は重複しない単語数(異なり語数)、 \( N \) はカウントされたトークンの総数です。TTRは、語彙の多様性を測る最もシンプルな指標です。短いニュース速報は通常0.5〜0.7になりますが、長い小説では一般的な単語が繰り返し使用されるため、0.15〜0.25に低下します。TTRはテキストの長さに影響を受けやすいため、長いテキストは短いテキストよりも常にTTRが低くなります。そのため、分量が大きく異なる文書間でTTRを比較することは避けてください。

ハパックス・レゴメノン

ハパックス・レゴメノン(ギリシャ語で「一度だけ言われた」の意)とは、テキスト中に完全に一度しか出現しない単語のことです。ハパックスのカウント数とハパックスの割合は、語彙の豊かさを示す古典的なシグナルです。シェイクスピアの全著作では、約31,000語の重複しない単語のうち、およそ14,000語がハパックスであり、約45%を占めます。現代のブログ記事では、単語が再出現するほどのテキスト量がないため、ハパックスが60%以上に達することがよくあります。

ワードクラウドのフォントサイズ設定

クラウド内の単語 \( w \) のフォントサイズは、表示されている最小カウント数と最大カウント数の間で平方根スケールを使用して計算されます:

\( \text{size}(w) = 60\% + 180\% \cdot \dfrac{\sqrt{\text{count}(w)} - \sqrt{\text{min}}}{\sqrt{\text{max}} - \sqrt{\text{min}}} \)

これによりダイナミックレンジが圧縮されるため、200回出現する単語の高さは、20回出現する単語の10倍ではなく、約3倍に抑えられます。この圧縮がないと、クラウドが1つか2つの巨大な単語に占有されてしまいます。

カラーコード化された頻度ティア

バーとクラウド内の単語は、順位のティア(階層)ごとにカラーコード化されているため、分布の形状を一目で特定できます:

ティア 1 — 1〜5位テキストが最も依存している5つの単語です。意味を持つ内容語がここにランクインしている場合、それがそのテキストのテーマです。
ティア 2 — 6〜15位メインのアイデアを展開するために繰り返し使用される、脇を固める名詞や動詞です。
ティア 3 — 16〜40位上位のテーマを取り囲む、より幅広い語彙層です。
ティア 4 — 41〜100位専門用語や特定の用語(固有名詞、専門用語、名前付きエンティティなど)です。
ティア 5 — 101位以降ロングテール部分です。1、2回しか使われていない単語であり、最も興味深い語彙がここに隠れていることがよくあります。

活用事例

執筆者 — 意図しない繰り返しの検知

単一の単語(「素早く」、「本当に」、「本質的に」や、登場人物の名前など)が、下書きの上位に忍び込んでいる頻度に驚かされることでしょう。章を貼り付けて、金・銀・銅の表彰台を見てみてください。意識的に強調したわけではない内容語がそこにある場合、それは推敲で修正すべき口癖(執筆の癖)です。

SEOとコンテンツマーケティング

ストップワードフィルターと最小単語長を設定し、上位25語を確認します。これらは、検索エンジンがあなたのページと最も強く関連付ける単語です。これらがターゲットとするキーワードクラスターと一致しない場合、ページ上のSEOパフォーマンスは低下します。キーワードの詰め込み(キーワードスタッフィング)は避けてください。現代のアルゴリズムは不自然な密度にペナルティを科します。健全な目標値は、メインキーワードで全体の約1〜2%です。

文学研究と文体論

ディケンズとヘミングウェイの章を貼り付けて、TTR、ハパックスの割合、平均単語長を比較してみてください。著者固有の文体のデジタルな指紋は、その著作群を通じて驚くほど一貫しており、これが計量文体論(コンピューター文体論)の基礎となっています。

スピーチと書き起こしの分析

政治家や経営者にはお気に入りの単語があります。ストップワードを除去した状態でスピーチをアナライザーにかけると、上位15語からメッセージング戦略が明らかになります。同じ話し手による2つのスピーチを比較して、何が変化したかを確認することもできます。

翻訳と語学学習

翻訳作業を行う際、最初に原テキトを分析して、どの内容語が主流を占めているかを確認します。これにより、翻訳文でも同じ強調が維持されるようにします。語学学習者の場合、200語程度の記事をストップワードフィルターなしで実行すると、流暢に認識すべき重要な機能語がどれであるかが分かります。

研究と学術論文の執筆

多くのジャーナルでは、アブストラクト(要旨)において制御された語彙を使用することが求められます。投稿前に頻度をチェックすることで、偶発的な専門用語の過剰使用を防ぐことができます。コーパス言語学の研究を行う研究者は、連語(コロケーション)、n-gram、トピックモデリング作業の初期入力として頻度リストを使用します。このツールはそのインプットを生成できます。

文書タイプ別の推奨設定

文書タイプストップワード最小単語長上位表示数(Top N)原型化
ブログ記事 / 一般記事英語(または該当言語)350オフ
小説の1章英語3100オン("runs"/"ran"/"running"を統合)
学術論文英語4100オン
ツイートスレッド / 短い投稿なし125オフ
SEOリサーチ英語350オン
スピーチの書き起こし英語325オフ(正確な言い回しを保持するため)
外国語テキスト該当する言語に合わせる150オフ(英語のみの原型化ツールのため)

よくある質問

何が「単語」としてカウントされますか?

トークナイザーは、1つ以上のUnicode文字をマッチングし、オプションでアポストロフィやハイフンで結合されたものを抽出します。そのため、don'tstate-of-the-artl'ovvio はそれぞれ1つの単語として扱われます。数字はデフォルトで除外されていますが、「数字をカウントする」をオンにすれば含めることができます。トークナイザーは、ラテン文字、キリル文字、ギリシャ文字、およびCJK(中国語・日本語・韓国語)スクリプトに対応しています。

基本的な原型化ツールは何を行い、何を行いませんか?

このツールは3つの軽量な変換を行います:所有格の 's の削除、一般的な動詞の語尾(-ing, -ed)の集約、およびシンプルな複数形(-s, -es, -ies → -y)の処理です。 WordNet語彙集を組み込む必要があるような、本格的な形態論的原型化(例: better → good, went → go)は行いません。正確な単語の形態そのものを確認したいことが多い頻度分析において、完全な原型化は過剰(オーバーキル)です。また、この控えめなアプローチにより、ステミングの最悪の失敗モードである「文脈上異なる単語の統合」(例: Porterステムマーにおける「university」と「universe」の同一視)を避けることができます。

ライブプレビューとサーバーの分析結果がわずかに異なるのはなぜですか?

ライブプレビューは、スクリプトのサイズを最小限に抑えるために、クライアント側での英語のストップワードのフィルタリングのみを行います。他の言語はサーバー側で完全にフィルタリングされます。また、サーバーは切り替えが有効な場合に基本的な原型化を適用します。ただし、両者間で総トークン数は常に一致します。

ラテン文字以外のスクリプト(日本語など)も処理できますか?

はい。トークナイザーはUnicode文字クラスを使用しているため、キリル文字、ギリシャ文字、アラビア語、ヘブライ語、中国語、日本語、韓国語のテキストもすべて正しくトークン化されます。ただし、中国語や日本語は単語間にスペースを使用しないため、連続するCJK文字の並び全体が1つの「トークン」として扱われます。これらの言語で真の単語分割(形態素解析)を行うには、jieba(中国語)やMeCab(日本語)のような専用のトークナイザーが必要となります。

テキストサイズの制限はありますか?

1回あたり200,000文字までです。これは英語の約30,000語、あるいは一般的な小説の1章分に相当します。これを超える分量では、ブラウザのメモリやリクエストサイズの問題が発生する可能性があるため、テキストを小さく分割して実行してください。

私のテキストのプライバシーは保護されていますか?

はい。テキストは結果ページをレンダリングするためにメモリ内で処理され、ディスクに書き込まれることはありません。入力中に表示されるライブミニ統計は、すべてブラウザ内で完全に実行されます。貼り付けられたコンテンツをログに記録、保存、または分析することはありません。

単語頻度分析の短い歴史

単語頻度リストは、言語学において最も古いツールの1つです。機械によって生成された最初の英語の頻度リストは、ロベルト・ブーザ神父(Father Roberto Busa)による1949〜1980年の Index Thomisticus でした。これはIBMのパンチカードマシンを使用して、トマス・アクィナスの著作に含まれるすべての単語をカウントしたもので、デジタル・ヒューマニティーズ(デジタル人文学)の創始プロジェクトとして広く知られています。ブラウンコーパス(1961年)は、現代アメリカ英語の、体系的にサンプリングされた最初の100万語規模の頻度リストを提供しました。今日、すべての検索エンジン、機械翻訳システム、大規模言語モデル(LLM)、およびSEOツールは、大規模な単語およびトークンの頻度統計に基づいて動作しています。このツールに表示されている、単純なカウンターベースのランキングと同じ仕組みが、その分野の核心(カーネル)となっています。

このコンテンツ、ページ、またはツールを引用する場合は、次のようにしてください:

"単語頻度アナライザー"(https://MiniWebtool.com/ja/単語頻度アナライザー/) MiniWebtool からの引用、https://MiniWebtool.com/

by miniwebtool チーム. 更新日: 2026年5月27日

テキスト統計ツール:

おすすめ:

InstagramユーザーID検索弧長電卓パーセント増加電卓不可視文字除去ツールパーセンテージ減少電卓ランダムカラージェネレーターMACアドレス検索円錐展開図テンプレートジェネレーター画像分割ツール水星逆行カレンダー英単語ランダム生成ツールシグマ記法電卓 総和動画を結合ランダム誕生日ジェネレーター合計電卓HEX電卓フィートとインチからセンチメートルへのコンバーター平方完成電卓パーセント誤差電卓エンジェルナンバー電卓クロスワードパズルメーカー動画を逆再生標準偏差電卓 - 高精度売上総利益率電卓YouTubeチャンネル統計土星回帰電卓筆算割り算電卓ASCIIコード表番号を並べ替えるai句読点追加ランダム超能力ジェネレーターCAGR電卓私のIPアドレスは何ですかwar電卓関数電卓MP3ルーパー空の行を削除する相対標準偏差電卓ランダム絵文字ジェネレーターモジュロ電卓手数料電卓FPSコンバーター動画を回転相関係数計算機楕円円周電卓マン・ホイットニーのU検定計算機対数電卓💧 露点電卓ビンゴカードジェネレーターコラッツ予想電卓オンライン句読点削除ツールデシベル (dB) 電卓t検定電卓中央値電卓マスターナンバー電卓熱膨張計算機HEXコンバーターボウリングスコア計算機血糖値コンバーター圧力電卓ビデオ速度を調整kva計算機ランダムトーナメント表作成ツールボルト締付トルク計算機BUN対クレアチニン比電卓逆テキストじゃんけんジェネレーターSRT 時間シフト 電卓ランダム名前ジェネレーター角速度計算機労働時間計算ツール指数電卓-高精度サッカーxg期待ゴール電卓加速度電卓求人検索分数電卓比率電卓fena電卓コラージュメーカーセンチメートルからフィートとインチへのコンバーター文字数による改行FIP電卓log-base-2電卓変化率電卓オーディオ スプリッタージニ係数電卓平方根電卓GIFメーカー年の日電卓 - 今日は今年の何日目XMLバリデーター小数時間から普通の時間へのコンバーター最小公倍数電卓AIテキストヒューマナイザーTikTok収益計算ツール三角関数グラフ作成ツールCRC32チェックサム電卓迷路ジェネレーター分散電卓 高精度水泳ペース計算機確率分布電卓ボクシングパンチ力計算機画像回転ツールSRTからTXTへの変換ツールベーカーズパーセント電卓Twitch収益計算ツール桁数電卓🖱️ クリックカウンターノノグラムジェネレーター (ピクロス)沸点計算ツール赤ちゃんのミルク量計算パレットジェネレーターランダム日付ジェネレーターランダム時刻ジェネレーター外れ値電卓筆算足し算・引き算計算機角度変換ツール魔方陣ジェネレータージョルダン標準形電卓ランダムポーカーハンドジェネレーター動画から画像抽出ツール四次方程式計算機ピタゴラスの定理電卓VTTからtxtへのコンバーターZalgoテキストジェネレーター太陽位置計算機正多角形電卓FacebookユーザーID検索ビデオ反転ピザ生地計算機ランニングペース電卓中間日計算機積分電卓車両重量配分計算機ワイヤーゲージ電卓円錐台電卓密度電卓配管流量電卓IPアドレスから16進数への変換SHA256 ハッシュジェネレーター取り消し線テキスト生成ツール変動係数電卓タンジェント電卓ヒジュラ暦変換器停止距離計算機ビデオをループ再生ランダムトランプカードジェネレーター比較分数電卓⚔️ DPS電卓🔊 トーンジェネレーターホームランの打席電卓並列抵抗電卓階段電卓音速計算機10進数からBCDへのコンバーターBCDからバイナリへのコンバーターバーコードジェネレーター平均寿命電卓発音IPA変換ツール行番号を追加配当利回り電卓YouTubeショート収益化計算ツールグレイコード・バイナリ変換電卓パーセント成長率電卓斜辺電卓日割り家賃計算F検定・F分布電卓バイナリ電卓マルコフ連鎖定常分布電卓ランダムクレジットカードジェネレーター二乗平均平方根電卓水分補給計算機表面積電卓ANC電卓標準誤差電卓油圧シリンダー推力計算機CPM 電卓psiからkPaへのコンバーターエラー関数電卓カラー反転ツールスリザーリンクパズルジェネレーターパスワード強度テスターランダムPIN生成器猫カロリー電卓番号ランダマイザー素数ですか重複行削除ツール長方形の電卓アナグラム生成器ランダムアニマルジェネレーターランダム算数問題ジェネレーター周波数波長変換ツール滑車システム計算機点つなぎジェネレーターHTMLからテキストコンバータ平均電卓-高精度歩数距離変換電卓熱伝達計算機上下反転テキストジェネレーター二つの文字列を比較する愛の相性電卓薪コード計算機空気清浄機CADR電卓除湿機サイズ計算シーリングファンサイズ電卓カーテンサイズ計算機ラグサイズ電卓額縁の掛け高さ計算機テレビ取り付け高さ計算機テレビサイズ電卓池の容量・ライナー電卓プール塩量計算機プール容量計算給湯器サイズ電卓エポキシ樹脂計算機手すり子間隔電卓巾木とトリムの電卓サイディング計算機デッキ用ステインの計算芝生の種計算機芝生電卓アスファルト電卓立方ヤード電卓アンテナ長計算機電線管充填率電卓直列並列コンデンサ電卓誘導リアクタンス計算機部屋の照明計算機ルクスからルーメン電卓ルーメンからワット変換器発電機サイズ計算機mAh Wh 変換器 電卓三相電力計算機アンペアからワット電卓ワットからアンペア電卓直列抵抗計算機摩擦計算機斜面計算機機械的倍率計算機波の速度計算機浮力電卓終端速度計算機ド・ブロイ波長計算機光子エネルギー計算機emc2電卓時間の遅れ計算機ケプラーの第三法則計算機脱出速度計算機万有引力計算機ベール・ランベルトの法則電卓ネルンストの式計算機浸透圧計算機沸点上昇電卓凝固点降下計算パーセント組成計算機規定度計算機質量モル濃度計算機pKa→Ka変換器ヘンダーソン・ハッセルバルヒ電卓理論収量計算機制限反応物計算機電子配置計算機インタラクティブ周期表AI授業計画ジェネレーターAIクイズ作成ツール引用ジェネレーター (APA/MLA/Chicago)出席率計算APスコア計算機ACTスコア計算機SATスコア電卓パーセンテージからCGPA変換器CGPAからパーセンテージへの変換器簡単採点ツール EZ Grader子育て費用計算機おむつサイズ電卓赤ちゃんの名前ジェネレーター赤ちゃんの目の色予測子供のBMIパーセンタイル計算機子供の身長予測ツールhcg倍加時間計算ツール体外受精出産予定日電卓着床計算ツール中国式性別予測カレンダーISO 8601 日付フォーマッターユリウス日変換器昼寝電卓月相電卓日の出&日の入り電卓世界時計日付ローマ数字変換電卓退職カウントダウンソブリエティ計算機ハーフバースデー計算機記念日計算機週番号計算機チップ分配計算機メールマーケティングROI電卓リード獲得単価計算機運転資本計算機youtube収益見積もりツールランダムRPGキャラクタージェネレーター