テキスト類似度チェッカー

両方の欄にテキストを入力すると比較できます。

このツールとは テキスト類似度チェッカー

テキスト類似度チェッカーは、単語頻度ベクトルに基づくコサイン類似度を使って2つの文章の一致度を計算します。両方の文章を単語に分割し、頻出する一般的な単語を除いたうえで、残った単語の重なりを測定し、類似度のパーセンテージと、両方の文章に共通する単語、それぞれにしかない単語を表示します。すべてブラウザ内で処理されるため、文章が外部に送信されることはありません。

使い方

  1. 左側の欄に1つ目の文章を貼り付けるか入力する。
  2. 右側の欄に2つ目の文章を貼り付けるか入力する。
  3. 下に表示される類似度のパーセンテージと、共通・固有の単語リストを確認する。
  4. どちらかの文章を編集すると、スコアが即座に更新される。

こんなときに便利

同じ段落の2つの原稿を比べて、実際にどれだけ変更したか確認したいことはありませんか。変更前と変更後を貼り付けると、類似度が62%と出て、'売上'や'四半期'は共通しているものの'成長'は新しい原稿にしかない、といった結果が見えます。ほぼ同じ商品説明文を見つけたいときや、言い換え文がどれだけ元の文に近いか確認したいとき、アンケートの2つの回答が別の言葉で同じことを言っているか調べたいときにも役立ちます。

よくある質問

類似度スコアはどのように計算されますか?

このツールは両方の文章を単語に分割し、'the'や'and'のような一般的な単語を除去したうえで、それぞれの単語頻度ベクトルを作成し、両者のコサイン類似度を計算します。結果は0%(共通する語彙なし)から100%(同じ単語の使用)までのパーセンテージで表示されます。

単語の順序は結果に影響しますか?

影響しません。単語頻度ベクトルによるコサイン類似度は語順や文法を無視するため、'猫が犬を追いかけた'と'犬が猫を追いかけた'は完全に一致するスコアになります。測定しているのは語彙の重なりであり、文の構造や意味ではありません。

似ている文章なのにスコアが低く出るのはなぜですか?

スコアはストップワード除去後に残った単語だけを数えるため、'車'と'自動車'のように同じ意味でも異なる語彙を使う言い換えは、意味が同じでも共通語が少なくなります。パーセンテージは意味の一致度ではなく、語彙の重なりの指標として捉えてください。

これは剽窃チェッカーと同じですか?

厳密には異なります。このツールは入力された2つの文章間の語彙の重なりを測定するもので、下書きや言い換え、重複コンテンツの比較に役立ちます。剽窃チェッカーはウェブや文書データベースを検索して一致箇所を探しますが、このツールはそれを行いません。

関連ツール