Embedding Benzerlik Hesaplama

Benzerliği hesaplamak için yukarıya her iki metni girin

TF kosinüs benzerliği · durak kelimeler kaldırıldı · tarayıcınızda çalışır

Nedir Embedding Benzerlik Hesaplama

Embedding Benzerlik Hesaplayıcı, iki metni terim frekansı vektörlerine dönüştürüp aralarındaki kosinüs açısını ölçerek ne kadar anlamsal benzer olduklarını hesaplar. %100 skor, metinlerin birebir aynı sözcük dağarcığını kullandığı anlamına gelir; %0 ise hiç ortak içerik sözcüğü paylaşmadıklarını gösterir. Bu yaklaşım embedding modellerinin yaptığını yaklaşık olarak taklit eder, ancak tamamen tarayıcınızda çalışır; API anahtarı veya harici servis gerektirmez.

Nasıl kullanılır

  1. İlk metni Metin A alanına yapıştırın veya yazın.
  2. İkinci metni Metin B alanına yapıştırın veya yazın.
  3. Anında beliren benzerlik skorunu okuyun — %0 hiç örtüşme yok, %100 aynı sözcük dağarcığı demektir.
  4. Her iki metnin ortak kullandığı sözcükleri görmek için ortak terimler panelini inceleyin.
  5. Her metnin diğerinde olmayan neyi kapsadığını anlamak için benzersiz terimler panellerini karşılaştırın.

Ne zaman kullanılır

Yayınlamadan önce iki ürün açıklamasının fazla mı benzediğinden endişelisiniz? İkisini de yapıştırın; ortak anahtar kelimeler listelenmiş hâlde örneğin %78'lik bir benzerlik skoru alın. Google'ın sayfaları kopya içerik olarak işaretlememesi için birinin yeniden yazılması gerektiğini bilmenize yeter.

Sık sorulan sorular

Bunun OpenAI text-embedding-3 gibi gerçek bir embedding modelinden farkı ne?

Gerçek embedding modelleri anlamsal anlamı yakalar — 'araba' ile 'otomobil'in benzediğini sözcükler farklı olsa da bilirler. Bu araç terim frekansı örtüşmesini kullanır; yani metinleri yalnızca gerçekten aynı sözcükleri paylaştıklarında benzer puanlar. Daha hızlı, ücretsiz ve gizlidir ama başka sözcüklerle ifade edilmiş içeriği tespitte daha az isabetlidir.

Benzerlik skoru ne anlama geliyor?

Skor, iki TF vektörü arasındaki kosinüs benzerliğinin yüzde olarak ifadesidir. %70 üzeri genellikle çok benzer içeriği gösterir. %30–70 arası ilişkili konulara işaret eder. %30 altı, metinlerin farklı sözcük dağarcıkları kullandığı anlamına gelir.

Hesaplamaya durak sözcükler dahil mi?

Hayır. 'the', 'a', 'is', 'de', 'le', 'der' gibi yaygın işlev sözcükleri, skora yalnızca anlamlı içerik sözcükleri katkı yapsın diye benzerlik hesaplanmadan önce çıkarılır.

Metnim bir sunucuya gönderiliyor mu?

Hayır. Tüm işlem tarayıcınızda JavaScript ile gerçekleşir. Hiçbir şey iletilmez veya saklanmaz.

Bunu intihal tespitinde kullanabilir miyim?

Bariz kelimesi kelimesine örtüşmeyi yakalayabilir, ancak birebir sözcük eşleşmesine dayandığı için başka sözcüklerle yazılmış intihali kaçırır. Ciddi intihal tespiti için büyük belge veritabanlarıyla karşılaştıran özel bir araç kullanın.

Bu aracı girdilerim dolu şekilde paylaşabilir miyim?

Evet. Siz yazarken URL otomatik güncellenir. Adres çubuğundan kopyalayın veya Paylaş düğmesini kullanın — bağlantıyı açan herkes girdilerinizi hazır görür.

İlgili araçlar

Son yazılar