AI Metin Bölücü — RAG ve Embedding için Metin Bölün

Nedir AI Metin Bölücü — RAG ve Embedding için Metin Bölün

Metin bölücü (text splitter da denir), uzun belgeleri LLM'lerin bağlam penceresine veya embedding modellerinin girdi boyutu sınırlarına sığan daha küçük parçalara böler. Bu; RAG (Retrieval-Augmented Generation) sistemleri, vektör veritabanları ve semantik arama hatları kurmanın temel adımıdır. Tahmini token sayısına, karakter sayısına veya paragraf sınırlarına göre bölebilirsiniz — parça sınırları arasında bağlamı korumak için yapılandırılabilir örtüşmeyle.

Nasıl kullanılır

  1. Bölmek istediğiniz metni giriş alanına yapıştırın.
  2. Bölme modunu seçin: Token (LLM bağlamı için en iyi), Karakter (kesin boyut) veya Paragraf (doğal kesitler).
  3. Parça boyutunu (örn. çoğu embedding modeli için 512 token) ve isteğe bağlı örtüşmeyi (örn. bağlamı korumak için 50 token) ayarlayın.
  4. Metni böl'e tıklayın — her parça, token ve karakter sayısıyla birlikte altta görünür.
  5. Her parçanın yanındaki Kopyala düğmesiyle parçaları tek tek kopyalayın.

Ne zaman kullanılır

Semantik arama için 50 sayfalık bir PDF'i vektör veritabanına mı yüklüyorsunuz? Çıkarılan metni yapıştırın, 50 token örtüşmeli 512 token ayarlayın; cümle sınırlarını koruyan yaklaşık 80 parça elde edin. Örtüşme, kesim noktalarında anlamın hayatta kalmasına yetecek bağlamı taşır — parçaları doğrudan bir embedding modeline gönderip RAG erişimi için saklayabilirsiniz.

Sık sorulan sorular

RAG için hangi parça boyutunu kullanmalıyım?

Çoğu embedding modeli için (text-embedding-3-small, text-embedding-ada-002, Cohere Embed) 256–512 token ideal noktadır. Daha büyük parçalar daha çok bağlam taşır ama semantik sinyali sulandırabilir. LLM bağlam pencereleri için, aynı anda kaç parça getirdiğinize bağlı olarak parça başına 2000–4000 token'a çıkabilirsiniz.

Parça örtüşmesi nedir ve neden önemli?

Örtüşme, ardışık parçaların paylaştığı token/karakter sayısıdır. Örtüşme olmadan, tam parça sınırına denk gelen bir cümle iki parçaya bölünür ve bağlam kaybolur. %10–20'lik örtüşme (örn. 512 token'lık parçalar için 50 token) komşu parçalar arasında sürekliliği sağlar.

Token'a göre mi karaktere göre mi bölmeliyim?

Token'a göre bölmek, LLM ve embedding modeli sınırları için daha isabetlidir. Karaktere göre bölmek belirlenimci, kesin boyutlar verir — alt sistem token değil bayt veya karakter ölçtüğünde kullanışlıdır. Paragraf modu, doğal belge yapısını korumak için en iyisidir.

Bu araç cümleleri kelimenin ortasından bölüyor mu?

Hayır. Bölücü önce paragraf sınırlarında, sonra cümle sonu noktalamasında, ardından kelime boşluklarında kesmeye çalışır. Yalnızca %15'lik ileri bakış penceresinde daha iyi bir sınır bulunamazsa kelime ortasından böler.

Metin uzunluğu sınırı var mı?

Katı bir sınır yok — araç tamamen tarayıcınızda çalışır. Çok büyük metinler (1 milyon karakterin üzeri) işleme sırasında tarayıcınızı yavaşlatabilir ama sunucu tarafı kısıt yoktur.

Bu aracı girdilerim dolu şekilde paylaşabilir miyim?

Evet. Siz yazarken URL otomatik güncellenir. Adres çubuğundan kopyalayın veya Paylaş düğmesini kullanın — bağlantıyı açan herkes girdilerinizi hazır görür.

İlgili araçlar