Dzielnik Tekstu AI — Fragmentacja dla RAG i Embeddings

Czym jest Dzielnik Tekstu AI — Fragmentacja dla RAG i Embeddings

Dzielnik tekstu dzieli długie dokumenty na mniejsze fragmenty mieszczące się w oknie kontekstowym modeli językowych lub limitach wejściowych modeli embeddingowych. Jest to kluczowy krok przy budowaniu systemów RAG (Retrieval-Augmented Generation), baz wektorowych i potoków wyszukiwania semantycznego. Możesz dzielić według szacowanej liczby tokenów, liczby znaków lub granic akapitów — z konfigurowalnym nakładaniem, aby zachować kontekst na granicach fragmentów.

Jak używać

  1. Wklej tekst do podzielenia w pole wejściowe.
  2. Wybierz tryb podziału: Tokeny (najlepiej dla kontekstu LLM), Znaki (precyzyjny rozmiar) lub Akapity (naturalne granice).
  3. Ustaw rozmiar fragmentu (np. 512 tokenów dla większości modeli embeddingowych) i opcjonalne nakładanie (np. 50 tokenów).
  4. Kliknij Podziel tekst — każdy fragment pojawia się poniżej z liczbą tokenów i znaków.
  5. Kopiuj poszczególne fragmenty przyciskiem Kopiuj obok każdego.

Kiedy używać

Ładujesz 50-stronicowy PDF do bazy wektorowej do wyszukiwania semantycznego? Wklej wyodrębniony tekst, ustaw 512 tokenów z nakładaniem 50 tokenów, a otrzymasz około 80 fragmentów zachowujących granice zdań. Nakładanie przenosi wystarczający kontekst przez punkty cięcia, dzięki czemu możesz bezpośrednio wysłać fragmenty do modelu embeddingowego.

Często zadawane pytania

Jakiego rozmiaru fragmentu używać do RAG?

Dla większości modeli embeddingowych optymalny zakres to 256–512 tokenów. Większe fragmenty zawierają więcej kontekstu, ale mogą osłabić sygnał semantyczny. Dla okien kontekstowych LLM możesz sięgać do 2000–4000 tokenów na fragment.

Czym jest nakładanie fragmentów i dlaczego jest ważne?

Nakładanie to liczba tokenów lub znaków wspólnych dla sąsiadujących fragmentów. Bez nakładania zdanie na granicy fragmentu zostanie podzielone i kontekst zostanie utracony. Nakładanie 10–20% zapewnia ciągłość między sąsiadującymi fragmentami.

Czy dzielić według tokenów czy znaków?

Podział według tokenów jest dokładniejszy dla limitów modeli LLM i embeddingowych. Podział według znaków daje deterministyczne, precyzyjne rozmiary. Tryb akapitów najlepiej zachowuje naturalną strukturę dokumentu.

Czy narzędzie dzieli słowa w połowie?

Nie. Dzielnik próbuje najpierw podzielić na granicach akapitów, potem na końcowej interpunkcji zdań, a następnie przy spacjach. Tylko gdy w oknie zapobiegawczym 15% nie ma lepszej granicy, dzieli w środku słowa.

Czy mogę udostępnić narzędzie z wypełnionymi danymi?

Tak. URL aktualizuje się automatycznie podczas wpisywania. Skopiuj link z paska adresu lub użyj przycisku Udostępnij — każdy, kto go otworzy, zobaczy Twoje dane.

Powiązane narzędzia