KI-Text-Teiler — RAG und Embeddings
Was ist KI-Text-Teiler — RAG und Embeddings
Ein Text-Teiler (Text Chunker) teilt lange Dokumente in kleinere Stücke auf, die in das Kontextfenster von LLMs oder in die Eingabegrößenlimits von Embedding-Modellen passen. Dies ist ein zentraler Schritt beim Aufbau von RAG-Systemen (Retrieval-Augmented Generation), Vektordatenbanken und semantischen Such-Pipelines. Du kannst nach geschätzter Token-Anzahl, Zeichenzahl oder Absatzgrenzen aufteilen — mit konfigurierbarer Überlappung, um den Kontext an Chunk-Grenzen zu erhalten.
Verwendung
- Den aufzuteilenden Text in das Eingabefeld einfügen.
- Aufteilungsmodus wählen: Tokens (beste Wahl für LLM-Kontext), Zeichen (genaue Größe) oder Absätze (natürliche Trennungen).
- Chunk-Größe festlegen (z.B. 512 Tokens für die meisten Embedding-Modelle) und optionale Überlappung (z.B. 50 Tokens für Kontext-Kontinuität).
- Auf Text aufteilen klicken — jeder Chunk erscheint darunter mit seiner Token- und Zeichenanzahl.
- Einzelne Chunks mit dem Kopieren-Button daneben kopieren.
Wann ist es nützlich?
Du willst ein 50-seitiges PDF für die semantische Suche in eine Vektordatenbank laden? Füge den extrahierten Text ein, stelle 512 Tokens mit 50 Tokens Überlappung ein und du erhältst rund 80 Chunks, die Satzgrenzen bewahren. Die Überlappung trägt an den Schnittpunkten genug Kontext, damit keine Bedeutung verloren geht und die Chunks direkt ins Embedding-Modell wandern können.
Häufig gestellte Fragen
Welche Chunk-Größe soll ich für RAG verwenden?
Für die meisten Embedding-Modelle (text-embedding-3-small, text-embedding-ada-002, Cohere Embed) ist 256–512 Tokens der optimale Bereich. Größere Chunks tragen mehr Kontext, können aber das semantische Signal verwässern. Für LLM-Kontextfenster kannst du je nach Anzahl der abgerufenen Chunks bis zu 2000–4000 Tokens pro Chunk gehen.
Was ist Chunk-Überlappung und warum ist sie wichtig?
Überlappung ist die Anzahl von Tokens/Zeichen, die zwischen aufeinanderfolgenden Chunks geteilt werden. Ohne Überlappung wird ein Satz, der genau an einer Chunk-Grenze liegt, auf zwei Chunks aufgeteilt und verliert Kontext. Eine Überlappung von 10–20% (z.B. 50 Tokens bei 512-Token-Chunks) gewährleistet Kontinuität zwischen benachbarten Chunks.
Soll ich nach Tokens oder Zeichen aufteilen?
Die Aufteilung nach Tokens ist genauer für LLM- und Embedding-Modelllimits. Die Aufteilung nach Zeichen ergibt deterministische Größen — nützlich, wenn das nachgelagerte System Bytes oder Zeichen misst. Der Absatz-Modus eignet sich am besten zur Bewahrung der natürlichen Dokumentstruktur.
Bricht dieses Tool Sätze mitten in Wörtern ab?
Nein. Der Text-Teiler versucht zunächst an Absatzgrenzen zu trennen, dann an Satzschluss-Interpunktion, dann an Wortleerzeichen. Nur wenn kein besserer Trennpunkt gefunden wird, erfolgt ein Schnitt mitten im Wort.
Gibt es eine Begrenzung der Textlänge?
Keine harte Begrenzung — das Tool läuft vollständig in deinem Browser. Sehr lange Texte (über 1 Million Zeichen) können die Verarbeitung verlangsamen, aber es gibt keine serverseitige Einschränkung.
Kann ich dieses Tool mit vorausgefüllten Eingaben teilen?
Ja. Die URL aktualisiert sich während du tippst. Kopiere den Link aus der Adressleiste oder klicke auf Teilen — wer den Link öffnet, sieht deine Eingaben bereits ausgefüllt.
Ähnliche Werkzeuge
KI-Token-Zähler — GPT, Claude und Gemini
Tokens in jedem Text für GPT-4, Claude und Gemini zählen. Kostenloser KI-Token-Zähler online. Kontextfenster-Auslastung und Wortzahl sofort anzeigen.
Atbash-Chiffre-Encoder und -Decoder
Kodiere und dekodiere die Atbash-Chiffre online. Atbash spiegelt das Alphabet und ist sein eigenes Inverses, ein Klick verschlüsselt und entschlüsselt. Kostenlos und privat.
Hintergrund entfernen
Entferne den Hintergrund jedes Bildes online und lade ein transparentes PNG herunter. Läuft per KI im Browser, dein Foto wird nie hochgeladen.