AI-textdelare — Dela text för RAG och embeddingar

Vad är AI-textdelare — Dela text för RAG och embeddingar

En textdelare delar upp långa dokument i mindre delar som ryms inom LLM:ers kontextfönster eller embeddingmodellers gränser för indatastorlek. Det är ett grundläggande steg i att bygga RAG-system (Retrieval-Augmented Generation), vektordatabaser och semantiska sökpipelines. Du kan dela efter uppskattat antal token, antal tecken eller styckegränser — med konfigurerbar överlappning för att bevara sammanhang över delgränser.

Så använder du

  1. Klistra in texten du vill dela i inmatningsfältet.
  2. Välj delningsläge: Token (bäst för LLM-kontext), Tecken (exakt storlek) eller Stycken (naturliga brytningar).
  3. Ställ in delstorleken (t.ex. 512 token för de flesta embeddingmodeller) och valfri överlappning (t.ex. 50 token för att bevara sammanhang).
  4. Klicka på Dela text — varje del visas nedanför med sitt antal token och tecken.
  5. Kopiera enskilda delar med Kopiera-knappen bredvid var och en.

När du använder det

Laddar du in en PDF på 50 sidor i en vektordatabas för semantisk sökning? Klistra in den extraherade texten, ställ in 512 token med 50 tokens överlappning, så får du cirka 80 delar som håller meningsgränserna intakta. Överlappningen för med sig tillräckligt med sammanhang över brytpunkterna för att betydelsen ska överleva, så du kan skicka delarna direkt till en embeddingmodell och lagra dem för RAG-hämtning.

Vanliga frågor

Vilken delstorlek ska jag använda för RAG?

512 token är ett vanligt val som balanserar sammanhang och precision för de flesta embeddingmodeller. Mindre delar (256) ger mer exakt hämtning; större delar (1024) bevarar mer sammanhang per del.

Vad är delöverlappning och varför spelar det roll?

Överlappning upprepar en del av slutet på en del i början av nästa. Det förhindrar att en mening eller ett resonemang som ligger på en delgräns förlorar sitt sammanhang, vilket förbättrar hämtningskvaliteten.

Ska jag dela efter token eller tecken?

Dela efter token när målet är en LLM- eller embeddingmodells kontextgräns, eftersom de räknar token. Dela efter tecken när du behöver exakt kontroll över storleken oberoende av modell.

Delar det här verktyget meningar mitt i ett ord?

Nej. Verktyget försöker respektera ord- och meningsgränser när det delar, så delarna slutar på en naturlig punkt i stället för mitt i ett ord.

Finns det en gräns för textlängden?

Eftersom bearbetningen sker i din webbläsare beror gränsen på enhetens minne. Mycket långa dokument kan ta ett ögonblick att dela men fungerar.

Kan jag dela verktyget med mina värden ifyllda?

Ja. Webbadressen uppdateras automatiskt medan du skriver. Kopiera den från adressfältet eller använd Dela-knappen — den som öppnar länken ser exakt dina värden redo att användas.

Relaterade verktyg