Divisore di Testo AI — RAG ed Embeddings
Cos'è Divisore di Testo AI — RAG ed Embeddings
Un divisore di testo (text chunker) divide documenti lunghi in pezzi più piccoli che rientrano nella finestra di contesto degli LLM o nei limiti di dimensione di input dei modelli di embedding. Questo è un passaggio centrale nella costruzione di sistemi RAG (Retrieval-Augmented Generation), database vettoriali e pipeline di ricerca semantica. Puoi dividere per numero stimato di token, numero di caratteri o limiti di paragrafo — con sovrapposizione configurabile per preservare il contesto tra i chunk.
Come usare
- Incolla il testo da dividere nel campo di input.
- Scegli la modalità di divisione: Token (migliore per il contesto LLM), Caratteri (dimensione precisa) o Paragrafi (divisioni naturali).
- Imposta la dimensione del chunk (es: 512 token per la maggior parte dei modelli di embedding) e la sovrapposizione opzionale (es: 50 token per mantenere il contesto).
- Clicca su Dividi testo — ogni chunk appare sotto con il suo conteggio di token e caratteri.
- Copia i chunk individuali con il pulsante Copia accanto a ciascuno.
Quando usarlo
Devi caricare un PDF di 50 pagine in un database vettoriale per la ricerca semantica? Incolla il testo estratto, imposta 512 token con 50 token di sovrapposizione e ottieni circa 80 chunk che mantengono i confini delle frasi. La sovrapposizione porta abbastanza contesto tra i tagli da non perdere significato, pronti per il tuo modello di embedding.
Domande frequenti
Quale dimensione di chunk usare per RAG?
Per la maggior parte dei modelli di embedding (text-embedding-3-small, text-embedding-ada-002, Cohere Embed), 256–512 token è il punto ottimale. Chunk più grandi portano più contesto ma possono diluire il segnale semantico. Per le finestre di contesto LLM, puoi arrivare fino a 2000–4000 token per chunk a seconda di quanti chunk recuperi contemporaneamente.
Cos'è la sovrapposizione dei chunk e perché è importante?
La sovrapposizione è il numero di token/caratteri condivisi tra chunk consecutivi. Senza sovrapposizione, una frase che cade esattamente su un confine di chunk viene divisa in due, perdendo contesto. Una sovrapposizione del 10–20% (es: 50 token per chunk da 512) assicura continuità tra chunk adiacenti.
Devo dividere per token o per caratteri?
Dividere per token è più preciso per i limiti di LLM e modelli di embedding. Dividere per caratteri dà dimensioni deterministiche — utile quando il sistema a valle misura byte o caratteri. La modalità paragrafo è migliore per preservare la struttura naturale del documento.
Questo strumento spezza le frasi a metà parola?
No. Il divisore tenta prima di tagliare ai confini di paragrafo, poi alla punteggiatura di fine frase, poi agli spazi tra parole. Taglia a metà parola solo se non viene trovato un confine migliore.
C'è un limite alla lunghezza del testo?
Nessun limite rigido — lo strumento funziona completamente nel tuo browser. Testi molto lunghi (oltre 1 milione di caratteri) possono rallentare il browser durante l'elaborazione, ma non ci sono restrizioni lato server.
Posso condividere questo strumento con i miei dati precompilati?
Sì. L'URL si aggiorna automaticamente mentre digiti. Copia il link dalla barra degli indirizzi o usa il pulsante Condividi — chiunque lo apra vedrà i tuoi dati già inseriti.
Strumenti correlati
Contatore Token AI — GPT, Claude e Gemini
Conta i token di qualsiasi testo per GPT-4, Claude e Gemini. Contatore token AI gratuito online. Visualizza l'uso della finestra di contesto e il conteggio delle parole istantaneamente.
Codificatore e Decodificatore del Cifrario Atbash
Codifica e decodifica il cifrario Atbash online. Atbash specchia l'alfabeto ed è l'inverso di se stesso, quindi un clic cifra e decifra. Gratis e privato.
Rimuovere lo Sfondo da un'Immagine
Rimuovi lo sfondo da qualsiasi immagine online e scarica un PNG trasparente. Funziona nel browser con l'IA, la tua foto non viene mai caricata.