Divisore di Testo AI — RAG ed Embeddings

Cos'è Divisore di Testo AI — RAG ed Embeddings

Un divisore di testo (text chunker) divide documenti lunghi in pezzi più piccoli che rientrano nella finestra di contesto degli LLM o nei limiti di dimensione di input dei modelli di embedding. Questo è un passaggio centrale nella costruzione di sistemi RAG (Retrieval-Augmented Generation), database vettoriali e pipeline di ricerca semantica. Puoi dividere per numero stimato di token, numero di caratteri o limiti di paragrafo — con sovrapposizione configurabile per preservare il contesto tra i chunk.

Come usare

  1. Incolla il testo da dividere nel campo di input.
  2. Scegli la modalità di divisione: Token (migliore per il contesto LLM), Caratteri (dimensione precisa) o Paragrafi (divisioni naturali).
  3. Imposta la dimensione del chunk (es: 512 token per la maggior parte dei modelli di embedding) e la sovrapposizione opzionale (es: 50 token per mantenere il contesto).
  4. Clicca su Dividi testo — ogni chunk appare sotto con il suo conteggio di token e caratteri.
  5. Copia i chunk individuali con il pulsante Copia accanto a ciascuno.

Quando usarlo

Devi caricare un PDF di 50 pagine in un database vettoriale per la ricerca semantica? Incolla il testo estratto, imposta 512 token con 50 token di sovrapposizione e ottieni circa 80 chunk che mantengono i confini delle frasi. La sovrapposizione porta abbastanza contesto tra i tagli da non perdere significato, pronti per il tuo modello di embedding.

Domande frequenti

Quale dimensione di chunk usare per RAG?

Per la maggior parte dei modelli di embedding (text-embedding-3-small, text-embedding-ada-002, Cohere Embed), 256–512 token è il punto ottimale. Chunk più grandi portano più contesto ma possono diluire il segnale semantico. Per le finestre di contesto LLM, puoi arrivare fino a 2000–4000 token per chunk a seconda di quanti chunk recuperi contemporaneamente.

Cos'è la sovrapposizione dei chunk e perché è importante?

La sovrapposizione è il numero di token/caratteri condivisi tra chunk consecutivi. Senza sovrapposizione, una frase che cade esattamente su un confine di chunk viene divisa in due, perdendo contesto. Una sovrapposizione del 10–20% (es: 50 token per chunk da 512) assicura continuità tra chunk adiacenti.

Devo dividere per token o per caratteri?

Dividere per token è più preciso per i limiti di LLM e modelli di embedding. Dividere per caratteri dà dimensioni deterministiche — utile quando il sistema a valle misura byte o caratteri. La modalità paragrafo è migliore per preservare la struttura naturale del documento.

Questo strumento spezza le frasi a metà parola?

No. Il divisore tenta prima di tagliare ai confini di paragrafo, poi alla punteggiatura di fine frase, poi agli spazi tra parole. Taglia a metà parola solo se non viene trovato un confine migliore.

C'è un limite alla lunghezza del testo?

Nessun limite rigido — lo strumento funziona completamente nel tuo browser. Testi molto lunghi (oltre 1 milione di caratteri) possono rallentare il browser durante l'elaborazione, ma non ci sono restrizioni lato server.

Posso condividere questo strumento con i miei dati precompilati?

Sì. L'URL si aggiorna automaticamente mentre digiti. Copia il link dalla barra degli indirizzi o usa il pulsante Condividi — chiunque lo apra vedrà i tuoi dati già inseriti.

Strumenti correlati