Découpeur de Texte IA — RAG et Embeddings

Qu'est-ce que Découpeur de Texte IA — RAG et Embeddings

Un découpeur de texte (text chunker) divise les longs documents en morceaux plus petits qui tiennent dans la fenêtre de contexte des LLMs ou dans les limites de taille d'entrée des modèles d'embedding. C'est une étape centrale dans la construction de systèmes RAG (Retrieval-Augmented Generation), de bases de données vectorielles et de pipelines de recherche sémantique. Vous pouvez diviser par nombre estimé de tokens, nombre de caractères ou limites de paragraphes — avec un chevauchement configurable pour préserver le contexte entre les segments.

Comment utiliser

  1. Collez le texte à découper dans le champ de saisie.
  2. Choisissez le mode de découpage : Tokens (idéal pour le contexte LLM), Caractères (taille précise) ou Paragraphes (coupures naturelles).
  3. Définissez la taille du segment (ex : 512 tokens pour la plupart des modèles d'embedding) et le chevauchement optionnel (ex : 50 tokens pour maintenir le contexte).
  4. Cliquez sur Découper le texte — chaque segment apparaît en dessous avec son nombre de tokens et de caractères.
  5. Copiez les segments individuels avec le bouton Copier à côté de chacun.

Quand l'utiliser

Vous chargez un PDF de 50 pages dans une base de données vectorielle pour la recherche sémantique ? Collez le texte extrait, réglez 512 tokens avec 50 tokens de chevauchement et vous obtenez environ 80 segments qui conservent les limites de phrases. Le chevauchement transporte assez de contexte entre les coupures pour ne pas perdre de sens, prêts pour votre modèle d'embedding.

Questions fréquentes

Quelle taille de segment utiliser pour RAG ?

Pour la plupart des modèles d'embedding (text-embedding-3-small, text-embedding-ada-002, Cohere Embed), 256–512 tokens est la zone optimale. Les segments plus grands portent plus de contexte mais peuvent diluer le signal sémantique. Pour les fenêtres de contexte LLM, vous pouvez aller jusqu'à 2000–4000 tokens par segment selon le nombre de segments récupérés.

Qu'est-ce que le chevauchement de segments et pourquoi est-il important ?

Le chevauchement est le nombre de tokens/caractères partagés entre des segments consécutifs. Sans chevauchement, une phrase tombant exactement sur une limite de segment est coupée en deux, perdant du contexte. Un chevauchement de 10–20% (ex : 50 tokens pour des segments de 512) assure la continuité entre segments adjacents.

Faut-il découper par tokens ou par caractères ?

Découper par tokens est plus précis pour les limites des LLM et des modèles d'embedding. Découper par caractères donne des tailles déterministes — utile quand le système en aval mesure en octets ou caractères. Le mode paragraphes est idéal pour préserver la structure naturelle du document.

Cet outil coupe-t-il les phrases au milieu des mots ?

Non. Le découpeur essaie de couper aux limites de paragraphe d'abord, puis à la ponctuation de fin de phrase, puis aux espaces entre mots. Il ne coupe qu'au milieu des mots si aucune meilleure limite n'est trouvée.

Y a-t-il une limite à la taille du texte ?

Pas de limite stricte — l'outil fonctionne entièrement dans votre navigateur. Les textes très longs (plus de 1 million de caractères) peuvent ralentir votre navigateur pendant le traitement, mais il n'y a pas de restriction côté serveur.

Puis-je partager cet outil avec mes données pré-remplies ?

Oui. L'URL se met à jour pendant que vous tapez. Copiez le lien depuis la barre d'adresse ou utilisez le bouton Partager — quiconque l'ouvre verra vos données déjà remplies.

Outils connexes