Divisor de Texto para IA — RAG y Embeddings
Qué es Divisor de Texto para IA — RAG y Embeddings
Un divisor de texto (text chunker) divide documentos largos en piezas más pequeñas que caben en la ventana de contexto de los LLMs o en los límites de tamaño de entrada de los modelos de embedding. Este es un paso central en la construcción de sistemas RAG (Retrieval-Augmented Generation), bases de datos vectoriales y pipelines de búsqueda semántica. Puedes dividir por conteo estimado de tokens, conteo de caracteres o límites de párrafos — con solapamiento configurable para preservar el contexto entre divisiones.
Cómo usar
- Pega el texto que quieres dividir en el campo de entrada.
- Elige el modo de división: Tokens (mejor para contexto de LLM), Caracteres (tamaño preciso) o Párrafos (divisiones naturales).
- Establece el tamaño del chunk (ej: 512 tokens para la mayoría de modelos de embedding) y solapamiento opcional (ej: 50 tokens para mantener contexto).
- Haz clic en Dividir texto — cada chunk aparece abajo con su conteo de tokens y caracteres.
- Copia chunks individuales con el botón Copiar junto a cada uno.
Cuándo usarla
¿Necesitas cargar un PDF de 50 páginas en una base de datos vectorial para búsqueda semántica? Pega el texto extraído, establece 512 tokens con 50 tokens de solapamiento y obtienes unos 80 chunks que conservan los límites de las oraciones. El solapamiento arrastra contexto suficiente entre los cortes para no perder significado, listos para tu modelo de embedding.
Preguntas frecuentes
¿Qué tamaño de chunk debo usar para RAG?
Para la mayoría de modelos de embedding (text-embedding-3-small, text-embedding-ada-002, Cohere Embed), 256–512 tokens es el punto óptimo. Chunks más grandes llevan más contexto pero pueden diluir la señal semántica. Para ventanas de contexto de LLM, puedes llegar hasta 2000–4000 tokens por chunk dependiendo de cuántos chunks recuperas a la vez.
¿Qué es el solapamiento de chunks y por qué importa?
El solapamiento es el número de tokens/caracteres compartidos entre chunks consecutivos. Sin solapamiento, una oración que cae exactamente en un límite de chunk se divide entre dos chunks, perdiendo contexto. Un solapamiento del 10–20% (ej: 50 tokens para chunks de 512) asegura continuidad entre chunks adyacentes.
¿Debo dividir por tokens o caracteres?
Dividir por tokens es más preciso para los límites de LLM y modelos de embedding. Dividir por caracteres da tamaños determinísticos — útil cuando el sistema downstream mide bytes o caracteres. El modo párrafo es mejor para preservar la estructura natural del documento.
¿Esta herramienta rompe las oraciones en medio de palabras?
No. El divisor intenta romper en límites de párrafo primero, luego en puntuación de fin de oración, luego en espacios de palabras. Solo rompe en medio de palabras si no se encuentra un límite mejor.
¿Hay un límite en el tamaño del texto?
Sin límite rígido — la herramienta corre completamente en tu navegador. Textos muy grandes (más de 1 millón de caracteres) pueden hacer que tu navegador se ralentice durante el procesamiento, pero no hay restricción del lado del servidor.
¿Puedo compartir esta herramienta con mis datos precargados?
Sí. La URL se actualiza automáticamente mientras escribes. Copia el enlace desde la barra de direcciones o usa el botón Compartir — quien lo abra verá tus datos ya cargados.
Herramientas relacionadas
Contador de Tokens de IA — GPT, Claude y Gemini
Cuenta tokens de cualquier texto para GPT-4, Claude y Gemini. Contador de tokens de IA gratuito online. Ve el uso de la ventana de contexto e conteo de palabras al instante.
Codificador y Decodificador del Cifrado Atbash
Codifica y decodifica el cifrado Atbash online. Atbash refleja el alfabeto y es su propio inverso, así que un clic cifra y descifra. Gratis y privado.
Quitar Fondo de Imagen
Quita el fondo de cualquier imagen online y descarga un PNG transparente. Funciona en tu navegador con IA, tu foto nunca se sube. Gratis.