Divisor de Texto para IA — RAG e Embeddings
O que é Divisor de Texto para IA — RAG e Embeddings
Um divisor de texto (text chunker) divide documentos longos em pedaços menores que cabem na janela de contexto de LLMs ou nos limites de tamanho de entrada de modelos de embedding. Este é um passo central na construção de sistemas RAG (Retrieval-Augmented Generation), bancos de dados vetoriais e pipelines de busca semântica. Você pode dividir por contagem estimada de tokens, contagem de caracteres ou limites de parágrafos — com sobreposição configurável para preservar contexto entre divisões.
Como usar
- Cole o texto que deseja dividir no campo de entrada.
- Escolha o modo de divisão: Tokens (melhor para contexto de LLM), Caracteres (tamanho preciso) ou Parágrafos (divisões naturais).
- Defina o tamanho do chunk (ex: 512 tokens para a maioria dos modelos de embedding) e sobreposição opcional (ex: 50 tokens para manter contexto).
- Clique em Dividir texto — cada chunk aparece abaixo com sua contagem de tokens e caracteres.
- Copie chunks individuais com o botão Copiar ao lado de cada um.
Quando usar
Precisa carregar um PDF de 50 páginas em um banco de dados vetorial para busca semântica? Cole o texto extraído, defina 512 tokens com 50 tokens de sobreposição e você recebe cerca de 80 chunks que mantêm os limites das frases. A sobreposição carrega contexto suficiente entre os cortes para não perder significado, prontos para enviar ao modelo de embedding.
Perguntas frequentes
Qual tamanho de chunk devo usar para RAG?
Para a maioria dos modelos de embedding (text-embedding-3-small, text-embedding-ada-002, Cohere Embed), 256–512 tokens é o ponto ideal. Chunks maiores carregam mais contexto, mas podem diluir o sinal semântico. Para janelas de contexto de LLM, você pode ir até 2000–4000 tokens por chunk dependendo de quantos chunks recupera de uma vez.
O que é sobreposição de chunks e por que importa?
Sobreposição é o número de tokens/caracteres compartilhados entre chunks consecutivos. Sem sobreposição, uma frase que cai exatamente em um limite de chunk é dividida entre dois chunks, perdendo contexto. Uma sobreposição de 10–20% (ex: 50 tokens para chunks de 512) garante continuidade entre chunks adjacentes.
Devo dividir por tokens ou caracteres?
Dividir por tokens é mais preciso para limites de LLM e modelos de embedding. Dividir por caracteres dá tamanhos determinísticos — útil quando o sistema downstream mede bytes ou caracteres. O modo de parágrafos é melhor para preservar a estrutura natural do documento.
Esta ferramenta quebra frases no meio de palavras?
Não. O divisor tenta quebrar em limites de parágrafo primeiro, depois em pontuação de fim de frase, depois em espaços de palavras. Só quebra no meio de palavras se nenhum limite melhor for encontrado.
Há limite no tamanho do texto?
Sem limite rígido — a ferramenta roda inteiramente no seu navegador. Textos muito grandes (acima de 1 milhão de caracteres) podem deixar o navegador lento durante o processamento, mas não há restrição do lado do servidor.
Posso compartilhar esta ferramenta com meus dados preenchidos?
Sim. A URL é atualizada automaticamente enquanto você digita. Copie da barra de endereço ou use o botão Compartilhar — quem abrir verá seus dados exatos já preenchidos.
Ferramentas relacionadas
Contador de Tokens de IA — GPT, Claude e Gemini
Conte tokens de qualquer texto para GPT-4, Claude e Gemini. Contador de tokens de IA gratuito. Veja o uso da janela de contexto e contagem de palavras instantaneamente.
Codificador e Decodificador da Cifra Atbash
Codifique e decodifique a cifra Atbash online. O Atbash espelha o alfabeto e é seu próprio inverso, então um clique embaralha e desembaralha. Grátis e privado.
Removedor de Fundo
Remova o fundo de qualquer imagem online e baixe um PNG transparente. Roda no seu navegador com IA, sua foto nunca é enviada. Grátis.