Ferramenta de desenvolvedor / 31

Visualizador de Chunking e Sobreposição de Texto (RAG)

Visualize estratégias de divisão de texto, tamanhos de chunks por token/caractere e sobreposições para indexação vetorial RAG no seu navegador.

Visualizador de Chunking e Sobreposição de Texto (RAG): TOEA divide documentos em chunks de texto localmente usando a estratégia escolhida por você. Ela calcula intervalos de caracteres, estimativas de tokens (~4 caracteres/token) e o texto de sobreposição explícito entre chunks consecutivos. Roda 100% localmente no seu navegador, sem enviar nenhum arquivo para o servidor.

Execuções
No seu navegador
Custo
Grátis · sem cadastro
Disponibilidade
Pronto para usar
Tamanho-alvo do bloco300 caracteres
Janela de sobreposição40 caracteres
Total de blocos5
Tamanho médio do bloco264 caracteres
Média de tokens / bloco~66 tokens
Tamanho do documento782 caracteres

Blocos e sobreposições do documento gerados

Bloco #1Intervalo: [0 - 300]• 300 caracteres (~75 tokens)

# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.

Bloco #2Intervalo: [56 - 324]• 268 caracteres (~67 tokens)
Sobreposição do bloco anterior:"Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. "

Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies

Bloco #3Intervalo: [298 - 568]• 270 caracteres (~68 tokens)
Sobreposição do bloco anterior:" ## Chunking Strategies "

## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Bloco #4Intervalo: [324 - 568]• 244 caracteres (~61 tokens)
Sobreposição do bloco anterior:"Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing "

Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Bloco #5Intervalo: [546 - 782]• 236 caracteres (~59 tokens)
Sobreposição do bloco anterior:" ## Vector Indexing "

## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.

Caracteres, tokens e limites do modelo

O tamanho do chunk aqui é medido em caracteres, e a quantidade de tokens pressupõe cerca de quatro caracteres por token, o que funciona para prosa em inglês. Código, números e muitos outros idiomas usam mais tokens por caractere, portanto deixe uma margem. Confira o resultado em relação ao limite de entrada do seu modelo de embeddings: muitos modelos no estilo BERT param em 512 tokens e normalmente descartam o restante, enquanto os modelos text-embedding-3 da OpenAI aceitam 8.191. No máximo de 2.000 caracteres, um chunk equivale aproximadamente a 500 tokens em inglês.

Lendo a prévia

Procure chunks que começam no meio de um raciocínio, títulos separados do texto que introduzem e tabelas ou blocos de código cortados ao meio; cada um será recuperado sem o contexto que lhe dá significado. Com as estratégias de sentença, parágrafo e Markdown, uma unidade única maior que o tamanho do chunk é mantida inteira; portanto, um chunk grande geralmente indica um parágrafo ou uma seção muito longa.

Com essas três estratégias, a sobreposição também recua por sentenças, parágrafos ou seções inteiros, em vez de usar uma quantidade exata de caracteres. Muitos pipelines também acrescentam o título do documento ou o título da seção a cada chunk antes de gerar os embeddings.

Como usar

  1. Cole seu documento ou código no editor.
  2. Escolha uma estratégia de divisão (Parágrafo, Frase, Cabeçalhos Markdown ou Tamanho fixo) e ajuste os controles de tamanho de chunk alvo e de sobreposição.
  3. Inspecione limites de chunks com cores, métricas de caracteres/tokens e janelas de sobreposição.

Privacidade e limitações

Seu documento de origem permanece 100% na memória do seu navegador.

Ferramentas relacionadas

Perguntas frequentes

Qual estratégia de chunking devo usar para RAG?

Limites de parágrafo funcionam melhor para texto geral; Cabeçalhos Markdown para documentação estruturada; limites de frase para Q&A de alta precisão.

Por que a sobreposição entre chunks é importante?

A sobreposição evita perda semântica nos limites dos chunks, garantindo que buscas por similaridade vetorial capturem o contexto que atravessa os pontos de corte.

Ferramenta grátis · no seu navegador execuções · não precisa de conta