Herramienta de desarrollo / 31

Visualizador de fragmentación de texto y superposición para RAG

Visualiza estrategias de división de texto, tamaños de fragmento en tokens/caracteres y superposiciones para indexación vectorial RAG en tu navegador.

Visualizador de fragmentación de texto y superposición para RAG: TOEA divide los documentos en fragmentos de texto de forma local usando la estrategia que elijas. Calcula rangos de caracteres, estimaciones de tokens (~4 caracteres/token) y el texto de superposición explícito entre fragmentos consecutivos. Funciona al 100 % en tu navegador, sin subir archivos a ningún servidor.

Se ejecuta
En tu navegador
Coste
Gratis · sin registro
Disponibilidad
Lista para usar
Tamaño objetivo del fragmento300 caracteres
Ventana de superposición40 caracteres
Total de fragmentos5
Longitud promedio del fragmento264 caracteres
Promedio de tokens / fragmento~66 tokens
Longitud del documento782 caracteres

Fragmentos y superposiciones generados a partir del documento

Fragmento #1Rango: [0 - 300]• 300 caracteres (~75 tokens)

# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.

Fragmento #2Rango: [56 - 324]• 268 caracteres (~67 tokens)
Superposición con el fragmento anterior:"Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. "

Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies

Fragmento #3Rango: [298 - 568]• 270 caracteres (~68 tokens)
Superposición con el fragmento anterior:" ## Chunking Strategies "

## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Fragmento #4Rango: [324 - 568]• 244 caracteres (~61 tokens)
Superposición con el fragmento anterior:"Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing "

Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Fragmento #5Rango: [546 - 782]• 236 caracteres (~59 tokens)
Superposición con el fragmento anterior:" ## Vector Indexing "

## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.

Caracteres, tokens y límites del modelo

Aquí, el tamaño del fragmento se expresa en caracteres y la cifra de tokens supone unos cuatro caracteres por token, algo que se cumple en la prosa en inglés. El código, los números y muchos otros idiomas usan más tokens por carácter, así que deja margen. Comprueba el resultado con el límite de entrada de tu modelo de embeddings: muchos modelos de estilo BERT se detienen en 512 tokens y normalmente descartan el resto, mientras que los modelos text-embedding-3 de OpenAI aceptan 8.191. Con el máximo de 2.000 caracteres, un fragmento equivale aproximadamente a 500 tokens en inglés.

Cómo leer la vista previa

Busca fragmentos que empiecen a mitad de una idea, encabezados separados del texto que introducen y tablas o bloques de código divididos en dos; cada uno se recuperará sin el contexto que le da significado. Con las estrategias de oración, párrafo y Markdown, una unidad individual más larga que el tamaño del fragmento se conserva completa, por lo que un fragmento demasiado grande suele indicar un párrafo o una sección muy largos.

Con esas tres estrategias, la superposición también retrocede por oraciones, párrafos o secciones completas, en lugar de hacerlo según un número exacto de caracteres. Muchas canalizaciones también anteponen el título del documento o el encabezado de la sección a cada fragmento antes de crear sus embeddings.

Cómo se usa

  1. Pega tu documento o código en el editor.
  2. Elige una estrategia de división (Paragraph, Sentence, Markdown Headers o Fixed size) y ajusta los controles deslizantes de tamaño objetivo de fragmento y superposición.
  3. Examina los límites de fragmentos codificados por color, las métricas de caracteres/tokens y las ventanas de superposición.

Privacidad y límites

Tu documento de origen permanece 100% dentro de la memoria de tu navegador.

Herramientas relacionadas

Preguntas frecuentes

¿Qué estrategia de fragmentación debo usar para RAG?

Los límites por párrafo funcionan mejor para texto general; Markdown Headers para documentación estructurada; los límites por oración para preguntas y respuestas de alta precisión.

¿Por qué es importante la superposición de fragmentos?

La superposición evita la pérdida semántica en los límites entre fragmentos y garantiza que las búsquedas por similitud vectorial capturen el contexto que atraviesa los puntos de corte.

Herramienta gratuita · se ejecuta en tu navegador · sin cuenta