Herramienta de desarrollo / 31
Visualizador de fragmentación de texto y superposición para RAG
Visualiza estrategias de división de texto, tamaños de fragmento en tokens/caracteres y superposiciones para indexación vectorial RAG en tu navegador.
Visualizador de fragmentación de texto y superposición para RAG: TOEA divide los documentos en fragmentos de texto de forma local usando la estrategia que elijas. Calcula rangos de caracteres, estimaciones de tokens (~4 caracteres/token) y el texto de superposición explícito entre fragmentos consecutivos. Funciona al 100 % en tu navegador, sin subir archivos a ningún servidor.
- Categoría
- Herramientas de desarrollo
- Se ejecuta
- En tu navegador
- Coste
- Gratis · sin registro
- Disponibilidad
- Lista para usar
Fragmentos y superposiciones generados a partir del documento
# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.
Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies
## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing
Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing
## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.
Caracteres, tokens y límites del modelo
Aquí, el tamaño del fragmento se expresa en caracteres y la cifra de tokens supone unos cuatro caracteres por token, algo que se cumple en la prosa en inglés. El código, los números y muchos otros idiomas usan más tokens por carácter, así que deja margen. Comprueba el resultado con el límite de entrada de tu modelo de embeddings: muchos modelos de estilo BERT se detienen en 512 tokens y normalmente descartan el resto, mientras que los modelos text-embedding-3 de OpenAI aceptan 8.191. Con el máximo de 2.000 caracteres, un fragmento equivale aproximadamente a 500 tokens en inglés.
Cómo leer la vista previa
Busca fragmentos que empiecen a mitad de una idea, encabezados separados del texto que introducen y tablas o bloques de código divididos en dos; cada uno se recuperará sin el contexto que le da significado. Con las estrategias de oración, párrafo y Markdown, una unidad individual más larga que el tamaño del fragmento se conserva completa, por lo que un fragmento demasiado grande suele indicar un párrafo o una sección muy largos.
Con esas tres estrategias, la superposición también retrocede por oraciones, párrafos o secciones completas, en lugar de hacerlo según un número exacto de caracteres. Muchas canalizaciones también anteponen el título del documento o el encabezado de la sección a cada fragmento antes de crear sus embeddings.
Cómo se usa
- Pega tu documento o código en el editor.
- Elige una estrategia de división (Paragraph, Sentence, Markdown Headers o Fixed size) y ajusta los controles deslizantes de tamaño objetivo de fragmento y superposición.
- Examina los límites de fragmentos codificados por color, las métricas de caracteres/tokens y las ventanas de superposición.
Privacidad y límites
Tu documento de origen permanece 100% dentro de la memoria de tu navegador.
Herramientas relacionadas
Preguntas frecuentes
¿Qué estrategia de fragmentación debo usar para RAG?
Los límites por párrafo funcionan mejor para texto general; Markdown Headers para documentación estructurada; los límites por oración para preguntas y respuestas de alta precisión.
¿Por qué es importante la superposición de fragmentos?
La superposición evita la pérdida semántica en los límites entre fragmentos y garantiza que las búsquedas por similitud vectorial capturen el contexto que atraviesa los puntos de corte.
Herramienta gratuita · se ejecuta en tu navegador · sin cuenta