Outil de développement / 31
Visualiseur de découpage de texte RAG et de chevauchement
Visualisez les stratégies de découpage, les tailles de segments en caractères/tokens et les chevauchements pour l’indexation vectorielle RAG, dans votre navigateur.
Visualiseur de découpage de texte RAG et de chevauchement: TOEA découpe les documents en segments de texte en local selon la stratégie que vous choisissez. Il calcule les plages de caractères, des estimations de tokens (~4 caractères par token) et le texte de chevauchement explicite entre segments consécutifs. Fonctionne 100 % localement dans votre navigateur, sans aucun téléversement de fichier vers le serveur.
- Catégorie
- Outils développeur
- Exécutions
- Dans votre navigateur
- Coût
- Gratuit · sans inscription
- Disponibilité
- Prêt à l'emploi
Segments générés du document et chevauchements
# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.
Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies
## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing
Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing
## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.
Caractères, tokens et limites des modèles
La taille des segments est exprimée ici en caractères, et le nombre de tokens suppose environ quatre caractères par token, ce qui convient à la prose anglaise. Le code, les nombres et de nombreuses autres langues utilisent davantage de tokens par caractère ; gardez donc une marge. Vérifiez le résultat par rapport à la limite d’entrée de votre modèle d’embeddings : de nombreux modèles de type BERT s’arrêtent à 512 tokens et ignorent généralement le reste, tandis que les modèles text-embedding-3 d’OpenAI acceptent 8 191 tokens. À la taille maximale de 2 000 caractères, un segment représente environ 500 tokens anglais.
Lire l’aperçu
Repérez les segments qui commencent au milieu d’une idée, les titres séparés du texte qu’ils introduisent et les tableaux ou blocs de code coupés en deux ; chacun sera récupéré sans le contexte qui lui donne son sens. Avec les stratégies par phrase, par paragraphe et Markdown, une unité unique plus longue que la taille du segment est conservée en entier ; un segment trop volumineux indique donc généralement un paragraphe ou une section très long.
Avec ces trois stratégies, le chevauchement revient également en arrière par phrases, paragraphes ou sections entiers, plutôt que selon un nombre exact de caractères. De nombreux pipelines ajoutent aussi le titre du document ou le titre de la section au début de chaque segment avant de le vectoriser.
Comment l'utiliser
- Collez votre document ou votre code dans l’éditeur.
- Choisissez une stratégie de découpage (Paragraph, Sentence, Markdown Headers ou Fixed size) et réglez les curseurs de taille de segment cible et de chevauchement.
- Examinez les limites de segments colorées, les métriques caractères/tokens et les fenêtres de chevauchement.
Confidentialité et limitations
Votre document source reste 100 % dans la mémoire de votre navigateur.
Outils associés
Questions fréquentes
Quelle stratégie de découpage dois-je utiliser pour RAG ?
Les limites de paragraphes fonctionnent le mieux pour le texte général ; Markdown Headers pour la documentation structurée ; les limites de phrases pour des questions-réponses très précises.
Pourquoi le chevauchement des segments est-il important ?
Le chevauchement évite les pertes sémantiques aux frontières des segments, garantissant que les recherches par similarité vectorielle capturent le contexte qui traverse les points de découpe.
Outil gratuit · dans votre navigateur exécutions · aucun compte requis