Entwickler-Werkzeug / 31

RAG Textsegmentierung & Überlappungs-Visualisierung

Visualisiere Strategien zur Textaufteilung, Token-/Zeichen-Abschnittsgrößen und Überlappungen für die RAG‑Vektorindizierung direkt im Browser.

RAG Textsegmentierung & Überlappungs-Visualisierung: TOEA teilt Dokumente lokal nach deiner gewählten Strategie in Textabschnitte. Es berechnet Zeichenbereiche, Token-Schätzungen (~4 chars/token) und den expliziten Überlappungstext zwischen aufeinanderfolgenden Abschnitten. Läuft zu 100% lokal in deinem Browser, ohne Datei-Uploads zum Server.

Ausführungen
In deinem Browser
Kosten
Kostenlos · ohne Anmeldung
Verfügbarkeit
Einsatzbereit
Ziel-Abschnittsgröße300 Zeichen
Überlappungsfenster40 Zeichen
Gesamtzahl der Abschnitte5
Durchschn. Abschnittslänge264 Zeichen
Durchschn. Token/Abschnitt~66 Token
Dokumentlänge782 Zeichen

Generierte Dokumentabschnitte & Überlappungen

Abschnitt Nr.1Bereich: [0 - 300]• 300 Zeichen (~75 Token)

# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.

Abschnitt Nr.2Bereich: [56 - 324]• 268 Zeichen (~67 Token)
Überlappung mit vorherigem Abschnitt:"Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. "

Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies

Abschnitt Nr.3Bereich: [298 - 568]• 270 Zeichen (~68 Token)
Überlappung mit vorherigem Abschnitt:" ## Chunking Strategies "

## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Abschnitt Nr.4Bereich: [324 - 568]• 244 Zeichen (~61 Token)
Überlappung mit vorherigem Abschnitt:"Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing "

Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Abschnitt Nr.5Bereich: [546 - 782]• 236 Zeichen (~59 Token)
Überlappung mit vorherigem Abschnitt:" ## Vector Indexing "

## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.

Zeichen, Token und Modelllimits

Die Chunk-Größe wird hier in Zeichen angegeben. Die Tokenzahl geht von etwa vier Zeichen pro Token aus, was für englische Prosa zutrifft. Code, Zahlen und viele andere Sprachen verwenden mehr Token pro Zeichen, daher solltest du Spielraum lassen. Vergleiche das Ergebnis mit dem Eingabelimit deines Einbettungsmodells: Viele BERT-ähnliche Modelle stoppen bei 512 Token und verwerfen den Rest normalerweise, während OpenAIs text-embedding-3-Modelle 8.191 akzeptieren. Bei maximal 2.000 Zeichen umfasst ein Chunk ungefähr 500 englische Token.

Die Vorschau lesen

Achte auf Chunks, die mitten in einem Gedanken beginnen, auf Überschriften ohne den zugehörigen Text und auf Tabellen oder Codeblöcke, die geteilt wurden. Jeder dieser Teile wird ohne den Kontext abgerufen, der ihm seine Bedeutung gibt. Bei den Strategien für Sätze, Absätze und Markdown bleibt eine einzelne Einheit, die länger als die Chunk-Größe ist, vollständig erhalten. Ein übergroßer Chunk deutet daher meist auf einen sehr langen Absatz oder Abschnitt hin.

Bei diesen drei Strategien erfolgt die Überlappung ebenfalls anhand vollständiger Sätze, Absätze oder Abschnitte und nicht anhand einer exakten Zeichenzahl. Viele Pipelines stellen außerdem jedem Chunk vor der Einbettung den Dokumenttitel oder die Abschnittsüberschrift voran.

So benutzt du es

  1. Füge dein Dokument oder deinen Code in den Editor ein.
  2. Wähle eine Aufteilungsstrategie (Absatz, Satz, Markdown-Überschriften oder feste Größe) und passe die Schieberegler für Zielabschnittsgröße und Überlappung an.
  3. Untersuche farblich markierte Abschnittsgrenzen, Zeichen-/Token-Kennzahlen und Überlappungsbereiche.

Datenschutz & Einschränkungen

Dein Quelldokument bleibt zu 100% im Arbeitsspeicher deines Browsers.

Ähnliche Tools

Häufige Fragen

Welche Segmentierungsstrategie sollte ich für RAG verwenden?

Absatzgrenzen funktionieren am besten für allgemeinen Text; Markdown-Überschriften für strukturierte Dokumentation; Satzgrenzen für hochpräzise Frage-Antwort.

Warum ist die Überlappung von Abschnitten wichtig?

Überlappung verhindert semantische Verluste an Abschnittsgrenzen und stellt sicher, dass Vektorähnlichkeitssuchen Kontext erfassen, der über Trennpunkte hinweg reicht.

Kostenloses Tool · läuft in deinem browser · kein Konto nötig