開発者ツール / 31

RAGテキスト分割&オーバーラップ可視化ツール

ブラウザ上で、RAGのベクターインデックス向けに、テキストの分割戦略、トークン/文字のチャンクサイズ、オーバーラップを可視化します。

RAGテキスト分割&オーバーラップ可視化ツール: TOEAは、選択した戦略でドキュメントをローカルにテキストチャンクへ分割します。文字範囲、トークン推定値(~4 chars/token)、連続するチャンク間の明示的なオーバーラップテキストを計算します。 サーバーへのファイルアップロードは一切なく、100%ブラウザ内でローカル実行します。

カテゴリ
開発者ツール
実行回数
ブラウザ内で
コスト
無料 · 登録不要
提供状況
すぐに使えます
目標のチャンクサイズ300 文字
オーバーラップ幅40 文字
総チャンク数5
平均チャンク長264 文字
平均トークン数/チャンク~66 トークン
ドキュメントの長さ782 文字

生成されたドキュメントのチャンクとオーバーラップ

チャンク #1範囲: [0 - 300]• 300 文字 (~75 トークン)

# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.

チャンク #2範囲: [56 - 324]• 268 文字 (~67 トークン)
前のチャンクとのオーバーラップ:"Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. "

Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies

チャンク #3範囲: [298 - 568]• 270 文字 (~68 トークン)
前のチャンクとのオーバーラップ:" ## Chunking Strategies "

## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

チャンク #4範囲: [324 - 568]• 244 文字 (~61 トークン)
前のチャンクとのオーバーラップ:"Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing "

Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

チャンク #5範囲: [546 - 782]• 236 文字 (~59 トークン)
前のチャンクとのオーバーラップ:" ## Vector Indexing "

## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.

文字、トークン、モデルの上限

ここでのチャンクサイズは文字数で、トークン数は英語の文章に当てはまりやすい、1トークンあたり約4文字という前提で計算されます。コード、数値、多くの言語では1文字あたりのトークン数が増えるため、余裕を持たせてください。結果が埋め込みモデルの入力上限に収まるか確認しましょう。多くのBERT系モデルは512トークンで停止し、通常は残りを切り捨てます。一方、OpenAIのtext-embedding-3モデルは8,191トークンを受け付けます。チャンクの最大値2,000文字では、英語でおよそ500トークンです。

プレビューを読み取る

考えの途中から始まるチャンク、導入する本文から切り離された見出し、途中で分割された表やコードブロックを探してください。これらは意味を与える文脈なしで検索されます。文、段落、Markdownの各戦略では、チャンクサイズを超える単一の単位も全体が保持されるため、サイズを超えるチャンクは通常、非常に長い段落やセクションを示しています。

これら3つの戦略では、オーバーラップも正確な文字数ではなく、文、段落、セクション単位で後ろに戻ります。多くのパイプラインでは、各チャンクを埋め込む前に文書タイトルやセクション見出しも先頭に追加します。

使い方

  1. エディタにドキュメントまたはコードを貼り付けます。
  2. 分割戦略(段落、文、Markdownの見出し、固定サイズ)を選び、目標チャンクサイズとオーバーラップのスライダーを調整します。
  3. 色分けされたチャンク境界、文字/トークンのメトリクス、オーバーラップ領域を確認します。

プライバシーと制限事項

元のドキュメントは100%ブラウザのメモリ内に留まります。

関連ツール

よくある質問

RAGではどのチャンク分割戦略を使うべきですか?

一般的なテキストには段落境界が最適です。構造化されたドキュメントにはMarkdownの見出し、精度重視のQ&Aには文境界が有効です。

チャンクのオーバーラップはなぜ重要ですか?

オーバーラップはチャンク境界をまたぐ意味情報の欠落を防ぎ、ベクター類似検索が分割点をまたぐコンテキストを確実に捉えられるようにします。

無料ツール · ブラウザ内で · アカウント不要