开发者工具 / 31

RAG文本切分与重叠可视化工具

在浏览器中可视化RAG向量索引的文本切分策略、token/字符分块大小和重叠部分。

RAG文本切分与重叠可视化工具: TOEA会根据你选择的策略,在本地将文档切分为文本块。它会计算字符范围、token估算值(约4字符/token),以及相邻文本块之间明确的重叠文本。 完全在浏览器中本地运行,文件不会上传到服务器。

使用次数
在浏览器中
费用
免费·无需注册
可用性
可直接使用
目标分块大小300 字符
重叠窗口40 字符
分块总数5
平均分块长度264 字符
平均每个分块的Token数~66 Token数
文档长度782 字符

已生成的文档分块及重叠部分

分块#1范围:[0 - 300]• 300 字符(约75 Token数)

# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.

分块#2范围:[56 - 324]• 268 字符(约67 Token数)
上一个分块的重叠部分:"Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. "

Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies

分块#3范围:[298 - 568]• 270 字符(约68 Token数)
上一个分块的重叠部分:" ## Chunking Strategies "

## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

分块#4范围:[324 - 568]• 244 字符(约61 Token数)
上一个分块的重叠部分:"Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing "

Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

分块#5范围:[546 - 782]• 236 字符(约59 Token数)
上一个分块的重叠部分:" ## Vector Indexing "

## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.

字符、token和模型限制

这里的分块大小以字符计,token数量假设每个token约包含四个字符,这对英文散文基本成立。代码、数字和许多其他语言每个字符使用的token更多,因此请预留余量。请根据嵌入模型的输入限制检查结果:许多BERT类模型在512个token处停止,通常会丢弃其余内容,而OpenAI的text-embedding-3模型接受8,191个token。在2,000个字符的最大值下,一个分块大约对应500个英文token。

阅读预览

请留意从思路中间开始的分块、与其引入的文本分开的标题,以及被截成两半的表格或代码块;检索到这些内容时,它们都不会带有赋予其意义的上下文。使用句子、段落和Markdown策略时,任何长于分块大小的单个单元都会保持完整,因此超大的分块通常说明其中有很长的段落或章节。

使用这三种策略时,重叠部分也会按完整的句子、段落或章节回退,而不是按精确的字符数回退。许多处理流程还会在每个分块嵌入前,将文档标题或章节标题添加到分块开头。

使用方法

  1. 将文档或代码粘贴到编辑器中。
  2. 选择切分策略(段落、句子、Markdown标题或固定大小),并调整目标分块大小和重叠滑块。
  3. 查看按颜色区分的分块边界、字符/token指标和重叠窗口。

隐私与限制

你的源文档会100%保留在浏览器内存中。

相关工具

常见问题

RAG应该使用哪种文本切分策略?

对于一般文本,段落边界效果最好;结构化文档适合使用Markdown标题;需要高精度问答时,适合使用句子边界。

为什么文本块重叠很重要?

重叠可以防止语义在文本块边界处丢失,确保向量相似度搜索能够捕获跨越切分点的上下文。

免费工具·使用在浏览器中次·无需账户