Công cụ dành cho nhà phát triển / 31

Trình trực quan hóa chia đoạn và độ chồng lấp văn bản RAG

Trực quan hóa cách chia văn bản, kích thước đoạn theo token/ký tự và độ chồng lấp để lập chỉ mục vector RAG trong trình duyệt.

Trình trực quan hóa chia đoạn và độ chồng lấp văn bản RAG: TOEA chia tài liệu thành các đoạn văn bản ngay trên thiết bị bằng chiến lược bạn chọn. Công cụ tính phạm vi ký tự, ước tính token (~4 ký tự/token) và phần văn bản chồng lấp rõ ràng giữa các đoạn liên tiếp. Chạy 100% cục bộ trong trình duyệt của bạn, không có tệp nào được tải lên máy chủ.

Lượt chạy
Trong trình duyệt của bạn
Chi phí
Miễn phí · không cần đăng ký
Trạng thái khả dụng
Sẵn sàng sử dụng
Kích thước đoạn mục tiêu300 ký tự
Cửa sổ chồng lấn40 ký tự
Tổng số đoạn5
Độ dài đoạn trung bình264 ký tự
Token trung bình / đoạn~66 token
Độ dài tài liệu782 ký tự

Các đoạn tài liệu và phần chồng lấn đã tạo

Đoạn #1Phạm vi: [0 - 300]• 300 ký tự (~75 token)

# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.

Đoạn #2Phạm vi: [56 - 324]• 268 ký tự (~67 token)
Phần chồng lấn với đoạn trước:"Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. "

Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies

Đoạn #3Phạm vi: [298 - 568]• 270 ký tự (~68 token)
Phần chồng lấn với đoạn trước:" ## Chunking Strategies "

## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Đoạn #4Phạm vi: [324 - 568]• 244 ký tự (~61 token)
Phần chồng lấn với đoạn trước:"Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing "

Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Đoạn #5Phạm vi: [546 - 782]• 236 ký tự (~59 token)
Phần chồng lấn với đoạn trước:" ## Vector Indexing "

## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.

Ký tự, token và giới hạn mô hình

Kích thước đoạn ở đây tính theo ký tự, còn số token giả định khoảng bốn ký tự cho mỗi token, phù hợp với văn xuôi tiếng Anh. Mã, số và nhiều ngôn ngữ khác dùng nhiều token hơn trên mỗi ký tự, vì vậy hãy chừa dung lượng dự phòng. Kiểm tra kết quả theo giới hạn đầu vào của mô hình embedding: nhiều mô hình kiểu BERT dừng ở 512 token và thường bỏ phần còn lại, trong khi các mô hình text-embedding-3 của OpenAI chấp nhận 8.191. Ở mức tối đa 2.000 ký tự, một đoạn tương đương khoảng 500 token tiếng Anh.

Đọc phần xem trước

Hãy tìm các đoạn bắt đầu giữa chừng một ý, tiêu đề bị tách khỏi phần văn bản mà chúng giới thiệu, cùng các bảng hoặc khối mã bị cắt đôi; mỗi phần sẽ được truy xuất mà không có ngữ cảnh giúp nó có ý nghĩa. Với các chiến lược theo câu, đoạn văn và Markdown, một đơn vị dài hơn kích thước đoạn sẽ được giữ nguyên, nên một đoạn quá lớn thường cho thấy có một đoạn văn hoặc phần rất dài.

Với ba chiến lược đó, phần chồng lấn cũng lùi lại theo toàn bộ câu, đoạn văn hoặc phần, thay vì theo đúng số ký tự. Nhiều pipeline còn thêm tiêu đề tài liệu hoặc tiêu đề phần vào đầu mỗi đoạn trước khi embedding.

Cách sử dụng

  1. Dán tài liệu hoặc mã của bạn vào trình soạn thảo.
  2. Chọn chiến lược chia (Đoạn văn, Câu, Tiêu đề Markdown hoặc Kích thước cố định), rồi điều chỉnh các thanh trượt về kích thước đoạn mục tiêu và độ chồng lấp.
  3. Kiểm tra ranh giới các đoạn được tô màu, chỉ số ký tự/token và các vùng chồng lấp.

Quyền riêng tư và giới hạn

Tài liệu nguồn của bạn vẫn nằm 100% trong bộ nhớ trình duyệt.

Công cụ liên quan

Câu hỏi thường gặp

Nên dùng chiến lược chia đoạn nào cho RAG?

Ranh giới đoạn văn phù hợp nhất với văn bản thông thường; Tiêu đề Markdown phù hợp với tài liệu có cấu trúc; ranh giới câu phù hợp với hỏi đáp yêu cầu độ chính xác cao.

Tại sao độ chồng lấp giữa các đoạn lại quan trọng?

Độ chồng lấp giúp tránh mất ngữ nghĩa ở ranh giới đoạn, bảo đảm các tìm kiếm độ tương đồng vector nắm bắt được ngữ cảnh kéo dài qua các điểm chia.

Công cụ miễn phí · trong trình duyệt của bạn lượt chạy · không cần tài khoản