Alat developer / 31

Visualizer Chunking & Overlap Teks RAG

Visualisasikan strategi pemisahan teks, ukuran chunk token/karakter, dan overlap untuk pengindeksan vektor RAG langsung di browser Anda.

Visualizer Chunking & Overlap Teks RAG: TOEA membagi dokumen menjadi chunk teks secara lokal sesuai strategi pilihan Anda. Alat ini menghitung rentang karakter, perkiraan token (~4 chars/token), dan teks overlap eksplisit antar chunk berurutan. Berjalan 100% lokal di browser Anda tanpa upload file ke server.

Dijalankan
Di browser Anda
Biaya
Gratis · tanpa daftar
Ketersediaan
Siap digunakan
Ukuran Potongan Target300 karakter
Jendela Tumpang Tindih40 karakter
Total Potongan5
Rata-rata Panjang Potongan264 karakter
Rata-rata Token / Potongan~66 token
Panjang Dokumen782 karakter

Potongan Dokumen & Tumpang Tindih yang Dihasilkan

Potongan #1Rentang: [0 - 300]• 300 karakter (~75 token)

# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.

Potongan #2Rentang: [56 - 324]• 268 karakter (~67 token)
Tumpang Tindih Potongan Sebelumnya:"Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. "

Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies

Potongan #3Rentang: [298 - 568]• 270 karakter (~68 token)
Tumpang Tindih Potongan Sebelumnya:" ## Chunking Strategies "

## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Potongan #4Rentang: [324 - 568]• 244 karakter (~61 token)
Tumpang Tindih Potongan Sebelumnya:"Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing "

Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Potongan #5Rentang: [546 - 782]• 236 karakter (~59 token)
Tumpang Tindih Potongan Sebelumnya:" ## Vector Indexing "

## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.

Karakter, token, dan batas model

Ukuran chunk di sini dihitung dalam karakter, sedangkan jumlah token menggunakan asumsi sekitar empat karakter per token, yang berlaku untuk prosa berbahasa Inggris. Kode, angka, dan banyak bahasa lain menggunakan lebih banyak token per karakter, jadi sisakan ruang cadangan. Periksa hasilnya terhadap batas input model embedding Anda: banyak model bergaya BERT berhenti di 512 token dan biasanya membuang sisanya, sedangkan model text-embedding-3 dari OpenAI menerima 8.191. Pada maksimum 2.000 karakter, satu chunk kira-kira berisi 500 token bahasa Inggris.

Membaca pratinjau

Perhatikan chunk yang dimulai di tengah gagasan, judul yang terpisah dari teks yang diperkenalkannya, serta tabel atau blok kode yang terpotong menjadi dua; semuanya akan diambil tanpa konteks yang memberi makna. Dengan strategi kalimat, paragraf, dan Markdown, satu unit yang lebih panjang dari ukuran chunk akan dipertahankan secara utuh, sehingga chunk yang terlalu besar biasanya menunjukkan paragraf atau bagian yang sangat panjang.

Dengan ketiga strategi tersebut, overlap juga mundur berdasarkan kalimat, paragraf, atau bagian secara utuh, bukan berdasarkan jumlah karakter yang persis. Banyak pipeline juga menambahkan judul dokumen atau heading bagian di awal setiap chunk sebelum embedding.

Cara menggunakannya

  1. Tempel dokumen atau kode Anda ke editor.
  2. Pilih strategi pemisahan (Paragraf, Kalimat, Header Markdown, atau Ukuran tetap) dan atur slider ukuran chunk target serta overlap.
  3. Periksa batas chunk berkode warna, metrik karakter/token, dan jendela overlap.

Privasi & batasan

Dokumen sumber Anda tetap 100% di memori browser Anda.

Alat terkait

Pertanyaan umum

Strategi chunking mana yang sebaiknya saya gunakan untuk RAG?

Batas paragraf paling cocok untuk teks umum; Header Markdown untuk dokumentasi terstruktur; batas kalimat untuk tanya jawab presisi tinggi.

Mengapa overlap antar chunk itu penting?

Overlap mencegah hilangnya makna di batas chunk, sehingga pencarian kemiripan vektor tetap menangkap konteks yang melintasi titik pemisahan.

Alat gratis · berjalan di browser anda · tanpa perlu akun