Alat developer / 31
Visualizer Chunking & Overlap Teks RAG
Visualisasikan strategi pemisahan teks, ukuran chunk token/karakter, dan overlap untuk pengindeksan vektor RAG langsung di browser Anda.
Visualizer Chunking & Overlap Teks RAG: TOEA membagi dokumen menjadi chunk teks secara lokal sesuai strategi pilihan Anda. Alat ini menghitung rentang karakter, perkiraan token (~4 chars/token), dan teks overlap eksplisit antar chunk berurutan. Berjalan 100% lokal di browser Anda tanpa upload file ke server.
- Kategori
- Tools developer
- Dijalankan
- Di browser Anda
- Biaya
- Gratis · tanpa daftar
- Ketersediaan
- Siap digunakan
Potongan Dokumen & Tumpang Tindih yang Dihasilkan
# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.
Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies
## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing
Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing
## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.
Karakter, token, dan batas model
Ukuran chunk di sini dihitung dalam karakter, sedangkan jumlah token menggunakan asumsi sekitar empat karakter per token, yang berlaku untuk prosa berbahasa Inggris. Kode, angka, dan banyak bahasa lain menggunakan lebih banyak token per karakter, jadi sisakan ruang cadangan. Periksa hasilnya terhadap batas input model embedding Anda: banyak model bergaya BERT berhenti di 512 token dan biasanya membuang sisanya, sedangkan model text-embedding-3 dari OpenAI menerima 8.191. Pada maksimum 2.000 karakter, satu chunk kira-kira berisi 500 token bahasa Inggris.
Membaca pratinjau
Perhatikan chunk yang dimulai di tengah gagasan, judul yang terpisah dari teks yang diperkenalkannya, serta tabel atau blok kode yang terpotong menjadi dua; semuanya akan diambil tanpa konteks yang memberi makna. Dengan strategi kalimat, paragraf, dan Markdown, satu unit yang lebih panjang dari ukuran chunk akan dipertahankan secara utuh, sehingga chunk yang terlalu besar biasanya menunjukkan paragraf atau bagian yang sangat panjang.
Dengan ketiga strategi tersebut, overlap juga mundur berdasarkan kalimat, paragraf, atau bagian secara utuh, bukan berdasarkan jumlah karakter yang persis. Banyak pipeline juga menambahkan judul dokumen atau heading bagian di awal setiap chunk sebelum embedding.
Cara menggunakannya
- Tempel dokumen atau kode Anda ke editor.
- Pilih strategi pemisahan (Paragraf, Kalimat, Header Markdown, atau Ukuran tetap) dan atur slider ukuran chunk target serta overlap.
- Periksa batas chunk berkode warna, metrik karakter/token, dan jendela overlap.
Privasi & batasan
Dokumen sumber Anda tetap 100% di memori browser Anda.
Alat terkait
Pertanyaan umum
Strategi chunking mana yang sebaiknya saya gunakan untuk RAG?
Batas paragraf paling cocok untuk teks umum; Header Markdown untuk dokumentasi terstruktur; batas kalimat untuk tanya jawab presisi tinggi.
Mengapa overlap antar chunk itu penting?
Overlap mencegah hilangnya makna di batas chunk, sehingga pencarian kemiripan vektor tetap menangkap konteks yang melintasi titik pemisahan.
Alat gratis · berjalan di browser anda · tanpa perlu akun