Geliştirici aracı / 31

RAG Metin Parçalama ve Örtüşme Görselleştiricisi

RAG vektör dizinlemesi için metin bölme stratejilerini, token/karakter parça boyutlarını ve örtüşmeleri tarayıcınızda görselleştirin.

RAG Metin Parçalama ve Örtüşme Görselleştiricisi: TOEA, seçtiğiniz stratejiyi kullanarak belgeleri yerel olarak metin parçalarına böler. Karakter aralıklarını, token tahminlerini (~4 karakter/token) ve art arda gelen parçalar arasındaki açık örtüşme metnini hesaplar. Sunucuya hiçbir dosya yüklenmeden tarayıcınızda %100 yerel olarak çalışır.

Çalıştırma sayısı
Tarayıcınızda
Maliyet
Ücretsiz · kayıt gerekmez
Kullanılabilirlik
Kullanıma hazır
Hedef Parça Boyutu300 karakter
Örtüşme Penceresi40 karakter
Toplam Parça5
Ortalama Parça Uzunluğu264 karakter
Ortalama Token / Parça~66 token
Belge Uzunluğu782 karakter

Oluşturulan Belge Parçaları ve Örtüşmeleri

Parça #1Aralık: [0 - 300]• 300 karakter (~75 token)

# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.

Parça #2Aralık: [56 - 324]• 268 karakter (~67 token)
Önceki Parçayla Örtüşme:"Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. "

Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies

Parça #3Aralık: [298 - 568]• 270 karakter (~68 token)
Önceki Parçayla Örtüşme:" ## Chunking Strategies "

## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Parça #4Aralık: [324 - 568]• 244 karakter (~61 token)
Önceki Parçayla Örtüşme:"Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing "

Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing

Parça #5Aralık: [546 - 782]• 236 karakter (~59 token)
Önceki Parçayla Örtüşme:" ## Vector Indexing "

## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.

Karakterler, belirteçler ve model sınırları

Buradaki parça boyutu karakter cinsindendir ve belirteç sayısı, İngilizce düzyazı için geçerli olan yaklaşık dört karakterin bir belirtece denk geldiğini varsayar. Kod, sayılar ve diğer birçok dil karakter başına daha fazla belirteç kullanır; bu nedenle pay bırakın. Sonucu gömme modelinizin giriş sınırına göre kontrol edin: BERT tarzı birçok model 512 belirteçte durur ve genellikle geri kalanını atar; OpenAI'nin text-embedding-3 modelleri ise 8.191 kabul eder. 2.000 karakterlik en yüksek değerde bir parça yaklaşık 500 İngilizce belirteç içerir.

Önizlemeyi okuma

Düşüncenin ortasında başlayan parçaları, tanıttıkları metinden ayrılmış başlıkları ve ikiye bölünmüş tabloları veya kod bloklarını arayın; bunların her biri, anlamını veren bağlam olmadan alınır. Cümle, paragraf ve Markdown stratejilerinde, parça boyutundan uzun tek birim bütün olarak korunur. Bu nedenle aşırı büyük bir parça genellikle çok uzun bir paragrafa veya bölüme işaret eder.

Bu üç stratejide örtüşme, tam bir karakter sayısı yerine bütün cümleler, paragraflar veya bölümler üzerinden geriye gider. Birçok işlem hattı, gömme işleminden önce belge başlığını veya bölüm başlığını her parçanın başına da ekler.

Nasıl kullanılır?

  1. Belgenizi veya kodunuzu düzenleyiciye yapıştırın.
  2. Bir bölme stratejisi seçin (Paragraf, Cümle, Markdown Başlıkları veya Sabit boyut), ardından hedef parça boyutunu ve örtüşme kaydırıcılarını ayarlayın.
  3. Renklerle belirtilen parça sınırlarını, karakter/token ölçümlerini ve örtüşme pencerelerini inceleyin.

Gizlilik ve sınırlamalar

Kaynak belgeniz %100 tarayıcı belleğinizin içinde kalır.

İlgili araçlar

Sık sorulan sorular

RAG için hangi parçalama stratejisini kullanmalıyım?

Genel metinler için paragraf sınırları; yapılandırılmış belgeler için Markdown Başlıkları; yüksek hassasiyetli soru-cevap işlemleri için cümle sınırları en iyi sonucu verir.

Parça örtüşmesi neden önemlidir?

Örtüşme, parça sınırlarında anlam kaybını önleyerek vektör benzerliği aramalarının bölme noktalarını aşan bağlamı yakalamasını sağlar.

Ücretsiz araç · tarayıcınızda kez çalıştırma · hesap gerekmez