개발자 도구 / 31
RAG 텍스트 청킹 및 오버랩 시각화 도구
브라우저에서 RAG 벡터 인덱싱을 위한 텍스트 분할 전략, 토큰 및 문자 청크 크기와 오버랩을 시각화합니다.
RAG 텍스트 청킹 및 오버랩 시각화 도구: TOEA는 선택한 전략에 따라 문서를 로컬에서 텍스트 청크로 분할합니다. 문자 범위와 토큰 추정치(~4 chars/token)를 계산하고, 연속된 청크 사이에 겹치는 텍스트를 명시적으로 표시합니다. 서버에 파일을 전혀 업로드하지 않고 브라우저에서 100% 로컬로 실행됩니다.
- 카테고리
- 개발자 도구
- 실행 횟수
- 브라우저에서
- 비용
- 무료 · 가입 불필요
- 사용 가능 여부
- 사용 가능
생성된 문서 청크 및 중복 구간
# Introduction to Retrieval-Augmented Generation (RAG) Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time.
Retrieval-Augmented Generation enhances Large Language Models by grounding outputs on external knowledge bases. Instead of relying solely on parametric memory learned during training, RAG models fetch relevant text passages at inference time. ## Chunking Strategies
## Chunking Strategies Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing
Proper text chunking is critical for RAG accuracy. Fixed-size chunking splits documents into uniform character intervals. Sentence-based chunking preserves grammatical units. Markdown chunking splits along section headers. ## Vector Indexing
## Vector Indexing Once chunks are generated, embedding models convert text chunks into dense vector representations. These vectors are indexed in vector databases like Pinecone, Qdrant, or PGVector for fast cosine similarity search.
문자, 토큰, 모델 한도
여기서 청크 크기는 문자 수이며, 토큰 수는 영어 산문에서 성립하는 문자 4개당 토큰 1개 정도를 가정합니다. 코드, 숫자, 여러 다른 언어에서는 문자당 토큰이 더 많이 필요하므로 여유를 두십시오. 결과를 임베딩 모델의 입력 한도와 비교하십시오. 많은 BERT 계열 모델은 512 토큰에서 중단하고 나머지를 버리는 반면, OpenAI의 text-embedding-3 모델은 8,191개를 허용합니다. 최대 2,000자에서는 청크 하나가 영어 토큰 약 500개에 해당합니다.
미리보기 읽기
생각의 중간에서 시작하는 청크, 소개하는 텍스트와 분리된 제목, 중간에서 잘린 표나 코드 블록을 확인하십시오. 이런 청크는 의미를 부여하는 맥락 없이 검색됩니다. 문장, 단락, Markdown 전략에서는 청크 크기보다 긴 단일 단위를 그대로 유지하므로, 지나치게 큰 청크는 대개 매우 긴 단락이나 섹션을 의미합니다.
이 세 가지 전략에서는 겹치는 부분도 정확한 문자 수가 아니라 전체 문장, 단락 또는 섹션 단위로 뒤로 이동합니다. 많은 파이프라인은 임베딩하기 전에 각 청크 앞에 문서 제목이나 섹션 제목을 추가하기도 합니다.
사용 방법
- 문서 또는 코드를 편집기에 붙여넣습니다.
- 분할 전략(문단, 문장, Markdown 헤더 또는 고정 크기)을 선택하고 목표 청크 크기와 오버랩 슬라이더를 조정합니다.
- 색상으로 구분된 청크 경계, 문자 및 토큰 측정값과 오버랩 구간을 확인합니다.
개인정보 보호 및 제한사항
원본 문서는 브라우저 메모리 안에 100% 유지됩니다.
관련 도구
자주 묻는 질문
RAG에는 어떤 청킹 전략을 사용해야 하나요?
일반 텍스트에는 문단 경계가 가장 적합하고, 구조화된 문서에는 Markdown 헤더가 적합합니다. 정밀한 질의응답에는 문장 경계를 사용하십시오.
청크 오버랩이 중요한 이유는 무엇인가요?
오버랩은 청크 경계에서 의미가 손실되는 것을 방지합니다. 따라서 벡터 유사도 검색에서 분할 지점에 걸쳐 있는 문맥을 포착할 수 있습니다.
무료 도구 · 브라우저에서회 실행 · 계정 불필요