개발자 / 토큰

토큰 개수 세기: OpenAI 모델용 토큰 계산

GPT-4o 및 최신 모델에서 사용하는 o200k_base 토크나이저와 GPT-4 및 GPT-3.5 Turbo에서 사용하는 cl100k_base 토크나이저로 텍스트의 토큰 수를 OpenAI 모델과 동일하게 정확히 셉니다. 문자 수, 단어 수, 토큰당 문자 수도 확인하고 각 토큰을 강조 표시합니다. 텍스트는 어디에도 전송하지 않습니다.

토큰 개수 세기: OpenAI 모델용 토큰 계산: 텍스트는 js-tiktoken과 OpenAI가 공개한 바이트 페어 어휘를 사용해 브라우저에서 인코딩됩니다. 모델이 사용하는 것과 동일한 어휘이므로 결과가 정확히 일치합니다. 예를 들어 "tiktoken is great!"은 cl100k_base에서 6개 토큰입니다. 각 토큰은 색상이 적용된 조각으로 표시되므로, 일반적인 단어는 하나의 토큰인 반면 드문 단어, 숫자 및 다른 문자 체계는 여러 토큰으로 분할되는 모습을 확인할 수 있습니다. 서버에 파일을 전혀 업로드하지 않고 브라우저에서 100% 로컬로 실행됩니다.

카테고리
개발자 도구
실행 횟수
브라우저에서
비용
무료 · 가입 불필요
사용 가능 여부
사용 가능
토큰 카운터로컬 처리

브라우저에서 전부 실행됩니다

토큰…
문자0
단어0
토큰당 문자 수—

이 인코딩을 사용하는 OpenAI 모델의 수치는 정확합니다. 브라우저에서 js-tiktoken (MIT)과 OpenAI가 공개한 어휘를 사용해 계산하며, 텍스트는 어디에도 전송되지 않습니다. 다른 회사의 모델은 자체 토크나이저를 사용하므로 이 수치는 추정치로 보십시오. 영어에서는 토큰 하나가 문자 약 4개인 경우가 많습니다.

토큰과 비용

모델 가격은 입력 및 출력 토큰 1백만 개를 기준으로 책정되므로, 토큰 수를 세면 요청 비용을 추정할 수 있습니다. 제공업체의 최신 가격표를 확인하십시오.

대략적인 기준

영어에서는 100토큰이 약 75단어 또는 토큰당 4문자에 해당합니다. 다른 언어와 코드는 일반적으로 단어당 더 많은 토큰이 필요합니다.

사용 방법

  1. 프롬프트 또는 텍스트를 붙여넣습니다.
  2. 모델에 사용할 토크나이저를 선택합니다.
  3. 토큰 수를 확인하고 텍스트가 어떻게 분할되었는지 살펴봅니다.

개인정보 보호 및 제한사항

텍스트 토큰화는 브라우저에서 수행되며 텍스트는 업로드하지 않습니다.

관련 도구

자주 묻는 질문

Claude, Gemini 또는 Llama의 토큰도 계산하나요?

정확하지는 않습니다. 각 회사가 자체 토크나이저를 사용하므로 다른 모델의 토큰 수는 상당히 다를 수 있습니다. 이 도구의 결과는 해당 모델의 대략적인 추정치로 사용하십시오.

중국어 또는 일본어는 왜 토큰을 더 많이 사용하나요?

어휘는 학습 데이터에서 가장 자주 사용되는 조각을 학습합니다. o200k_base에는 cl100k_base보다 영어 이외의 조각이 더 많으므로, 동일한 일본어 텍스트는 일반적으로 o200k_base에서 더 적은 토큰을 사용합니다.

공백과 줄 바꿈도 토큰으로 계산되나요?

예. 공백은 일반적으로 뒤에 오는 단어와 결합되며, 줄 바꿈도 토큰으로 계산됩니다.

무료 도구 · 브라우저에서회 실행 · 계정 불필요