주요 콘텐츠로 건너뛰기

o200k_base 또는 cl100k_base를 눌러 텍스트 토큰을 계산하고 유니코드 코드 포인트, UTF-8 바이트 수 및 토큰 ID를 동시에 확인하세요. 결과를 모델 청구서로 전달하지 않고 텍스트 길이를 비교하는 데 적합합니다.

모든 모델에 대한 보편적인 결과나 청구서가 아닌 선택된 인코딩에 의한 통계 원시 텍스트입니다. 채팅 래퍼, 도구 정의, 이미지 및 숨겨진 프롬프트는 포함되지 않습니다. 단어 분할 테이블은 처음 로드하는 데 약간 느릴 수 있습니다.

20 / 20,000 문자

단축키: Ctrl/⌘+Enter. 입력 또는 옵션을 수정하면 이전 결과가 지워집니다.

사용 지침

  1. 대상 모델 데이터에 따라 해당 단어 분할 인코딩을 선택합니다.
  2. 텍스트를 붙여넣거나 중국어와 영어가 혼합된 코드 예제를 로드하고 통계 토큰을 클릭합니다.
  3. 계산 카드와 토큰 ID를 확인하세요. 인코딩 전환 후 다시 계산하세요.

입력 및 출력 예

입력 예
hello(cl100k_base)
예제 출력
토큰 수: 1 유니코드 코드 포인트: 5 UTF-8 바이트: 5

서로 다른 텍스트와 서로 다른 인코딩의 단어 분할 경계는 다를 수 있으며 고정된 단어 수 비율을 사용하여 실제 단어 분할을 대체할 수 없습니다.

FAQ

여기에는 입력한 원본 텍스트만 계산되며 채팅 패키징, 도구 정의, 그림, 숨겨진 프롬프트 또는 출력 콘텐츠는 포함되지 않습니다. 실제 청구는 서비스 제공자가 반환한 사용량을 기준으로 합니다.

아니요. 언어, 간격, 구두점 및 코드는 모두 단어 분할에 영향을 미칩니다. ID 목록이 200개를 초과하면 처음 200개만 표시되지만 총 토큰 수는 계속 계산되어 완전히 입력됩니다.

계산근거 및 참고자료

gpt-tokenizer의 o200k_base 또는 cl100k_base 인코딩을 사용하여 일반 텍스트를 토큰화하고 코드 포인트 수와 UTF-8 바이트 수를 모두 표시합니다. 채팅 패키지, 이미지 또는 도구 호출에 대한 추가 사용량은 포함되지 않습니다.

내용 확인: · 이 사이트 및 콘텐츠 설명 정보

관련 도구