Pular para o conteúdo principal

Pressione o200k_base ou cl100k_base para contar tokens de texto e verifique o ponto de código Unicode, a contagem de bytes UTF-8 e o ID do token ao mesmo tempo. Adequado para comparar comprimentos de texto sem passar os resultados como modelos de faturas.

Texto bruto de estatísticas por codificação selecionada, não um resultado universal para todos os modelos, nem uma conta. Wrappers de bate-papo, definições de ferramentas, imagens e prompts ocultos não contam. A tabela de segmentação de palavras pode demorar um pouco para carregar pela primeira vez.

Caracteres 20 / 20,000

Tecla de atalho: Ctrl/⌘+Enter. Modificar entradas ou opções limpa resultados antigos.

Instruções de uso

  1. Selecione a codificação de segmentação de palavras correspondente de acordo com os dados do modelo de destino.
  2. Cole o texto ou carregue os exemplos de código mistos em chinês e inglês e clique em Token de Estatística.
  3. Verifique o cartão de contagem e o Token ID; recalcular depois de mudar a codificação.

Exemplos de entrada e saída

Entrada de exemplo
hello(cl100k_base)
Exemplo de saída
Número de fichas: 1 Ponto de código Unicode: 5 Bytes UTF-8: 5

Os limites de segmentação de palavras de diferentes textos e diferentes codificações podem ser diferentes, e uma proporção fixa de contagem de palavras não pode ser usada para substituir a segmentação de palavras real.

Perguntas frequentes

Somente o texto original inserido é contado aqui, e embalagens de bate-papo, definições de ferramentas, imagens, prompts ocultos ou conteúdo de saída não são incluídos. O faturamento real é baseado no uso retornado pelo provedor de serviços.

Não. Idioma, espaçamento, pontuação e código afetam a segmentação de palavras. Quando a lista de IDs exceder 200, apenas os primeiros 200 serão exibidos, mas o número total de Tokens ainda será contado e inserido completamente.

Base de cálculo e materiais de referência

Use a codificação o200k_base ou cl100k_base do gpt-tokenizer para tokenizar texto simples, exibindo o número de pontos de código e o número de bytes UTF-8. Não inclui uso adicional para pacotes de chat, imagens ou chamadas de ferramentas.

Verificação de conteúdo: · Sobre este site e descrição do conteúdo

Ferramentas relacionadas