Passer au contenu principal

Appuyez sur o200k_base ou cl100k_base pour compter les jetons de texte et vérifiez le point de code Unicode, le nombre d'octets UTF-8 et l'ID du jeton en même temps. Convient pour comparer les longueurs de texte sans faire passer les résultats pour des factures modèles.

Statistiques de texte brut par encodage sélectionné, pas un résultat universel pour tous les modèles, ni une facture. Les wrappers de discussion, les définitions d’outils, les images et les invites masquées ne comptent pas. Le tableau de segmentation des mots peut être un peu lent à charger la première fois.

Caractères 20 / 20,000

Touche de raccourci : Ctrl/⌘+Entrée. La modification des entrées ou des options efface les anciens résultats.

Mode d'emploi

  1. Sélectionnez le codage de segmentation de mots correspondant en fonction des données du modèle cible.
  2. Collez le texte ou chargez les exemples de codes mixtes chinois et anglais, puis cliquez sur Jeton de statistiques.
  3. Vérifiez la carte de comptage et l'ID du jeton ; recalculer après avoir changé de codage.

Exemples d'entrée et de sortie

Exemple de saisie
hello(cl100k_base)
Exemple de sortie
Nombre de jetons : 1 Point de code Unicode : 5 Octets UTF-8 : 5

Les limites de segmentation des mots de différents textes et différents encodages peuvent être différentes, et un taux de nombre de mots fixe ne peut pas être utilisé pour remplacer la segmentation réelle des mots.

FAQ

Seul le texte original saisi est pris en compte ici, et les emballages de discussion, les définitions d'outils, les images, les invites masquées ou le contenu de sortie ne sont pas inclus. La facturation réelle est basée sur l'utilisation renvoyée par le fournisseur de services.

Non. La langue, l’espacement, la ponctuation et le code affectent tous la segmentation des mots. Lorsque la liste d'ID dépasse 200, seuls les 200 premiers seront affichés, mais le nombre total de jetons sera toujours compté et saisi complètement.

Base de calcul et documents de référence

Utilisez l'encodage o200k_base ou cl100k_base de gpt-tokenizer pour tokeniser le texte brut, affichant à la fois le nombre de points de code et le nombre d'octets UTF-8. N'inclut pas l'utilisation supplémentaire pour les packages de chat, les images ou les appels d'outils.

Vérification du contenu : · À propos de ce site et description du contenu

Outils associés