Passa al contenuto principale

Premere o200k_base o cl100k_base per contare i token di testo e controllare contemporaneamente il punto di codice Unicode, il conteggio dei byte UTF-8 e l'ID token. Adatto per confrontare le lunghezze dei testi senza spacciare i risultati come fatture modello.

Testo grezzo delle statistiche per codifica selezionata, non un risultato universale per tutti i modelli, né una fattura. I wrapper di chat, le definizioni degli strumenti, le immagini e i suggerimenti nascosti non vengono conteggiati. La tabella di segmentazione delle parole potrebbe essere un po' lenta da caricare per la prima volta.

Caratteri 20 / 20,000

Tasto di scelta rapida: Ctrl/⌘+Invio. La modifica degli input o delle opzioni cancella i vecchi risultati.

Istruzioni per l'uso

  1. Selezionare la codifica di segmentazione delle parole corrispondente in base ai dati del modello di destinazione.
  2. Incolla il testo o carica gli esempi di codice misto cinese e inglese e fai clic su Token statistiche.
  3. Controlla la carta di conteggio e il Token ID; ricalcolare dopo aver cambiato la codifica.

Esempi di input e output

Ingresso di esempio
hello(cl100k_base)
Uscita di esempio
Numero di gettoni: 1 Punto di codice Unicode: 5 Byte UTF-8: 5

I confini della segmentazione delle parole di testi diversi e codifiche diverse possono essere diversi e non è possibile utilizzare un rapporto fisso di conteggio delle parole per sostituire la segmentazione effettiva delle parole.

Domande frequenti

Qui viene conteggiato solo il testo originale inserito e non sono inclusi il pacchetto della chat, le definizioni degli strumenti, le immagini, i suggerimenti nascosti o il contenuto dell'output. La fatturazione effettiva si basa sull'utilizzo restituito dal fornitore di servizi.

No. Lingua, spaziatura, punteggiatura e codice influiscono tutti sulla segmentazione delle parole. Quando l'elenco ID supera i 200, verranno visualizzati solo i primi 200, ma il numero totale di Token verrà comunque conteggiato e inserito completamente.

Basi di calcolo e materiali di riferimento

Utilizza la codifica o200k_base o cl100k_base di gpt-tokenizer per tokenizzare il testo semplice, visualizzando sia il numero di punti di codice che il numero di byte UTF-8. Non include l'utilizzo aggiuntivo di pacchetti di chat, immagini o chiamate a strumenti.

Controllo del contenuto: · Informazioni su questo sito e descrizione dei contenuti

Strumenti correlati