Zum Hauptinhalt springen

Drücken Sie o200k_base oder cl100k_base, um Text-Tokens zu zählen, und überprüfen Sie gleichzeitig den Unicode-Codepunkt, die UTF-8-Byte-Anzahl und die Token-ID. Geeignet zum Vergleich von Textlängen, ohne die Ergebnisse als Musterrechnungen auszugeben.

Statistik des Rohtextes nach ausgewählter Kodierung, kein universelles Ergebnis für alle Modelle, noch eine Rechnung. Chat-Wrapper, Tooldefinitionen, Bilder und versteckte Eingabeaufforderungen zählen nicht. Das Laden der Wortsegmentierungstabelle kann beim ersten Mal etwas langsam sein.

20 / 20,000 Zeichen

Tastenkombination: Strg/⌘+Eingabetaste. Durch das Ändern von Eingaben oder Optionen werden alte Ergebnisse gelöscht.

Gebrauchsanweisung

  1. Wählen Sie die entsprechende Wortsegmentierungskodierung entsprechend den Zielmodelldaten aus.
  2. Fügen Sie den Text ein oder laden Sie die gemischten chinesischen und englischen Codebeispiele und klicken Sie auf Statistik-Token.
  3. Überprüfen Sie die Zählkarte und die Token-ID. Nach Umstellung der Kodierung neu berechnen.

Eingabe- und Ausgabebeispiele

Beispieleingabe
hello(cl100k_base)
Beispielausgabe
Anzahl der Token: 1 Unicode-Codepunkt: 5 UTF-8-Byte: 5

Die Wortsegmentierungsgrenzen verschiedener Texte und verschiedener Kodierungen können unterschiedlich sein, und ein festes Wortanzahlverhältnis kann nicht verwendet werden, um die tatsächliche Wortsegmentierung zu ersetzen.

FAQ

Hier wird nur der eingegebene Originaltext gezählt, Chat-Pakete, Tool-Definitionen, Bilder, versteckte Eingabeaufforderungen oder Ausgabeinhalte werden nicht berücksichtigt. Die tatsächliche Abrechnung basiert auf der vom Dienstanbieter zurückgegebenen Nutzung.

Nein. Sprache, Abstände, Zeichensetzung und Code wirken sich alle auf die Wortsegmentierung aus. Wenn die ID-Liste 200 überschreitet, werden nur die ersten 200 angezeigt, aber die Gesamtzahl der Token wird trotzdem gezählt und vollständig eingegeben.

Berechnungsgrundlagen und Referenzmaterialien

Verwenden Sie die o200k_base- oder cl100k_base-Codierung von gpt-tokenizer, um Klartext zu tokenisieren und sowohl die Anzahl der Codepunkte als auch die Anzahl der UTF-8-Bytes anzuzeigen. Beinhaltet keine zusätzliche Nutzung für Chat-Pakete, Bilder oder Tool-Aufrufe.

Inhaltsprüfung: · Über diese Website und Inhaltsbeschreibung

Verwandte Tools