メインコンテンツにスキップ

o200k_base または cl100k_base を押してテキスト トークンをカウントし、同時に Unicode コード ポイント、UTF-8 バイト数、およびトークン ID を確認します。結果をモデル請求として偽ることなく、テキストの長さを比較するのに適しています。

選択したエンコードによる統計の生のテキスト。すべてのモデルに共通の結果や請求書ではありません。チャット ラッパー、ツール定義、画像、および非表示のプロンプトはカウントされません。単語分割テーブルを初めてロードする場合は、少し時間がかかる場合があります。

20 / 20,000 文字

ショートカット キー: Ctrl/⌘+Enter。入力またはオプションを変更すると、古い結果が消去されます。

使用説明書

  1. 対象モデルデータに応じて、対応する単語分割エンコーディングを選択します。
  2. テキストを貼り付けるか、中国語と英語が混合したコード例をロードし、「統計トークン」をクリックします。
  3. カウンティング カードとトークン ID を確認します。エンコーディングを切り替えた後に再計算します。

入力と出力の例

入力例
hello(cl100k_base)
出力例
トークンの数: 1 Unicode コードポイント: 5 UTF-8バイト: 5

異なるテキストおよび異なるエンコーディングの単語分割境界は異なる場合があり、固定単語数比率を使用して実際の単語分割を置き換えることはできません。

よくある質問

ここでは入力された元のテキストのみがカウントされ、チャット パッケージ、ツール定義、画像、非表示のプロンプト、または出力コンテンツは含まれません。実際の請求は、サービス プロバイダーから返された使用量に基づいて行われます。

いいえ。言語、スペース、句読点、コードはすべて単語の分割に影響します。 IDリストが200を超えた場合、最初の200のみが表示されますが、トークンの総数はカウントされ、完全に入力されます。

算出根拠と参考資料

gpt-tokenizer の o200k_base または cl100k_base エンコードを使用してプレーン テキストをトークン化し、コード ポイントの数と UTF-8 バイトの数の両方を表示します。チャット パッケージ、画像、ツール呼び出しの追加使用は含まれません。

内容チェック: · このサイトとコンテンツの説明について

関連ツール