跳到主要內容

按 o200k_base 或 cl100k_base 統計文字 token,同時查看 Unicode 碼點、UTF-8 位元組數與 Token ID。適合對比文字長度,不將結果冒充模型帳單。

按所選編碼統計原始文本,不是所有模型的通用結果,也不是帳單。聊天包裝、工具定義、圖像和隱藏提示不計入。分詞表首次載入可能稍慢。

20 / 20,000 字符

快速鍵:Ctrl / ⌘ + Enter。修改輸入或選項會清除舊結果。

使用說明

  1. 根據目標模型資料選擇對應分詞編碼。
  2. 貼上文字或載入中英混排、程式碼範例,點選統計 Token。
  3. 查看計數卡片與 Token ID;切換編碼後重新計算。

輸入與輸出範例

範例輸入
hello(cl100k_base)
範例輸出
Token 數:1 Unicode 碼點:5 UTF-8 位元組:5

不同文本與不同編碼的分詞邊界可能不同,不能用固定字數比例來取代實際分詞。

常見問題

這裡只統計輸入的原始文本,不包含聊天包裝、工具定義、圖片、隱藏提示或輸出內容。實際計費以服務方回傳的用量為準。

不能。語言、空格、標點和代碼都會影響分詞。 ID 清單超過 200 個時只展示前 200 個,但 Token 總數仍統計完整輸入。

計算依據與參考資料

使用 gpt-tokenizer 的 o200k_base 或 cl100k_base 編碼對純文字分詞,同時展示碼點數與 UTF-8 位元組數。不包含聊天封裝、圖片或工具呼叫的額外用量。

內容核對: · 關於本站與內容說明

相關工具