Нажмите o200k_base или cl100k_base, чтобы подсчитать текстовые токены, и одновременно проверьте кодовую точку Unicode, количество байтов UTF-8 и идентификатор токена. Подходит для сравнения длины текста без выдачи результатов за типовые счета.
Необработанный текст статистики по выбранной кодировке, а не универсальный результат для всех моделей или счет. Оболочки чата, определения инструментов, изображения и скрытые подсказки не учитываются. Таблица сегментации слов может загружаться немного медленно в первый раз.
Символы 20/20,000
Сочетание клавиш: Ctrl/⌘+Enter. Изменение входных данных или параметров удаляет старые результаты.
Границы сегментации слов в разных текстах и разных кодировках могут быть разными, и фиксированное соотношение количества слов не может использоваться для замены фактической сегментации слов.
Здесь учитывается только введенный исходный текст, а упаковка чата, определения инструментов, изображения, скрытые подсказки или выходной контент не учитываются. Фактический счет выставляется на основе данных об использовании, полученных от поставщика услуг.
Нет. Язык, пробелы, пунктуация и код влияют на сегментацию слов. Когда список идентификаторов превысит 200, будут отображаться только первые 200, но общее количество токенов все равно будет подсчитано и введено полностью.
Используйте кодировку o200k_base или cl100k_base gpt-tokenizer для токенизации обычного текста, отображая как количество кодовых точек, так и количество байтов UTF-8. Не включает дополнительное использование пакетов чата, изображений или вызовов инструментов.
Проверка содержимого:2026-09-08 · Об этом сайте и описании контента