Presione o200k_base o cl100k_base para contar los tokens de texto y verifique el punto de código Unicode, el recuento de bytes UTF-8 y el ID del token al mismo tiempo. Adecuado para comparar longitudes de texto sin hacer pasar los resultados como facturas modelo.
Estadísticas de texto sin formato mediante codificación seleccionada, no un resultado universal para todos los modelos, ni una factura. Los envoltorios de chat, las definiciones de herramientas, las imágenes y los mensajes ocultos no cuentan. La tabla de segmentación de palabras puede tardar un poco en cargarse por primera vez.
Caracteres 20 / 20,000
Tecla de acceso directo: Ctrl/⌘+Entrar. La modificación de entradas u opciones borra los resultados antiguos.
Los límites de segmentación de palabras de diferentes textos y diferentes codificaciones pueden ser diferentes, y no se puede utilizar una proporción fija de recuento de palabras para reemplazar la segmentación de palabras real.
Aquí solo se cuenta el texto original ingresado y no se incluyen el paquete de chat, las definiciones de herramientas, las imágenes, las indicaciones ocultas ni el contenido de salida. La facturación real se basa en el uso devuelto por el proveedor de servicios.
No. El idioma, el espaciado, la puntuación y el código afectan la segmentación de palabras. Cuando la lista de ID supere los 200, solo se mostrarán los primeros 200, pero el número total de tokens se seguirá contando e ingresando en su totalidad.
Utilice la codificación o200k_base o cl100k_base de gpt-tokenizer para tokenizar texto sin formato, mostrando tanto el número de puntos de código como el número de bytes UTF-8. No incluye uso adicional para paquetes de chat, imágenes o llamadas de herramientas.
Verificación de contenido:2026-09-08 · Acerca de este sitio y descripción del contenido