انتقل إلى المحتوى الرئيسي

اضغط على o200k_base أو cl100k_base لحساب الرموز النصية، وتحقق من نقطة رمز Unicode وعدد بايت UTF-8 ومعرف الرمز المميز في نفس الوقت. مناسب لمقارنة أطوال النص دون تمرير النتائج كنماذج فواتير.

إحصاءات النص الخام عن طريق الترميز المحدد، وليس نتيجة عالمية لجميع النماذج، ولا فاتورة. لا يتم احتساب أغلفة الدردشة وتعريفات الأدوات والصور والمطالبات المخفية. قد يكون جدول تجزئة الكلمات بطيئًا بعض الشيء في التحميل لأول مرة.

أحرف 20 / 20,000

مفتاح الاختصار: Ctrl/⌘+أدخل. يؤدي تعديل المدخلات أو الخيارات إلى مسح النتائج القديمة.

تعليمات الاستخدام

  1. حدد ترميز تجزئة الكلمات المقابل وفقًا لبيانات النموذج المستهدف.
  2. الصق النص أو قم بتحميل أمثلة التعليمات البرمجية الصينية والإنجليزية المختلطة، وانقر فوق رمز الإحصائيات.
  3. التحقق من بطاقة العد ومعرف الرمز المميز؛ إعادة الحساب بعد تبديل الترميز.

أمثلة المدخلات والمخرجات

إدخال المثال
hello(cl100k_base)
مثال الإخراج
عدد الرموز: 1 نقطة رمز يونيكود: 5 UTF-8 بايت: 5

قد تختلف حدود تجزئة الكلمات للنصوص المختلفة والتشفيرات المختلفة، ولا يمكن استخدام نسبة عدد الكلمات الثابتة لاستبدال تجزئة الكلمات الفعلية.

الأسئلة الشائعة

يتم احتساب النص الأصلي الذي تم إدخاله فقط هنا، ولا يتم تضمين حزمة الدردشة أو تعريفات الأدوات أو الصور أو المطالبات المخفية أو محتوى الإخراج. تعتمد الفواتير الفعلية على الاستخدام الذي يتم إرجاعه من قبل مزود الخدمة.

لا، فاللغة والمسافات وعلامات الترقيم والرموز كلها تؤثر على تجزئة الكلمات. عندما تتجاوز قائمة المعرفات 200، سيتم عرض أول 200 فقط، ولكن سيتم احتساب إجمالي عدد الرموز وإدخالها بالكامل.

أساس الحساب والمواد المرجعية

استخدم تشفير gpt-tokenizer o200k_base أو cl100k_base لترميز النص العادي، مع عرض كل من عدد نقاط الرمز وعدد بايتات UTF-8. لا يتضمن استخدامًا إضافيًا لحزم الدردشة أو الصور أو مكالمات الأدوات.

فحص المحتوى: · حول هذا الموقع ووصف المحتوى

الأدوات ذات الصلة