English
A token is the basic unit of text a language model reads or generates, roughly a word piece or a few characters. Text is split into tokens before processing, and model limits and costs are measured in token counts.
A token is the unit a model actually reads and bills for, usually a word fragment rather than a whole word. Text is cut into tokens before the model sees it, so "unbelievable" may arrive as three pieces while a common word arrives as one. This matters commercially, because pricing is per token, and it matters unevenly across languages: Arabic and other morphologically rich languages are typically cut into more tokens than English for the same meaning, so the same sentence costs more.
The request consumed 4,000 input tokens and 900 output tokens.
العربية
التوكن هو الوحدة الأساسية من النص التي يقرأها النموذج اللغوي أو يولّدها، وهي غالباً جزء من كلمة أو عدة أحرف. يُقسَّم النص إلى توكنات قبل المعالجة، وتُقاس حدود النموذج وتكلفته بعدد التوكنات.
التوكن هو الوحدة التي يقرأها النموذج فعلاً ويُحاسَب عليها، وهو غالباً جزءٌ من كلمة لا كلمةً كاملة. فالنص يُقطَّع إلى توكنات قبل أن يراه النموذج، حتى إن كلمةً طويلة قد تصل إليه في ثلاث قطع بينما تصل الكلمة الشائعة في قطعة واحدة. ولهذا أثرٌ تجاري لأن التسعير يكون بالتوكن، وأثرٌ غير متكافئ بين اللغات: إذ تُقطَّع العربية وسائر اللغات الغنية صرفياً إلى توكنات أكثر من الإنجليزية للمعنى نفسه، فتكون الجملة ذاتها أعلى كلفة.
استهلك الطلب 4000 توكن دخل و900 توكن خرج.
يُعرف أيضاً بـ
- tokens
- tokenization unit
- رمز
- الرمز المميز
- توكنات
- التوكينز
يُكتب أيضاً هكذا، ولا نوصي به
- الرمز
- الوحدة اللغوية
لمَ هذه الصيغة: «الرمز» مثقلةٌ أصلاً في الحوسبة العربية (رمز، شيفرة، ترميز). أما «توكن» المقترضة فلا لبس فيها، وهي ما يستعمله الممارسون فعلاً.
