All terms

Inference Cost

Business & Investment

تكلفة الاستدلال

Pronounced taklifat al-istidlālInformed

English

Inference cost is the money spent every time a deployed model is actually run to answer a request, usually priced per token processed and generated. Unlike the one-time cost of training, inference cost recurs with every user query and scales directly with usage.

Inference cost is what it takes to run a model per request, usually billed per token and split between input and output. Unlike training, it recurs forever and scales with usage, so it is the number that decides whether an AI feature is a business. Output tokens typically cost several times input tokens, which makes response length a direct cost lever.

Caching the system prompt cut inference cost by 40%.

العربية

تكلفة الاستدلال هي المبلغ المُنفَق في كل مرة يُشغَّل فيها نموذج منشور فعلياً للرد على طلب، وتُحتسب عادة بحسب عدد التوكنات المُعالَجة والمُولَّدة. وعلى عكس تكلفة التدريب التي تُدفع مرة واحدة، تتكرر تكلفة الاستدلال مع كل استعلام مستخدم وتتناسب مباشرة مع الاستخدام.

تكلفة الاستدلال هي ما يلزم لتشغيل النموذج في كل طلب، وتُحاسب عادةً بالتوكن وتُقسم بين دخلٍ وخرج. وهي، خلافاً للتدريب، متكررةٌ إلى الأبد وتتوسع مع الاستعمال، فهي الرقم الذي يقرر أكانت ميزة الذكاء الاصطناعي عملاً تجارياً أم لا. وتكلّف توكنات الخرج عادةً أضعاف توكنات الدخل، وهو ما يجعل طول الإجابة رافعة كلفةٍ مباشرة.

خفّض التخزين المؤقت لتوجيه النظام تكلفةَ الاستدلال بنسبة 40%.

Also known as

  • cost per token
  • serving cost
  • تكلفة التشغيل
  • كلفة الاستدلال

Also seen as, but not recommended

  • كلفة التشغيل
  • تكلفة الاستنتاج

Related terms