Grok 4.5: التفوق الحقيقي ليس في نتائج الاختبارات بل في الفاتورة

LLMsAI Agents
صورة توضيحية مُولّدة بالذكاء الاصطناعي: Editorial image for Grok 4.5's Real Edge Isn't the Benchmark Score, It's the Bill

الزبدة

  • Grok 4.5 يدخل السوق بسعر 2 دولار للإدخال و6 دولارات للإخراج لكل مليون رمز، أرخص بكثير من Opus 4.8 وFable 5 وGPT-5.5/5.6 مجتمعين
  • النموذج لا يتصدر أي اختبار معياري بمفرده، لكنه يستهلك رموزاً أقل بـ4.2 مرة من أقرب منافسيه في مهام البرمجة، وهذا يعني توفيراً حقيقياً على نطاق واسع
  • توزيع Grok 4.5 عبر Cursor يحمل دلالة أكبر من مجرد شراكة تقنية، خصوصاً بعد استحواذ SpaceX على الشركة الأم لـCursor بصفقة أسهم بقيمة 60 مليار دولار

نموذج لا يتصدر القائمة لكنه يوفر المال

لا يحتل Grok 4.5 من xAI المركز الأول في كل لوحة تصنيف يظهر فيها، لكنه قد يكون الطريق الأرخص للوصول إلى القمة تقريباً. دُرّب النموذج على عشرات آلاف من معالجات Nvidia GB300، وسجّل 83.3% في اختبار Terminal Bench 2.1، و64.7% في SWE Bench Pro، و53% في DeepSWE 1.1. هذه النتائج تضعه في نفس مستوى منافسيه من Anthropic و OpenAI، دون أن يتصدر أي فئة بمفرده.

الفرق الحقيقي يظهر في الفاتورة

هنا تكمن ميزة Grok 4.5 الفعلية: التسعير. حدّدت xAI سعر النموذج بـ2 دولار لكل مليون رمز إدخال (Input Tokens) و6 دولارات لكل مليون رمز إخراج (Output Tokens). في المقابل، يتقاضى Opus 4.8 من Anthropic 5 دولارات و25 دولاراً على التوالي، بينما يطلب Fable 5 عشرة دولارات للإدخال و50 دولاراً للإخراج. أما GPT-5.5 وGPT-5.6 من OpenAI فيقفان عند 5 دولارات للإدخال و30 دولاراً للإخراج. عملياً، يكلّف Grok 4.5 جزءاً بسيطاً فقط مما يتقاضاه أقرب منافسيه لأعمال مشابهة في البرمجة والمهام الوكيلية (Agentic Tasks).

تتوسع هذه الفجوة أكثر عند النظر إلى كفاءة استهلاك الرموز (Token Efficiency). في مهام SWE Bench Pro، يستهلك Grok 4.5 عدد رموز أقل بـ4.2 مرة من Opus 4.8 للوصول إلى نتائج مماثلة، مع سرعة إخراج تبلغ 80 رمزاً في الثانية. حين يُجمع سعر الرمز الأقل مع عدد الرموز الأقل المطلوبة لكل مهمة، يصبح الفرق الفعلي في التكلفة بين Grok 4.5 ومنافسيه الأغلى أكبر بكثير من مجرد الفرق في قائمة الأسعار المعلنة. وبالنسبة للفرق التي تشغّل أحمال عمل وكيلية (Agentic Workloads) بكثافة عالية، قد يكون هذا التراكم في التوفير أهم من فرق بضع نقاط في دقة أي اختبار منفرد.

توزيع مرتبط بصفقة بقيمة 60 مليار دولار

تستهدف xAI بهذا النموذج بشكل مباشر مهام البرمجة، والأنابيب الوكيلية (Agentic Pipelines)، وأتمتة أعمال المعرفة، ويُطرح النموذج عبر منصة Grok Build وواجهة xAI، وأيضاً عبر Cursor. قناة التوزيع الأخيرة تحمل دلالة إضافية: استحوذت SpaceX في منتصف يونيو على الشركة الأم لـCursor بصفقة أسهم بقيمة 60 مليار دولار، وهو ما يربط النموذج الرائد لدى xAI ببيئة برمجية تعتمد عليها شرائح واسعة من المطورين، عبر صلة مؤسسية لا مجرد اتفاقية واجهة برمجية (API) عادية.

هل تحسم فروق الاختبارات المعيارية المنافسة؟

النمط الذي يتكرر بين Grok 4.5 وOpus 4.8 وFable 5 وGPT-5.5/5.6 يشير إلى أن سباق النماذج المتقدمة (Frontier Models) بدأ يتحول عن كونه سباق قدرات خام فقط. فحين تتقارب النتائج ضمن فروق لا تتجاوز نقاطاً مفردة، تصبح تكلفة إنجاز كل مهمة وعدد الرموز المستهلكة في كل جلسة عاملين أكثر حسماً لفرق المهندسين عند اختيار نموذج افتراضي لتشغيل الوكلاء (Agents) في بيئات الإنتاج.

هذا الأمر بالغ الأهمية في أحمال عمل من طراز SWE Bench Pro وDeepSWE، حيث يقوم الوكيل بسلسلة طويلة من استدعاءات الأدوات والتعديلات المتتالية قبل إغلاق أي مشكلة. نموذج يحتاج ربع عدد الرموز فقط للوصول إلى نتيجة مقاربة يغيّر معادلة تشغيل الوكلاء على نطاق واسع، حتى إن تراجعت دقته الخام ببضع نقاط في اختبار معين. رهان xAI مع Grok 4.5 يبدو واضحاً: الإنتاجية والسعر، لا الصدارة في لوحات التصنيف، هما ما سيحدد النموذج الذي يختاره المطورون فعلياً للبناء عليه.

التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.

  1. 1Grok 4.5 is so cheap compared to Fable 5 and GPT 5.5 that benchmark gaps may not matter muchthe-decoder.com
  2. 2Task Decomposition-Guided Reranking for Adaptive Agent Skill Retrievalarxiv.org
  3. 3PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languagesarxiv.org
  4. 4Memory in the Loop: In-Process Retrieval as ExtendedWorking Memory for Language Agentsarxiv.org
  5. 5Decision Protocols in Multi-Agent Large Language Model Conversationsarxiv.org
  6. 6When Should LLMs Search? Counterfactual Supervision for Search Routingarxiv.org
  7. 7DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrailarxiv.org
  8. 8TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Trainingarxiv.org
  9. 9Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learningarxiv.org
  10. 10Anthropic extends free Fable 5 access for subscribers as OpenAI's GPT-5.6 Sol heats up the pricing warthe-decoder.com
  11. 11PORTS: Preference-Optimized Retrievers for Tool Selection with Large Language Modelsarxiv.org
  12. 12Learning to Control LLM Agent Harnesses with Offline Reinforcement Learningarxiv.org
  13. 13Most LLM Conformity Needs No Speaker: Measuring the Speaker-Free Floor in Peer-Pressure Benchmarksarxiv.org
  14. 14Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascadearxiv.org
  15. 15AI-Model Network: Concept, Current State and Futurearxiv.org
  16. 16Benchmarking KV-Cache Optimizations across Task Quality and System Performance for Long-Context Servingarxiv.org
  17. 17PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agentsarxiv.org
  18. 18Controlling Tool Use with Heading-Specific Activation Steeringarxiv.org
  19. 19From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Spacearxiv.org
  20. 20Onnes: A Physics-Grounded Multi-Agent LLM Simulator for Cryogenic Fault Diagnosis in Quantum Computing Infrastructurearxiv.org
  21. 21Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillationarxiv.org
  22. 22Lean-Quantum: Toward AI-Assisted Formalization of Quantum Informationarxiv.org
  23. 23Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluationarxiv.org
  24. 24Copilot goes cheap as Microsoft phases out OpenAI and Anthropic models to cut coststhe-decoder.com
  25. 25Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agentsarxiv.org
  26. 26Akashic: A Low-Overhead LLM Inference Service with MemAttentionarxiv.org
  27. 27Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memoryarxiv.org
  28. 28Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agentsarxiv.org
  29. 29ChatGPT can now listen and talk at the same time, making AI conversations seem more humanthe-decoder.com
واكب

فريق تحرير واكب

تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.

اشترك في النشرة البريدية

احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.

قناة التليجرام

تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.

انضم إلينا على تليجرام

المزيد من الأبحاث

عرض الكل في الأبحاث