"كلود أوبس 5" يرفع سقف الاستدلال في الذكاء الاصطناعي أربع مرات... وبتكلفة أقل من منافسيه

LLMs
صورة توضيحية مُولّدة بالذكاء الاصطناعي: Editorial image for Claude Opus 5 Quadruples the Toughest AI Reasoning Score, and Does It Cheaper Than Rivals

الزبدة

  • كلود أوبس 5 من أنثروبيك يقفز بمعيار ARC-AGI-3 الصعب من 7.8% إلى 30.2%، ويحل خمس ألغاز عجزت كل النماذج السابقة عن حلها.
  • النموذج تصدّر مؤشر الذكاء العام لدى Artificial Analysis برصيد 61 نقطة، متقدماً على منافسيه بما فيهم فيبل 5 وGPT-5.6 Sol، مع تكلفة تشغيل أقل بوضوح (2.03 دولار مقابل 2.75 دولار للمهمة الواحدة).
  • النتائج ليست مثالية بالكامل: أوبس 5 يتراجع في دقة الحقائق أمام فيبل 5، ومعدل الهلوسة فيه قفز 14 نقطة ليصل إلى 50%، وهناك شك مشروع بأن التدريب جاء بعد كشف صيغة معيار ARC-AGI-3 نفسه.

نسبة 30.2 بالمئة قد لا تبدو مثيرة للانتباه في البداية، إلى أن تعرف أن الرقم الأفضل سابقاً كان 7.8 بالمئة فقط. هذا القفزة الكبيرة التي حققها نموذج "كلود أوبس 5" (Claude Opus 5) الجديد من أنثروبيك على معيار (ARC-AGI-3) هي أبرز ما جاء في موجة من الاختبارات المستقلة التي وضعت النموذج في صدارة أو قرب صدارة معظم اختبارات الاستدلال (Reasoning) المعتمدة حالياً في القطاع.

صُمم معيار (ARC-AGI-3) خصيصاً ليصعب خداعه بأساليب مطابقة الأنماط (Pattern Matching) التي تعتمد عليها كثير من النماذج اللغوية، فهو يستخدم بيئات ألغاز تفاعلية تختبر القدرة الحقيقية على حل المشكلات بدل الاعتماد على مهارات محفوظة مسبقاً. نجح "أوبس 5" في حل خمس بيئات لم يسبق لأي نموذج اختراقها، أربع منها بمستوى يعادل أو يتفوق على أداء البشر، ليرتفع إجمالي البيئات التجريبية المحلولة من أصل 25 إلى ست بيئات فقط.

لاحظ الباحثون أن النموذج توصّل بشكل مستقل إلى معادلات انعكاسية (Reflection Equations) وحوّل منطق الألغاز إلى صيغ جبرية (Algebraic Notation) خلال عمله على مهام (ARC-AGI-3)، وهو سلوك حل مشكلات لم يُوثَّق من قبل في هذه الاختبارات. وبحسب جهة ARC Prize، لم تتجاوز نماذج "فيبل" (Fable) السابقة من أنثروبيك نسبة 20 بالمئة على المعيار نفسه، ما يوضح حجم الفارق الذي تمثله هذه النسخة الجديدة.

نتائج قوية تتجاوز معيار واحد

لم تتوقف المكاسب عند (ARC-AGI-3). سجّل "أوبس 5" نسبة 90.4 بالمئة على (ARC-AGI-2) و97.5 بالمئة على (ARC-AGI-1)، وتصدّر مؤشر الذكاء لدى "أرتيفيشال أناليسيس" (Artificial Analysis Intelligence Index) برصيد 61 نقطة، متقدماً على "فيبل 5" (60)، وGPT-5.6 Sol (59)، وKimi K3 (57)، وسلفه "أوبس 4.8" (56).

لكن لا تميل كل المعايير لصالح أنثروبيك. في اختبار (CritPt) لقياس الاستدلال الفيزيائي، تعادل "أوبس 5" مع "فيبل 5" لكنه تراجع خلف GPT-5.6 Sol وGPT-5.5 Pro وGPT-5.6 Terra. وفي اختبار الدقة الواقعية (AA-Omniscience)، تحسّن النموذج بسبع نقاط عن "أوبس 4.8" لكنه ظل خلف "فيبل 5"، بل ارتفع معدل الهلوسة (Hallucination Rate) الخاص به في نفس الاختبار بـ14 نقطة ليبلغ 50 بالمئة. وعلى مؤشر القدرات لدى Epoch AI، سجّل "أوبس 5" 159 نقطة مقابل 161 لـ"فيبل 5"، وهو تعادل تقريبي أكثر منه انتصاراً واضحاً.

السعر يقلب المعادلة لصالح المطورين

التفصيل الأكثر أهمية عملياً للمطورين قد يكون التكلفة. عند مستويي الاستدلال "المرتفع" و"المرتفع جداً"، يتفوق "أوبس 5" على "أوبس 4.8" و"سونيت 5" (Sonnet 5) في الأداء مع تكلفة تشغيل أقل. ووجدت "أرتيفيشال أناليسيس" أن متوسط تكلفة مهمة واحدة على مؤشر الذكاء تبلغ 2.03 دولار مع "أوبس 5"، مقارنة بـ2.75 دولار لـ"فيبل 5" عند احتساب التوجيه الاحتياطي (Fallback Routing).

على معيار (Terminal-Bench v2.1)، تعادل "أوبس 5" عند أقصى مستوى استدلال مع المتصدر السابق GPT-5.6 Sol بنسبة 89 بالمئة، وتساوى مع "فيبل 5" بنتيجة 161 على معيار البرمجة (SWE-ECI)، مع أن GPT-5.6 Sol لا يزال متقدماً بوضوح في كليهما.

ملاحظة تستحق التوقف عندها: تم تدريب "أوبس 5" بعد أن أصبحت صيغ ألغاز (ARC-AGI-3) متاحة للعموم، وهذا يفتح احتمال أن تكون أنثروبيك قد حسّنت النموذج خصيصاً لبنية المعيار وليس فقط لتحسين الاستدلال العام.

هذا الاحتمال لا يُلغي النتائج المُحققة، لكنه عامل سيبقى تحت مجهر المُقيّمين المستقلين مع تراكم اختبارات إضافية من طرف ثالث في الفترة المقبلة.

واكب

فريق تحرير واكب

تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.

اشترك في النشرة البريدية

احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.

قناة التليجرام

تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.

انضم إلينا على تليجرام