نموذج Kimi K3 من Moonshot AI يقتحم المراكز الأربعة الأولى... لكن على حساب صورة "الرخيص والفعّال" للذكاء الاصطناعي الصيني

LLMs
صورة توضيحية مُولّدة بالذكاء الاصطناعي: Editorial image for Moonshot AI's Kimi K3 Cracks the Top Four, But at a Cost to Chinese AI's Cheap-and-Cheerful Reputation

الزبدة

  • Kimi K3 من Moonshot AI يقفز إلى المركز الرابع عالميًا بنتيجة 57 نقطة، متفوقًا على Claude Opus 4.8 ومقتربًا من عمالقة مثل GPT-5.6 Sol
  • النموذج الصيني يحقق سبقًا تاريخيًا بتصدّره اختبار البرمجة Code Arena: Frontend، متجاوزًا أقوى المنافسين الأمريكيين لأول مرة
  • القفزة لها ثمن: تحسّن كبير في المهام الوكيلية والمعرفة العامة، لكن معدل الهلوسة ارتفع أيضًا، ودقته في الرياضيات المتقدمة لا تزال بعيدة جدًا عن مستوى OpenAI و Anthropic

أعاد نموذج مفتوح الأوزان (Open-weight) بحجم 2.8 تريليون معامل (Parameters) ترتيب القمة في مؤشر Artificial Analysis Intelligence Index. فقد حقق Kimi K3 التابع لشركة Moonshot AI نتيجة 57 نقطة، ليحتل المركز الرابع عالميًا، متأخرًا فقط عن Claude Fable 5 (60 نقطة) و GPT-5.6 Sol (59 نقطة)، متجاوزًا في الوقت نفسه Claude Opus 4.8 (56 نقطة). بالنسبة لنموذج مفتوح المصدر، هذا الترتيب لافت بكل المقاييس: K3 يسبق الآن GLM-5.2 وعدة إصدارات من Claude Opus، ما يقلّص فجوة كانت تفصل المعامل الصينية عن الصفوف الأولى قبل أشهر قليلة فقط.

النتيجة الأكثر إثارة جاءت من مجال البرمجة. فقد أصبح Kimi K3 أول نموذج صيني يتصدّر قائمة Code Arena: Frontend، محققًا 1,679 نقطة، متفوقًا على Claude Fable 5 (1,631 نقطة) و GPT-5.6 Sol (1,618 نقطة). هذا ليس فوزًا هامشيًا؛ فتوليد الأكواد الخاصة بالواجهات الأمامية (Frontend) كان ولا يزال ساحة تاريخية لهيمنة المعامل الأمريكية المغلقة، وتصدّر K3 فيها يشير إلى أن Moonshot ضبطت النموذج خصيصًا لأعمال التطوير العملية المرتبطة بواجهات المستخدم، بدلًا من التركيز فقط على الاستدلال النظري البحت.

الأداء في المهام الوكيلية (Agentic) يروي قصة مشابهة من التحسن السريع. في اختبار GDPval v2، الذي يقيس كفاءة النماذج في تنفيذ المهام متعددة الخطوات، سجّل K3 تصنيف Elo بلغ 1,668 نقطة، في طفرة كبيرة مقارنة بسلفه K2.6 الذي سجّل 1,190 نقطة فقط. هذه النتيجة تتجاوز GLM-5.2 (1,514) و GPT-5.5 (1,494)، وحتى Claude Opus 4.8 (1,600)، لكنها تبقى دون مستوى Claude Fable 5 البالغ 1,760 نقطة. النمط يتكرر في اختبار AA-Briefcase، حيث سجّل K3 تصنيف Elo بلغ 1,547، أي بقفزة 732 نقطة عن K2.6، محتلًا المركز الثاني بعد Fable 5 مباشرة. كما تصدّر K3 اختبار AutomationBench-AA بنتيجة 53 بالمئة.

حيث تظهر الشقوق

التحسّنات لم تكن متساوية في جميع الجبهات. في اختبار FrontierMath Tier 4، المخصص لقياس الاستدلال الرياضي المتقدم، لم يتجاوز K3 نسبة دقة 39 بالمئة تقريبًا، في حين تحوم أفضل نماذج OpenAI و Anthropic حول 90 بالمئة. هذه الفجوة تؤكد أن مكاسب Moonshot الهندسية تركّزت على البرمجة والمهام الوكيلية، لا على الاستدلال الكمي العميق.

مفارقة مماثلة تظهر في موضوع الموثوقية الواقعية (Factual Reliability). دقة K3 في مؤشر AA-Omniscience ارتفعت من 33 إلى 46 بالمئة مقارنة بـ K2.6، وهو تحسن حقيقي لا يمكن إنكاره. لكن معدل الهلوسة (Hallucination Rate) ارتفع أيضًا، من 39 إلى 51 بالمئة، أي أن النموذج أصبح أكثر معرفة وأكثر عرضة في الوقت ذاته لتقديم معلومات خاطئة بثقة تامة. هذا أثر جانبي يستحق التنبيه، خصوصًا لمن يخطط لاستخدام K3 في بيئات الإنتاج (Production) التي تتطلب دقة واقعية أعلى من المهام الإبداعية أو البرمجية.

زوّدت Moonshot نموذج K3 بنافذة سياق (Context Window) تصل إلى مليون رمز (Token)، إلى جانب قدرات متعددة الوسائط (Multimodal)، ما يجعله نظامًا عام الأغراض أكثر من كونه أداة متخصصة ضيقة النطاق. ومن المقرر أن تُطرح أوزان النموذج الكاملة بحلول 27 يوليو، وهو ما سيسمح للمطورين المستقلين بالتحقق من هذه النتائج مباشرة، بدلًا من الاعتماد كليًا على اختبارات Artificial Analysis. وبالنظر إلى السرعة التي أغلق بها K3 الفجوة مع النماذج المغلقة الرائدة، فإن هذا الطرح المفتوح قد يكون أكثر أهمية من أي مركز يحققه في لوحات الصدارة، إذ يمثّل ابتعادًا واضحًا عن الصورة النمطية للنماذج الصينية المفتوحة التي كانت سائدة حتى عام 2024، والقائمة على التكلفة المنخفضة جدًا مقابل قدرات محدودة.

واكب

فريق تحرير واكب

تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.

اشترك في النشرة البريدية

احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.

قناة التليجرام

تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.

انضم إلينا على تليجرام