GLM-5.3 من Z.ai: قفزة في البرمجة دون إعادة تدريب النموذج الأساسي

LLMsDeveloper Tools
صورة توضيحية مُولّدة بالذكاء الاصطناعي: Editorial image for Z.ai's GLM-5.3 Gains Coding Muscle Without Retraining the Base Model

الزبدة

  • Z.ai أطلقت GLM-5.3 دون أن تلمس النموذج الأساسي المكوّن من 743 مليار معامل، وكل التحسينات جاءت من إعادة صياغة مرحلة ما بعد التدريب فقط
  • النتائج مذهلة في اختبارات الأمن السيبراني والبرمجة الوكيلية: قفزة سداسية في Terminal-Bench من 4.6 إلى 28.3، وتضاعف أداء ExploitBench إلى 54.4%
  • النموذج متاح الآن عبر واجهة Z.ai وخطتها البرمجية، لكن الأوزان المفتوحة ستنتظر أسبوعين إضافيين لإتمام فحوصات السلامة، نظراً لقوة النموذج في مهام الاختراق

أطلقت Z.ai نموذج GLM-5.3 في 14 أغسطس 2026، لكن التفصيل الأهم لا يتعلق بحجم أكبر، بل بغيابه. أعادت الشركة استخدام البنية الأساسية نفسها من GLM-5.2 بحجم 743 مليار معامل، ووجّهت كل تحسينات القدرات عبر توسيع مرحلة ما بعد التدريب (Post-training) بدلاً من إجراء تدريب أولي جديد من الصفر.

هذا الخيار يظهر بوضوح في أرقام الاختبارات المعيارية. ففي Terminal-Bench 3.0، وهو اختبار لمهام طرفية طويلة الأمد تعتمد على الوكلاء الذاتيين، قفزت نتيجة GLM-5.3 من 4.6 إلى 28.3 مقارنة بسابقه، أي زيادة تفوق ستة أضعاف دون المساس بالأوزان الأساسية التي تولّد معرفة النموذج الخام.

أداء أفضل في الأمن السيبراني

التقييمات المتخصصة في الأمن السيبراني تحكي قصة مشابهة. ارتفع أداء النموذج في CyberGym من 77.2% في GLM-5.2 إلى 84.5% في GLM-5.3، بينما تضاعف أداؤه في ExploitBench أكثر من مرة، صاعداً من 24.4% إلى 54.4%. وفي ExploitGym، أنجز النموذج 105 مهام خلال ساعتين، و130 مهمة خلال نافذة زمنية مدتها ست ساعات، وهو مقياس إنتاجية موجّه لأعباء العمل الوكيلية وأنماط الاختبار الهجومي للأمن.

الوكلاء البرمجيون المبنيون فوق GLM-5.3 سجّلوا قفزات مماثلة. فوكيل هندسة البرمجيات DeepSWE v1.1، الذي جرى تقييمه على النموذج الجديد، حقق 66.9 نقطة مقابل 46.2 في النسخة السابقة، وهي قفزة تُرجعها Z.ai إلى خط أنابيب ما بعد التدريب نفسه، لا إلى أي تغيير معماري تحت السطح.

على اختبار Z.ai الداخلي الخاص بالبرمجة (Code Bench)، الذي يعمل عند نحو 50 ألف توكن مخرج لكل مهمة، سجّل GLM-5.3 نسبة 31.4%، وهو ما تصفه الشركة بأنه تحسّن بنسبة 50% مقارنة بنتيجة GLM-5.2 على الاختبار نفسه. الاختبارات الداخلية تستحق التحفظ المعتاد: فهي مؤشرات مفيدة على اتجاه التقدم، لكنها ليست موثقة بشكل مستقل كما هو الحال مع الاختبارات الخارجية المستقلة.

التوفر والأوزان المفتوحة

بات GLM-5.3 متاحاً بالفعل عبر واجهة برمجة تطبيقات Z.ai، وخطة GLM للبرمجة (GLM Coding Plan)، ومنصة ZCode، ما يعني أن بإمكان المطورين البدء باختباره على أعباء عمل برمجية ووكيلية فعلية فوراً. أما الأوزان المفتوحة فمسألة مختلفة: تقول Z.ai إنها تخطط لإصدارها بعد نحو أسبوعين من الإطلاق، بمجرد الانتهاء من تقييمات السلامة والتحصين الأمني.

هذه الفجوة بين الوصول المستضاف وإصدار الأوزان المفتوحة أصبحت نمطاً مألوفاً لدى المختبرات الرائدة، إذ تمنح الشركة وقتاً لاختبار النموذج ميدانياً قبل تسليم نسخ يمكن لأي شخص ضبطها أو إعادة توظيفها. ولنموذج تعتمد مكاسبه المعيارية بشكل كبير على مهام الأمن الهجومي وإتمام الثغرات، يحمل هذا الحذر وزناً إضافياً عن المعتاد.

ما يُظهره GLM-5.3 بشكل أساسي هو أن النموذج الأساسي الثابت لا يزال يملك هامشاً كبيراً من التحسين لم يُستنفد بعد.

مرحلة ما بعد التدريب، لا الحجم، هي ما أنتج هذه القفزة في أداء المهام البرمجية طويلة الأمد ومهام الأمن السيبراني هذه المرة. وهو إشارة إلى أن Z.ai ومنافسيها قد يواصلون استخلاص مكاسب من البنى القائمة قبل الالتزام بدورة تدريب أولي مكلفة جديدة.

التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.

  1. 1Z.ai Ships GLM-5.3 Without Retraining the Base Model: Better at Complex Coding and Long-Horizon Tasksmarktechpost.com
واكب

فريق تحرير واكب

تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.

اشترك في النشرة البريدية

احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.

قناة التليجرام

تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.

انضم إلينا على تليجرام

المزيد من الأبحاث

عرض الكل في الأبحاث