نموذج "لاغونا S 2.1" الصغير من Poolside يتفوق على منافس ضخم في اختبارات البرمجة بفارق 4 أضعاف

الزبدة
- نموذج صغير بـ8 مليارات معامل نشط فقط من Poolside يهزم منافساً أكبر بست مرات، محققاً 40.4% في اختبار DeepSWE مقابل 9.0% فقط لمنافسه DeepSeek-V4-Pro-Max
- الاختبارات تثبت الجدوى: النموذج يعمل على وحدة NVIDIA واحدة (DGX Spark) ويتصدر اختبار SWE-Bench Multilingual بنسبة 78.5%، لكن تفعيل 'وضع التفكير' يرفع الدقة بشكل كبير مقابل استهلاك 2.5 مرة أكثر من الرموز
- من العقود الحكومية إلى الأوزان المفتوحة على Hugging Face: هذا ثالث نموذج برمجي تطرحه Poolside في ثلاثة أشهر فقط، وتدرّب في أقل من تسعة أسابيع على 4,096 معالج H200
أطلقت شركة Poolside نموذجاً برمجياً بحجم 8 مليارات معامل نشط (Active Parameters) فقط، لكنه تمكّن من التفوق على منافس يفوقه في الحجم الحاسوبي بنحو ست مرات. النموذج الجديد، المسمى "لاغونا S 2.1" (Laguna S 2.1)، وهو الإصدار الأحدث مفتوح الأوزان (Open-Weight) من الشركة الناشئة، حقق نسبة 40.4% في اختبار DeepSWE v1.1، متجاوزاً بذلك نموذج DeepSeek-V4-Pro-Max الذي لم يتجاوز 9.0% في ذلك الاختبار. هذا الفارق الكبير في الكفاءة هو تحديداً ما يجذب الانتباه في سوق يحدد فيه تكلفة الاستدلال (Inference Cost) - وليس القدرة الخام وحدها - أي النماذج تُعتمد فعلياً في بيئات الإنتاج.
يعتمد النموذج على بنية "خليط الخبراء" (Mixture-of-Experts)، بإجمالي 118 مليار معامل، لكن فقط 8 مليارات منها تُنشّط عند الاستدلال، وهو حجم صغير يكفي لتشغيله على وحدة NVIDIA DGX Spark واحدة. وفي اختبار SWE-Bench Multilingual، سجّل النموذج 78.5%، متصدراً جميع النماذج الأخرى في جدول المقارنة الذي نشرته Poolside. أما في اختبار Terminal-Bench 2.1، فقد بلغت النتيجة 70.2% عند تفعيل "وضع التفكير" (Thinking Mode)، مقارنة بـ60.4% فقط دون تفعيل الاستدلال الموسّع.
هذا الوضع مفعّل افتراضياً في النموذج، وتأثيره ليس شكلياً: في اختبار DeepSWE على وجه التحديد، يرفع تفعيل وضع التفكير الدقة من 16.5% إلى 40.4%. لكن هذه القفزة ليست مجانية؛ فالمسارات (Trajectories) التي تستخدم وضع التفكير تستهلك حوالي 249 ألف رمزاً (Tokens) في مرحلة الإكمال، مقابل نحو 99 ألف رمز دون هذا الوضع، أي أن تحسين الدقة يأتي بتكلفة تقارب 2.5 مرة من استهلاك الرموز.
يدعم "لاغونا S 2.1" نافذة سياق (Context Window) تصل إلى مليون رمز، في كل من وضعي التفكير وغيره. كما يُعد هذا أول نموذج من Poolside تُنفَّذ فيه مرحلة التعلم التعزيزي (Reinforcement Learning) بدقة FP8، وهو خيار ساهم على الأرجح في تقليص مدة التدريب. بدأ التدريب المسبق (Pre-training) في 22 مايو 2026 باستخدام 4,096 معالج NVIDIA H200، واستغرقت الدورة الكاملة من التدريب حتى الإطلاق أقل من تسعة أسابيع. بُني النموذج كنسخة موسّعة من عائلة Laguna XS، ويتشارك بيانات التدريب المسبق مع نموذج XS 2.1، وقد نُشرت أوزانه على منصة Hugging Face بموجب ترخيص Poolside الخاص OpenMDW-1.1.
من العقود الحكومية إلى الأوزان المفتوحة
يمثّل هذا الإطلاق تحوّلاً لافتاً لمسار Poolside، الشركة التي بنت أعمالها الأولى حول عملاء حكوميين ومؤسسات القطاع العام، قبل أن تتجه نحو الإصدارات مفتوحة المصدر، بدءاً بنموذج XS.2 بموجب ترخيص Apache 2.0. ويُعد "لاغونا S 2.1" ثالث نموذج برمجي تطرحه الشركة في غضون ثلاثة أشهر تقريباً، بعد إصدار Laguna M.1 وXS.2 في أبريل 2026، وهي وتيرة إطلاق سريعة بشكل غير معتاد لشركة ناشئة تنافس معامل بحثية تملك موازنات حوسبة أضخم بكثير.
تركّز عروض Poolside التوضيحية على قدرة النموذج في التعامل مع المهام مفتوحة النهاية وطويلة المدى. في أحد العروض، بنى "لاغونا S 2.1" محرك متصفح (Browser Engine) كامل الوظائف من مجلد فارغ في غضون 50 دقيقة، قادراً على عرض صفحات HTML وCSS. وفي عرض آخر، توصّل النموذج إلى برهان لمسألة إردوش رقم 397 (Erdős Problem #397)، وهي مسألة في نظرية الأعداد ظلت بلا حل منذ عام 1975، وأنهى المهمة في 40 خطوة استدلالية بتكلفة حوسبة لم تتجاوز 0.088 دولار.
هذه الأمثلة تصنع مادة تسويقية جذابة، لكن الأرقام المرجعية (Benchmarks) هي ما يهم فعلاً فرق الهندسة التي تقيّم مساعدي برمجة يمكن استضافتهم ذاتياً. فنموذج يعمل على وحدة DGX Spark واحدة، ويتفوق في الوقت نفسه على منافسين أكبر بكثير في اختبار SWE-Bench Multilingual، يغيّر المعادلة بالنسبة للفرق التي تريد توليد كود قوي دون الحاجة لتأجير أسطول من وحدات معالجة الرسوميات (GPUs).
التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.
فريق تحرير واكب
تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.
اشترك في النشرة البريدية
احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.
قناة التليجرام
تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.
