أمازون تضيف ثلاثة نماذج ذكاء اصطناعي متخصصة إلى SageMaker JumpStart

الزبدة
- أمازون ضمّت ثلاثة نماذج ذكاء اصطناعي جديدة إلى SageMaker JumpStart في يناير 2026: واحد لتحديد الأجسام في الصور، وآخر لوكلاء يتصرفون فعلياً، وثالث للاستدلال طويل السياق
- نموذج LocateAnything-3B من إنفيديا يتنبأ بعدة مواقع أجسام دفعة واحدة بدل واحد تلو الآخر، ما يسرّع كشف الأجسام في الصور بشكل ملحوظ
- نموذج Qwen3.5-122B-A10B يحمل 122 مليار معلمة لكن ينشّط 10 مليارات فقط لكل توكن، مع نافذة سياق ضخمة تبلغ 262 ألف توكن تناسب المستندات الطويلة وجلسات الوكلاء الممتدة
منصة Amazon SageMaker JumpStart باتت تستضيف منذ يناير 2026 ثلاثة نماذج جديدة، كل واحد منها مصمم لمهمة مختلفة تماماً عن الآخر: تحديد مواقع الأجسام داخل الصور، والتنقل عبر واجهات البرمجيات والويب، ومعالجة الاستدلال طويل السياق على نطاق واسع. الإضافة تمنح المطورين مساراً واحداً لنشر قدرات كانت تتطلب سابقاً تجميع إصدارات بحثية متفرقة بأنفسهم.
النموذج الأول هو LocateAnything-3B من إنفيديا، وهو نموذج تأريض بصري (Visual Grounding) يحدد مواقع الأجسام داخل الصور ويرسم حدودها. يعتمد على تقنية تُعرف باسم فك التشفير المتوازي للصناديق (Parallel Box Decoding)، تتيح للنموذج التنبؤ بعدة صناديق إحاطة في آنٍ واحد بدلاً من واحد تلو الآخر، وهو خيار تصميمي يهدف إلى تسريع مهام كشف الأجسام.
الإضافة الثانية هي Qwen-AgentWorld-35B-A3B من فريق Qwen التابع لعلي بابا، وهو مبني خصيصاً لوكلاء الذكاء الاصطناعي الذين يحتاجون إلى التصرف لا مجرد الإجابة عن الأسئلة. دُرّب النموذج على أكثر من 10 ملايين مسار تفاعل واقعي موزعة على سبعة مجالات: استعمال الأدوات، البحث، استخدام الطرفية (Terminal)، هندسة البرمجيات، أندرويد، تصفح الويب، والتفاعل العام مع نظام التشغيل. هذا التنوع يجعله أساساً لوكلاء يعملون عبر بيئات رقمية متعددة بدلاً من الاقتصار على مهمة ضيقة واحدة.
أما النموذج الثالث، Qwen3.5-122B-A10B، فيستهدف الاستدلال طويل السياق والكفاءة الحاسوبية. يحمل 122 مليار معلمة إجمالاً، لكنه ينشّط 10 مليارات فقط لكل توكن، وفق تصميم "مزيج الخبراء" (Mixture-of-Experts) الذي يبقي تكاليف الاستدلال قريبة من نموذج أصغر بكثير مع الاحتفاظ بمجموعة معلمات ضخمة.
هذه الكفاءة مصدرها بنية هجينة تجمع بين شبكات "غيتد دلتا" (Gated Delta Networks) وطبقة متناثرة من مزيج الخبراء مكوّنة من 256 خبيراً. ومع نافذة سياق أصلية تبلغ 262 ألف توكن، يُوضع النموذج في مصاف الحلول المناسبة لتحليل المستندات الطويلة، وجلسات الوكلاء الممتدة، أو الاستدلال على مستوى قواعد أكواد كاملة، حيث يشكّل طول السياق عادة نقطة الاختناق الأبرز.
لماذا يهم التجميع هنا
لا شيء من هذه الإصدارات الثلاثة غير مسبوق بمفرده: التأريض البصري، ومجموعات التدريب الوكيلية، وبنى مزيج الخبراء المتناثرة مع سياق طويل، جميعها ظهرت في مكان أو آخر خلال 2025. ما تقدمه أمازون هنا تشغيلي لا تقني: بوابة إدارية عبر SageMaker JumpStart تختصر عبء الإعداد المرتبط باستضافة كل نموذج بشكل مستقل.
بالنسبة للفرق التي تبني خطوط معالجة متعددة الوسائط أو وكيلية، يعني هذا أن LocateAnything-3B يمكنه تولي طبقة الإدراك البصري، بينما يقود Qwen-AgentWorld-35B-A3B التفاعل والتنفيذ، ويعمل Qwen3.5-122B-A10B كعمود فقري للاستدلال طويل السياق، وكل ذلك يُشغَّل من نفس لوحة التحكم. الإعلان نفسه لا يتضمن تفاصيل كثيرة حول مقارنات الأداء أو التسعير، ما يترك مسألة كيفية أداء هذه النماذج مقابل منافسين من فئة GPT-4o أو عروض SageMaker الحالية رهينة التجربة العملية لا بيانات الإصدار الرسمية.
التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.
فريق تحرير واكب
تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.
اشترك في النشرة البريدية
احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.
قناة التليجرام
تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.
