مقياس OSWorld 2.0 يكشف المسافة الحقيقية بين وكلاء الذكاء الاصطناعي وإتمام مهام الحاسوب كالبشر

AI AgentsLLMs
صورة توضيحية مُولّدة بالذكاء الاصطناعي: Editorial image for OSWorld 2.0 Benchmark Exposes How Far Computer-Use AI Still Has to Go

الزبدة

  • أقوى نموذج ذكاء اصطناعي في العالم ينجح في إتمام خُمس المهام الحاسوبية الطويلة فقط، ما يُظهر أن أتمتة العمل المكتبي المعقد لا تزال بعيدة المنال
  • مقياس OSWorld 2.0 يضع 108 مهام واقعية تشبه ما يفعله البشر لمدة 1.6 ساعة تقريبًا، وتحتاج الوكلاء إلى 318 خطوة لإنجازها بدل 30 خطوة فقط في النسخة القديمة
  • المفاجأة: النموذج الأكثر كفاءة في استهلاك الموارد (GPT-5.5) ليس الأفضل في الأداء، إذ يتفوق عليه Claude Opus 4.8 بفارق كبير في نسبة إتمام المهام

عشرون بالمئة فقط. هذا أفضل معدل إتمام تحققه أقوى النماذج المتطورة (Frontier Models) على مقياس OSWorld 2.0، وهو معيار قياس (Benchmark) جديد صُمم لاختبار قدرة وكلاء الذكاء الاصطناعي (AI Agents) على إنهاء مهام حاسوبية طويلة ومعقدة، من النوع الذي يتعامل معه الناس يوميًا دون تفكير.

الورقة البحثية، التي نُشرت على أرشيف الأبحاث (arXiv) في 28 يونيو 2026 وخضعت لتعديل في 13 يوليو، أعدها الباحثون منغ‌تشي يوان، وتزيلونغ تشو، وشين‌تشوانغ شيونغ، بمساهمة متساوية عبر دراسة تمتد على 68 صفحة. يبني هذا العمل على إطار العمل الأصلي (OSWorld) لكن برفع مستوى تعقيد المهام بشكل جذري. فبينما كانت النسخة الأولى تطلب من الوكلاء إنهاء مهام رقمية قصيرة نسبيًا، تضم OSWorld 2.0 هذه المرة 108 مهمة طويلة الأمد (Long-Horizon Tasks) تغطي استخدامات يومية ومهنية للحاسوب، كل واحدة منها مصممة على غرار مهام يحتاج الإنسان لإنهائها في المتوسط نحو 1.6 ساعة.

هذا القفزة في الصعوبة تنعكس بوضوح في الأرقام. فالوكلاء الذين يتصدون لمهام OSWorld 2.0 يحتاجون في المتوسط إلى 318 استدعاء أداة (Tool Calls) عند العمل على نموذج Claude Opus 4.7 مع تفعيل أقصى درجات التفكير، مقارنة بحوالي 30 استدعاء فقط للمهام المماثلة في النسخة الأولى من OSWorld. هذا التضخم بمعدل عشر مرات ليس عرضيًا، بل يعكس تصميمًا مقصودًا يستهدف خمس نقاط ضعف محددة في الوكلاء الحاليين: التفاعل المتدفق (Streaming Interaction)، والبيئات المتغيرة أثناء عمل الوكيل، والاستدلال عبر مصادر معلومات متعددة، واستنتاج الحالة غير المعروضة صراحة على الشاشة، والدقة البصرية-المكانية الدقيقة عند النقر أو التنقل بين الواجهات.

النماذج المتطورة لا تزال قاصرة

على المقياس الأساسي للإتمام الثنائي (Binary-Completion Metric)، حقق أقوى تكوين تم اختباره، وهو Claude Opus 4.8 بتفعيل أقصى درجات التفكير مع استدعاءات أدوات مجمّعة (Batched Tool Calls) عبر 500 خطوة، إتمامًا كاملًا لـ20.6% من المهام فقط، رغم حصوله على درجات جزئية في 54.8% منها بحسب نظام تقييم OSWorld 2.0 الذي يرصد التقدم التدريجي.

أما GPT-5.5 فيروي قصة مختلفة حول العلاقة بين الكفاءة والقدرة الفعلية. النموذج يستهلك عددًا أقل من الرموز (Tokens) لكل مهمة مقارنة بـClaude Opus 4.8، لكن هذه الكفاءة لها ثمن: معدل إتمامه يستقر عند نحو 13%، أي أقل بفارق ملموس عن أفضل نموذج لدى Anthropic، رغم حاجته لموارد حوسبة أقل في كل محاولة.

الفارق بين هاتين النتيجتين مهم جدًا لأي جهة تقيّم منتجات الوكلاء لاستخدامها في بيئات الإنتاج الفعلية. فنموذج أقل تكلفة تشغيلية لكنه يتوقف عند 13% من الإتمام قد يكلف أكثر في النهاية إذا أُضيفت تكاليف إعادة المحاولة والتدخل البشري، في حين أن نموذجًا أعلى تكلفة وأعلى معدل إتمام لا يزال يفشل في نحو أربع من كل خمس مهام. لا واحدة من هاتين النتيجتين تشير إلى أن وكلاء استخدام الحاسوب (Computer-Use Agents) اقتربوا من أتمتة سير العمل الفعلي متعدد الساعات ومتعدد التطبيقات الذي يتعامل معه العاملون المعرفيون يوميًا.

بـ42 رسمًا بيانيًا يوثق أنماط الفشل وتفاصيل المهام، تبدو الورقة البحثية أقرب إلى خريطة تشخيصية شاملة منها إلى احتفال بنجاح مختبر معين. فئات التحدي الخمس التي حددها الباحثون، وخصوصًا استنتاج الحالة الضمنية (Implicit-State Inference) والدقة البصرية-المكانية، تشير إلى ثغرات هيكلية محددة في تصميم هذه الأنظمة، لا إلى قصور عام في القدرات، وهذا يمنح مطوري النماذج والشركات المشترية صورة أوضح عن النقاط الدقيقة التي يتعطل عندها وكلاء اليوم.

التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.

  1. 1OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasksarxiv.org
واكب

فريق تحرير واكب

تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.

اشترك في النشرة البريدية

احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.

قناة التليجرام

تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.

انضم إلينا على تليجرام

المزيد من الأبحاث

عرض الكل في الأبحاث