خوارزميات تدرج السياسة تتفوق على نظرية الألعاب في ذكاء اصطناعي معقد بمعلومات غير كاملة

الزبدة
- بحث جديد من معهد ماساتشوستس للتكنولوجيا (MIT) يقلب الموازين: خوارزميات تدرج السياسة (Policy Gradient Algorithms) تدفع الذكاء الاصطناعي للتفوق على نظرية الألعاب (Game Theory) في التعامل مع التحديات المعقدة ذات المعلومات المخفية.
- تم تطوير معيار جديد ومبتكر لقياس أداء وكلاء الذكاء الاصطناعي (AI Agents) بدقة غير مسبوقة، من خلال اختبار 'قابلية الاستغلال' (Exploitability) في ألعاب ضخمة تحتوي على مليارات الحالات.
- لتسريع عجلة الابتكار، جعل الفريق أدواته البرمجية مفتوحة المصدر وسهلة الاستخدام، مما يفتح الباب أمام الباحثين لاستكشاف حدود جديدة في تطوير وكلاء الذكاء الاصطناعي (AI Agents) الأكثر ذكاءً وقدرة.
كشفت أبحاث جديدة شارك في تأليفها معهد ماساتشوستس للتكنولوجيا (MIT) وقُدمت في المؤتمر الدولي حول تمثيلات التعلم (ICLR) في أبريل، أن الشبكات العصبية (Neural Networks) المُدربة باستخدام خوارزميات تدرج السياسة (Policy Gradient Algorithms) يمكنها تحقيق أداء متفوق في ألعاب المعلومات غير الكاملة ومجموعها صفري (Imperfect-Information, Zero-Sum Games) المعقدة، مقارنةً بتلك التي تستفيد من المناهج التقليدية القائمة على نظرية الألعاب (Game Theory-Based Approaches). يقدم هذا العمل رؤى مهمة حول كيفية تمكن وكلاء الذكاء الاصطناعي (AI Agents) من التنقل في البيئات الاستراتيجية (Strategic Environments) حيث تكون المعلومات الكاملة غير متوفرة.
تقدم الذكاء الاصطناعي في الألعاب الاستراتيجية
يعالج البحث، الذي قاده سوبهان محمدبور وغابرييل فارينا من معهد ماساتشوستس للتكنولوجيا، بالتعاون مع باحثين من جامعة تكساس في أوستن، وجامعة كاليفورنيا في بيركلي، وجامعة كارنيجي ميلون، وجامعة نيويورك، تحديًا قديمًا في مجال الذكاء الاصطناعي: تمكين الوكلاء من اتخاذ قرارات مثلى في الألعاب ذات المعلومات المخفية (Hidden Information). على عكس ألعاب المعلومات الكاملة (Perfect-Information Games) حيث يعرف جميع اللاعبين الحالة الكاملة للعبة، تتطلب سيناريوهات المعلومات غير الكاملة، مثل البوكر أو التجسس، من الوكلاء استنتاج استراتيجيات الخصم وإدارة حالة عدم اليقين بفعالية. تركز الدراسة بشكل خاص على تدريب الشبكات العصبية (Neural Networks) للتفوق في هذه البيئات التنافسية المعقدة.
معيار جديد ونتائج مفاجئة
تُعد المساهمة المحورية لهذا البحث تطوير معيار جديد مصمم لتقييم مختلف الخوارزميات بشكل صارم لتعليم وكلاء الشبكات العصبية (Neural Network Agents) كيفية التنافس. يحدد هذا المعيار براعة الوكيل باستخدام 'قابلية الاستغلال' (Exploitability)، وهو مقياس يقيس مدى فعالية أداء اللاعب ضد الخصم في أسوأ الأحوال (Worst-Case Adversary) النظري. تشير النتيجة المثالية البالغة صفر في قابلية الاستغلال (Exploitability) إلى اللعب الخالي من العيوب. طبق الفريق هذا المعيار على خمس ألعاب مميزة ذات معلومات غير كاملة، بما في ذلك نسختين من Phantom Tic-Tac-Toe، ونسختين من Hex، ولعبة Liar's Dice. ومن الجدير بالذكر أن بعض حالات الاختبار هذه تضمنت ما يصل إلى 30 مليار من حالات اللعبة (Game States)، وهو حجم يتجاوز بكثير النطاق النموذجي لتحليل قابلية الاستغلال (Exploitability) في الأبحاث السابقة بعوامل تصل إلى 100,000 مرة.
كانت النتائج التجريبية مقنعة. فقد حققت الشبكات العصبية (Neural Networks) المُدربة باستخدام خوارزميات تدرج السياسة (Policy Gradient Methods)، التي تُطبق على مشكلات اتخاذ القرار منذ التسعينيات، درجات قابلية استغلال (Exploitability) أقل (أفضل) باستمرار. علاوة على ذلك، وفي المنافسات المباشرة وجهًا لوجه، هزمت هذه الشبكات المُدربة بتدرج السياسة (Policy Gradient-Trained Networks) بشكل قاطع نظيراتها التي اعتمدت على خوارزميات نظرية الألعاب (Game Theory-Based Algorithms).
أدوات متاحة للباحثين
لتسهيل البحث والتطوير الأوسع في هذا المجال، أتاح الفريق برنامج المقارنة المعيارية (Benchmarking Software) الخاص بهم بشكل مفتوح. وهو مصمم لسهولة الاستخدام، وقادر على العمل على أجهزة الكمبيوتر المحمولة القياسية، ويتكامل بسلاسة مع أوبن سبيل (OpenSpiel)، وهي مجموعة برامج مقارنة معيارية (Benchmarking Software) مُعتمدة على نطاق واسع في الذكاء الاصطناعي للألعاب، ولا يتطلب سوى سطر واحد من التعليمات البرمجية للتنفيذ. تهدف هذه الإمكانية إلى تسريع المزيد من الاستكشاف لفعالية نماذج التدريب (Training Paradigms) المختلفة لوكلاء الذكاء الاصطناعي (AI Agents) في البيئات الاستراتيجية المعقدة.
التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.
فريق تحرير واكب
تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.
اشترك في النشرة البريدية
احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.
قناة التليجرام
تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.
