LLMs٢٢ يوليو ٢٠٢٦
معيار قياس جديد يفضح نقطة ضعف خطيرة في وكلاء الذكاء الاصطناعي: تذكّر تنفيذ المهام لاحقاً
أقوى وكيل ذكاء اصطناعي مبني على GPT-5.4 لم يتجاوز نسبة 65.1% في اختبار جديد يقيس قدرته على تذكّر تنفيذ مهام مؤجلة، وهي فجوة كبيرة عن الأداء البشري الطبيعي.
اقرأ المقال

















