أربع اختبارات جديدة تكشف حجم الغموض الحقيقي في "تفكير" النماذج اللغوية الكبيرة

LLMsResearch
صورة توضيحية مُولّدة بالذكاء الاصطناعي: Editorial image for Four New Benchmarks Expose How Little We Actually Know About What LLMs Are "Thinking"

الزبدة

  • روبوتات المحادثة تفشل بشكل صادم في تقديم نصائح صحية تراعي الثقافة المحلية، والحالة الأفغانية توضح ذلك بقسوة: 8.8% فقط من الردود كانت ملائمة ثقافياً
  • نماذج 'كلود' تنحاز بوضوح نحو الإجابة بـ'لا' حسب ترتيب الأسئلة في القرارات الأخلاقية، بينما تظهر 'جي بي تي-5.5' و'جيميناي' حياداً تاماً تقريباً من هذا الخلل
  • 'شهادة سؤال البحث' ترفع جودة أبحاث وكلاء الذكاء الاصطناعي من 4.38 إلى 4.86 من 5، لكن إزالتها تُسقط الأداء إلى ما دون 1 من 5، وهو دليل قوي على أن البنية المنظّمة للتفكير هي الفارق الحقيقي لا قوة النموذج نفسه

مريض أفغاني يسأل روبوت محادثة عن نصيحة صحية، فيحصل على إجابة تراعي خصوصيته الثقافية في 8.8% فقط من الحالات. هذا الرقم الوحيد، المدفون داخل اختبار جديد يُدعى "سي سي بنش-هيلث" (CCBench-Health)، يلخّص فكرة تتردد في مجموعة أبحاث نُشرت على أرشيف الأبحاث العلمية (arXiv) بين أواخر يونيو وبداية يوليو 2026: النماذج اللغوية الكبيرة (Large Language Models) أقل موضوعية بكثير في وصف تفكيرها الداخلي وقيمها وحساسيتها الثقافية مما توحي به لغتها الطليقة.

اختبار "سي سي بنش-هيلث"، الموصوف في الورقة البحثية arXiv:2607.05405، يخرج عن العادة السائدة في معاملة "الثقافة" كصفة ثابتة تُلصق بالمستخدم. بدلاً من ذلك، يتعامل مع الثقافة كطيف من درجات الالتزام بالمعايير الاجتماعية. يعتمد الاختبار على 60 شخصية افتراضية (Personas) مبنية على ملفات ثقافية حقيقية من ست دول، تخضع كل منها لـ18 محادثة، ثم تُقرن بـ52 سؤالاً صحياً حقيقياً مأخوذاً من منتديات المستخدمين، لتنتج 3120 تفاعلاً مختلفاً. من بين خمسة نماذج رائدة خضعت للاختبار، لم يتجاوز أفضلها نسبة 20 إلى 30% في تقديم ردود ملائمة ثقافياً. وحين طُلب من النماذج التفكير بوضوح في الإشارات الثقافية عبر تقنية "سلسلة التفكير" (Chain-of-Thought)، تحسّن الأداء، لكن بشكل طفيف لا يتجاوز 3 إلى 5 نقاط بالمئة في المتوسط. والأكثر لفتاً للنظر هو التناقض الذي رصده الباحثون: تعاملت النماذج بشكل أفضل مع الشخصيات التي تجاهلت معاييرها الثقافية الخاصة مقارنة بتلك التي التزمت بها، وهو نمط تقرأه الورقة البحثية كدليل على أن التحيزات المدمجة داخل النموذج تتغلب على أي تكيّف ثقافي حقيقي.

هل يتغير الحكم الأخلاقي بتغير الصياغة؟

ورقة بحثية منفصلة للباحث هاونان هوانغ من جامعة برينستون، نُشرت في 6 يوليو (arXiv:2607.05552)، تتعمق في سؤال أضيق نطاقاً لكنه لا يقل إثارة للقلق: هل تتبدل الأحكام الأخلاقية للنماذج بحسب طريقة صياغة السؤال؟ باستخدام منهجية قياس نفسي جديدة تُدعى "التماثل المتقاطع" (Crossed Symmetrization)، تفصل أثر الصياغة والمنطق وترتيب الإجابات عن القناعة الحقيقية للنموذج، وجد هوانغ أن النماذج المتقدمة تحافظ في معظمها على اتساق داخلي، بدرجات تضارب لا تتجاوز 0.12 إلى 0.21 على مقياس يمتد من -1 إلى 1. لكن نماذج "كلود" (Claude) تمثل استثناءً واضحاً، فهي تنحاز بقوة نحو الإجابة بـ"لا" وتُظهر حساسية لافتة لترتيب الإجابات، بدرجات تحيّز تتراوح بين -0.32 و-0.86 حسب السيناريو. في المقابل، تُظهر نماذج "جي بي تي-5.5" (GPT-5.5) و"جيميناي" (Gemini) خللاً شبه معدوم من هذا النوع، ويتراجع التحيّز أكثر عندما تُعطى النماذج مساحة أوسع للتفكير الموسّع.

آلية الخطأ لا مجرد أعراضه

ورقتان بحثيتان أخريان تتناولان الآلية الكامنة خلف هذه السلوكيات، لا مظاهرها السطحية فقط. الأولى (arXiv:2606.27679) تدرس تقنيات "تقدير عدم اليقين" (Uncertainty Estimation) القائمة على "المجسّات" (Probes)، وهي أساليب تقرأ الحالات الداخلية الخفية للنموذج أو أنماط الانتباه (Attention) لرصد الهلوسة (Hallucination) المحتملة. تُظهر الدراسة أن هذه المجسّات تعمل بكفاءة داخل نطاق البيانات المدرَّبة عليها، لكن أداءها يتراجع بشدة عند حدوث "انزياح في التوزيع" (Distribution Shift). وتقترح الورقة مجسّات مُدرَّبة مسبقاً تنتقل بكفاءة إلى مهام التوليد الواقعي المفتوح، في خطوة نحو تقييمات تعكس ظروف الاستخدام الفعلي بدلاً من بيئة المختبر المعزولة.

أما الورقة الثانية، "فيرست ريسيرش" (FirstResearch) (arXiv:2607.05682)، فتستهدف عنق زجاجة مختلفاً تماماً: كيف تصوغ وكلاء الذكاء الاصطناعي (AI Agents) أسئلة بحثية جيدة من الأساس. إسهامها الجوهري هو "شهادة سؤال البحث" (Research Question Certificate)، التي تُلزم الوكيل بتحديد التعريفات والفروض، وتوضيح تناقض قابل للاختبار، وصياغة فرضية قابلة للتفنيد قبل الشروع في أي عمل. عند تجربتها على عشرة مواضيع بحثية لوكلاء نماذج لغوية كبيرة، سجّل "فيرست ريسيرش" 4.86 من 5 وفق تحكيم نموذج "ديب سيك" (DeepSeek) وتحكيم مستقل من "جيميناي-2.5-فلاش"، بمعامل ارتباط بيرسون بلغ 0.865، مقابل 4.38 من 5 لأفضل نموذج مرجعي منافس. وحين يُنزع مكوّن الشهادة، تنهار النتائج إلى أقل من 1 من 5، في دليل صارخ على أن هياكل التفكير المنظّم، لا القدرة الخام للنموذج، هي التي تقوم بالعمل الأثقل.

التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.

  1. 1FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agentsarxiv.org
  2. 2From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Modelsarxiv.org
  3. 3The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selectionarxiv.org
  4. 4Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim Verificationarxiv.org
  5. 5Narrative-UFET: Narrative Generation for Ultra-Fine Entity Typingarxiv.org
  6. 6Enhancing Numerical Prediction in LLMs via Smooth MMD Alignmentarxiv.org
  7. 7Can LLMs Judge Better Than They Generate? Evaluating Task Asymmetry, Mechanistic Interpretability and Transferability for In-Context QAarxiv.org
  8. 8ELF: Embedded Language Flowsarxiv.org
  9. 9The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgmentarxiv.org
  10. 10Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Trainingarxiv.org
  11. 11Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answeringarxiv.org
  12. 12A Study of Temporal Fusion Strategies for Named Entity Recognition in Historical Textsarxiv.org
  13. 13BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulationarxiv.org
  14. 14Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Modelsarxiv.org
  15. 15Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearningarxiv.org
  16. 16CCBENCH: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queriesarxiv.org
  17. 17Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generationarxiv.org
  18. 18NLL-Guided Full-Attention Layer Selection for Training-Free Sliding-Window Adaptationarxiv.org
  19. 19Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuningarxiv.org
  20. 20Position Bias Correction is Insufficient for One-Pass Attention Sortingarxiv.org
  21. 21SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented Generationarxiv.org
  22. 22MultiHashFormer: Hash-based Generative Language Modelsarxiv.org
  23. 23HistoriQA-ThirdRepublic: Multi-Hop Question Answering Corpus for Historical Research, Parliamentary Debates from the French Third Republic (1870-1940)arxiv.org
واكب

فريق تحرير واكب

تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.

اشترك في النشرة البريدية

احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.

قناة التليجرام

تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.

انضم إلينا على تليجرام

المزيد من الأبحاث

عرض الكل في الأبحاث