أربع اختبارات جديدة تكشف حجم الغموض الحقيقي في "تفكير" النماذج اللغوية الكبيرة

الزبدة
- روبوتات المحادثة تفشل بشكل صادم في تقديم نصائح صحية تراعي الثقافة المحلية، والحالة الأفغانية توضح ذلك بقسوة: 8.8% فقط من الردود كانت ملائمة ثقافياً
- نماذج 'كلود' تنحاز بوضوح نحو الإجابة بـ'لا' حسب ترتيب الأسئلة في القرارات الأخلاقية، بينما تظهر 'جي بي تي-5.5' و'جيميناي' حياداً تاماً تقريباً من هذا الخلل
- 'شهادة سؤال البحث' ترفع جودة أبحاث وكلاء الذكاء الاصطناعي من 4.38 إلى 4.86 من 5، لكن إزالتها تُسقط الأداء إلى ما دون 1 من 5، وهو دليل قوي على أن البنية المنظّمة للتفكير هي الفارق الحقيقي لا قوة النموذج نفسه
مريض أفغاني يسأل روبوت محادثة عن نصيحة صحية، فيحصل على إجابة تراعي خصوصيته الثقافية في 8.8% فقط من الحالات. هذا الرقم الوحيد، المدفون داخل اختبار جديد يُدعى "سي سي بنش-هيلث" (CCBench-Health)، يلخّص فكرة تتردد في مجموعة أبحاث نُشرت على أرشيف الأبحاث العلمية (arXiv) بين أواخر يونيو وبداية يوليو 2026: النماذج اللغوية الكبيرة (Large Language Models) أقل موضوعية بكثير في وصف تفكيرها الداخلي وقيمها وحساسيتها الثقافية مما توحي به لغتها الطليقة.
اختبار "سي سي بنش-هيلث"، الموصوف في الورقة البحثية arXiv:2607.05405، يخرج عن العادة السائدة في معاملة "الثقافة" كصفة ثابتة تُلصق بالمستخدم. بدلاً من ذلك، يتعامل مع الثقافة كطيف من درجات الالتزام بالمعايير الاجتماعية. يعتمد الاختبار على 60 شخصية افتراضية (Personas) مبنية على ملفات ثقافية حقيقية من ست دول، تخضع كل منها لـ18 محادثة، ثم تُقرن بـ52 سؤالاً صحياً حقيقياً مأخوذاً من منتديات المستخدمين، لتنتج 3120 تفاعلاً مختلفاً. من بين خمسة نماذج رائدة خضعت للاختبار، لم يتجاوز أفضلها نسبة 20 إلى 30% في تقديم ردود ملائمة ثقافياً. وحين طُلب من النماذج التفكير بوضوح في الإشارات الثقافية عبر تقنية "سلسلة التفكير" (Chain-of-Thought)، تحسّن الأداء، لكن بشكل طفيف لا يتجاوز 3 إلى 5 نقاط بالمئة في المتوسط. والأكثر لفتاً للنظر هو التناقض الذي رصده الباحثون: تعاملت النماذج بشكل أفضل مع الشخصيات التي تجاهلت معاييرها الثقافية الخاصة مقارنة بتلك التي التزمت بها، وهو نمط تقرأه الورقة البحثية كدليل على أن التحيزات المدمجة داخل النموذج تتغلب على أي تكيّف ثقافي حقيقي.
هل يتغير الحكم الأخلاقي بتغير الصياغة؟
ورقة بحثية منفصلة للباحث هاونان هوانغ من جامعة برينستون، نُشرت في 6 يوليو (arXiv:2607.05552)، تتعمق في سؤال أضيق نطاقاً لكنه لا يقل إثارة للقلق: هل تتبدل الأحكام الأخلاقية للنماذج بحسب طريقة صياغة السؤال؟ باستخدام منهجية قياس نفسي جديدة تُدعى "التماثل المتقاطع" (Crossed Symmetrization)، تفصل أثر الصياغة والمنطق وترتيب الإجابات عن القناعة الحقيقية للنموذج، وجد هوانغ أن النماذج المتقدمة تحافظ في معظمها على اتساق داخلي، بدرجات تضارب لا تتجاوز 0.12 إلى 0.21 على مقياس يمتد من -1 إلى 1. لكن نماذج "كلود" (Claude) تمثل استثناءً واضحاً، فهي تنحاز بقوة نحو الإجابة بـ"لا" وتُظهر حساسية لافتة لترتيب الإجابات، بدرجات تحيّز تتراوح بين -0.32 و-0.86 حسب السيناريو. في المقابل، تُظهر نماذج "جي بي تي-5.5" (GPT-5.5) و"جيميناي" (Gemini) خللاً شبه معدوم من هذا النوع، ويتراجع التحيّز أكثر عندما تُعطى النماذج مساحة أوسع للتفكير الموسّع.
آلية الخطأ لا مجرد أعراضه
ورقتان بحثيتان أخريان تتناولان الآلية الكامنة خلف هذه السلوكيات، لا مظاهرها السطحية فقط. الأولى (arXiv:2606.27679) تدرس تقنيات "تقدير عدم اليقين" (Uncertainty Estimation) القائمة على "المجسّات" (Probes)، وهي أساليب تقرأ الحالات الداخلية الخفية للنموذج أو أنماط الانتباه (Attention) لرصد الهلوسة (Hallucination) المحتملة. تُظهر الدراسة أن هذه المجسّات تعمل بكفاءة داخل نطاق البيانات المدرَّبة عليها، لكن أداءها يتراجع بشدة عند حدوث "انزياح في التوزيع" (Distribution Shift). وتقترح الورقة مجسّات مُدرَّبة مسبقاً تنتقل بكفاءة إلى مهام التوليد الواقعي المفتوح، في خطوة نحو تقييمات تعكس ظروف الاستخدام الفعلي بدلاً من بيئة المختبر المعزولة.
أما الورقة الثانية، "فيرست ريسيرش" (FirstResearch) (arXiv:2607.05682)، فتستهدف عنق زجاجة مختلفاً تماماً: كيف تصوغ وكلاء الذكاء الاصطناعي (AI Agents) أسئلة بحثية جيدة من الأساس. إسهامها الجوهري هو "شهادة سؤال البحث" (Research Question Certificate)، التي تُلزم الوكيل بتحديد التعريفات والفروض، وتوضيح تناقض قابل للاختبار، وصياغة فرضية قابلة للتفنيد قبل الشروع في أي عمل. عند تجربتها على عشرة مواضيع بحثية لوكلاء نماذج لغوية كبيرة، سجّل "فيرست ريسيرش" 4.86 من 5 وفق تحكيم نموذج "ديب سيك" (DeepSeek) وتحكيم مستقل من "جيميناي-2.5-فلاش"، بمعامل ارتباط بيرسون بلغ 0.865، مقابل 4.38 من 5 لأفضل نموذج مرجعي منافس. وحين يُنزع مكوّن الشهادة، تنهار النتائج إلى أقل من 1 من 5، في دليل صارخ على أن هياكل التفكير المنظّم، لا القدرة الخام للنموذج، هي التي تقوم بالعمل الأثقل.
التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.
- 1FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agentsarxiv.org
- 2From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Modelsarxiv.org
- 3The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selectionarxiv.org
- 4Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim Verificationarxiv.org
- 5Narrative-UFET: Narrative Generation for Ultra-Fine Entity Typingarxiv.org
- 6Enhancing Numerical Prediction in LLMs via Smooth MMD Alignmentarxiv.org
- 7Can LLMs Judge Better Than They Generate? Evaluating Task Asymmetry, Mechanistic Interpretability and Transferability for In-Context QAarxiv.org
- 8ELF: Embedded Language Flowsarxiv.org
- 9The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgmentarxiv.org
- 10Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Trainingarxiv.org
- 11Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answeringarxiv.org
- 12A Study of Temporal Fusion Strategies for Named Entity Recognition in Historical Textsarxiv.org
- 13BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulationarxiv.org
- 14Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Modelsarxiv.org
- 15Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearningarxiv.org
- 16CCBENCH: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queriesarxiv.org
- 17Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generationarxiv.org
- 18NLL-Guided Full-Attention Layer Selection for Training-Free Sliding-Window Adaptationarxiv.org
- 19Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuningarxiv.org
- 20Position Bias Correction is Insufficient for One-Pass Attention Sortingarxiv.org
- 21SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented Generationarxiv.org
- 22MultiHashFormer: Hash-based Generative Language Modelsarxiv.org
- 23HistoriQA-ThirdRepublic: Multi-Hop Question Answering Corpus for Historical Research, Parliamentary Debates from the French Third Republic (1870-1940)arxiv.org
فريق تحرير واكب
تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.
اشترك في النشرة البريدية
احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.
قناة التليجرام
تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.
