هل تفهم الآلات اللهجة السعودية والخليجية حقاً؟ هذا ما تقوله التقييمات المنشورة عن أبرز المحرّكات الصوتية

الزبدة
- لوحة Open Universal Arabic ASR (تحديث 7 يوليو 2026) تُظهر تفوّق محرك Cohere Transcribe Arabic بفارق نحو ست نقاط عن OmniASR في اختبار Casablanca للعربية العامية، لكن دون تفصيل رقمي مستقل للهجة الخليجية أو السعودية.
- ادعاء Deepgram في يناير 2026 بأن Nova-3 Arabic يخفّض معدل خطأ الكلمة حتى 40% عبر اللهجات الخليجية وغيرها لا يرافقه نشر لأرقام WER مطلقة أو خط أساس واضح، ما يحدّ من قابليته للتحقق المستقل.
- تقرير aiXplain (مارس 2026) هو أقرب مصدر يقيّم صراحة اللهجتين الحجازية والنجدية عبر Google وAWS وWhisper وAzure، لكن نتائجه الكمية محجوبة خلف نموذج تسجيل بيانات ولم تُتَح للوصول العام.
يبحث فريق متزايد من المهندسين والباحثين العرب عن إجابة دقيقة لسؤال يبدو بسيطاً لكنه معقّد التحقق: هل تتراجع دقة محرّكات تحويل الكلام إلى نص (Speech-to-Text / ASR) فعلياً عند التعامل مع اللهجات الخليجية والسعودية مقارنة بالعربية الفصحى (MSA)، وبأي مقدار مقيس؟ الإجابة المتوفرة في الأدبيات والتقييمات المنشورة حتى الآن جزئية، ومعظمها لا يفصل الأداء على مستوى اللهجة الخليجية أو السعودية تحديداً، رغم وجود أطر قياس ولوحات صدارة (leaderboards) جادة بدأت تسد هذه الفجوة.
لوحة Open Universal Arabic ASR: تفوّق عام دون تفصيل لهجي دقيق
أحدث مصدر تقييم منهجي متاح هو لوحة الصدارة Open Universal Arabic ASR، التي جرى تحديثها في 7 يوليو 2026، وتقيس التعميم بدون تدريب مسبق على اللهجة (zero-shot multi-dialect generalization) عبر ستة مجموعات اختبار تغطي الفصحى والمصرية والخليجية والشامية والمغاربية.
وبحسب هذه اللوحة، فإن محرّك Cohere Transcribe Arabic يحقق أفضل معدل خطأ كلمة (Word Error Rate / WER) إجمالاً، ويتصدّر أربعة من أصل ستة مجموعات مهام مركّبة. وعلى وجه الخصوص، يتفوق هذا المحرك على نظام OmniASR بفارق يقارب ست نقاط مئوية كاملة في اختبار Casablanca، وهو مجموعة بيانات مخصّصة لتقييم العربية العامية المحكية عبر ثماني لهجات مختلفة.
هذا الرقم مهم لأنه أول مؤشر كمّي منشور وموثّق التاريخ يقارن بين محرّكين على بيانات لهجية حقيقية. لكن المشكلة المنهجية الجوهرية لأغراض هذا التحليل هي أن تقرير اللوحة لا يفصّل أرقام WER الخاصة باللهجة الخليجية أو السعودية بمعزل عن باقي اللهجات ضمن مجموعة Casablanca أو غيرها. بعبارة أخرى، النتيجة الإجمالية موجودة، لكن التفكيك على مستوى اللهجة الفرعية غائب في المصادر المتاحة حالياً، ما يجعل أي استنتاج حول أداء الخليجية تحديداً استنتاجاً استقرائياً غير مؤكد، لا رقماً مثبتاً.
ادعاءات الشركات التجارية: أرقام تسويقية بلا تفصيل تقني كافٍ
على الجانب التجاري، أعلنت شركة Deepgram في يناير 2026 عن إصدار Nova-3 Arabic، مدّعية أنه يحقق أدنى معدلات خطأ كلمة عبر اللهجات الخليجية والفصحى والمصرية والشامية، متفوقاً على جميع المنافسين الرئيسيين، مع تخفيض يصل إلى نحو 40% في معدل خطأ الكلمة مقارنة بالأنظمة المنافسة.
هذا الادعاء يستحق قراءة نقدية من زاويتين تقنيتين:
غياب الأرقام المطلقة: النسبة المئوية للتحسّن (~40%) نسبية إلى خط أساس (baseline) غير محدد بدقة في المصادر المتاحة؛ فتحسّن بنسبة 40% على معدل WER أساسي مرتفع (لنقل 45%) يعني نتيجة نهائية مختلفة جذرياً عن نفس النسبة مطبّقة على خط أساس منخفض (لنقل 15%).
عدم فصل اللهجة الخليجية عن السعودية تحديداً: الادعاء التسويقي يذكر "الخليجية" كفئة واحدة، بينما من المعروف تقنياً أن اللهجة الخليجية نفسها غير متجانسة صوتياً ومعجمياً؛ فالنجدية والحجازية داخل السعودية وحدها تختلفان صوتياً بشكل ملحوظ عن اللهجات الخليجية الساحلية (الكويتية، الإماراتية، القطرية)، ما يجعل تجميعها في فئة واحدة عند القياس مصدر تشويش إحصائي (statistical aggregation bias) يخفي فروقات الأداء الحقيقية بين اللهجات الفرعية.
إطار Arab Voices: بنية تحتية للقياس، لا نتائج جاهزة بعد
على مستوى البنية التحتية البحثية، برز إطار Arab Voices كمحاولة لتوحيد قياس أداء أنظمة التعرف الآلي على الكلام (Automatic Speech Recognition) للعربية اللهجية. يوفر هذا الإطار وصولاً موحّداً إلى 31 مجموعة بيانات (datasets) تغطي 14 لهجة عربية، مع بيانات وصفية منسّقة (harmonized metadata) وأدوات تقييم (evaluation utilities) قياسية.
أهمية هذا الإطار تكمن في أنه يحل مشكلة منهجية شائعة في تقييم ASR العربي: تشتت مجموعات البيانات وتباين بروتوكولات القياس بين الأوراق البحثية، ما يجعل المقارنات بين الدراسات المختلفة غير قابلة للمطابقة المباشرة (apples-to-apples comparison). لكن حتى تاريخ آخر تحديث بحثي متاح، لم تُنشر ضمن الإطار عينة نتائج محدّدة تفصل أداء اللهجة الخليجية أو السعودية عن باقي اللهجات الأربع عشرة في مصادر تعود لآخر ثلاثين يوماً. وجود الإطار شرط ضروري لإنتاج مقارنات موثوقة مستقبلاً، لكنه ليس بديلاً عن نتائج منشورة فعلياً.
الفجوة الأكثر دلالة: تقرير aiXplain وقيود الوصول
أشار تقرير صادر عن aiXplain في مارس 2026 إلى تقييم صريح للهجتين الحجازية والنجدية، وهما اللهجتان الفرعيتان الأكثر ارتباطاً بالسعودية تحديداً، عبر مزوّدين رئيسيين هم GoogleAWS، وWhisper (OpenAI)، وAzure (Microsoft). هذا التقرير هو أقرب مصدر منشور إلى الإجابة المباشرة عن سؤال أداء اللهجات السعودية تحديداً بأرقام WER مفصّلة لكل مزوّد.
غير أن تفاصيل معدلات الخطأ الكمية محجوبة خلف نموذج تسجيل بيانات (download form) ولم تكن متاحة للوصول المباشر ضمن نطاق هذا البحث. هذا القيد بحد ذاته دلالة مهمة على واقع السوق: البيانات الأكثر تحديداً حول أداء اللهجات السعودية موجودة، لكنها محتكرة تجارياً أو مقيّدة الوصول، وليست جزءاً من الأدبيات المفتوحة القابلة للتدقيق العلمي (peer-reviewable) في هذه المرحلة.
التبعات التقنية لغياب القياس المفصّل
بالنظر إلى ما سبق، يمكن استخلاص عدة تبعات عملية للمهندسين الذين يبنون أنظمة تعتمد على ASR للسوق السعودي أو الخليجي:
لا يمكن الاعتماد على الادعاءات التسويقية العامة (مثل نسب التحسن الإجمالية لدى Deepgram) لاتخاذ قرارات هندسة الإنتاج دون تحقق مستقل على بيانات تمثيلية للهجة المستهدفة الفعلية، نظراً لغياب خط الأساس والتفصيل اللهجي.
الفجوة بين "الخليجية" كفئة تصنيف واسعة والفروقات الصوتية الدقيقة بين اللهجات الفرعية (النجدية، الحجازية، الشمالية، الجنوبية داخل السعودية وحدها) تعني أن أي معدل WER مجمّع للهجة "الخليجية" قد يخفي تبايناً كبيراً في الأداء الفعلي على مستوى لهجة محدّدة يستخدمها المستخدم النهائي.
أطر مثل Arab Voices ولوحات مثل Open Universal Arabic ASR تمثل الاتجاه الصحيح منهجياً، لكن نضجها كمصدر مرجعي شامل يتطلب نشر نتائج مفصّلة على مستوى اللهجة الفرعية، وهو ما لم يتحقق بعد في المصادر المؤرخة المتاحة حتى الآن.
خلاصة الموقف الحالي أن الأدلة المنشورة تسمح بترتيب نسبي عام بين بعض المحرّكات (تصدّر Cohere Transcribe Arabic في لوحة يوليو 2026 مثالاً)، لكنها لا تسمح بعد بجزم كمّي دقيق حول حجم الفجوة بين أداء الفصحى وأداء اللهجة الخليجية أو السعودية تحديداً بأرقام WER قابلة للاستشهاد المباشر. أي ادعاء بخلاف ذلك، من مصدر تجاري أو غير تجاري، ينبغي التعامل معه بوصفه غير مؤكد حتى تتوفر أرقام مفصّلة ومنهجية قياس شفافة.
فريق تحرير واكب
تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.
اشترك في النشرة البريدية
احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.
قناة التليجرام
تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.
