نموذج "Qwen-Audio-3.0-TTS" من علي بابا يتصدر تصنيفات تحويل النص إلى كلام

LLMsDeveloper Tools
صورة توضيحية مُولّدة بالذكاء الاصطناعي: Editorial image for Alibaba's Qwen-Audio-3.0-TTS Takes the Top Spot in Text-to-Speech Rankings

الزبدة

  • علي بابا تتصدر عالم الأصوات الرقمية: نموذج Qwen-Audio-3.0-TTS-Plus حقق أعلى درجة إيلو (1,236) في تصنيف Artificial Analysis، متجاوزًا كل المنافسين التجاريين المعروفين.
  • نسختان بشخصيتين مختلفتين: Flash سريعة البرق للمحادثات الفورية بزمن استجابة 300 ميلي ثانية فقط، وPlus أدق في تقليد الصوت الأصلي واستنساخه، حتى مع تسجيلات مليئة بالضجيج أو الصدى.
  • الجودة العالية لها ثمن: نسخة Plus تولّد النص بسرعة 16 حرفًا في الثانية فقط، أي أبطأ بمراحل من منافسين مثل Sonic 3.5، والوصول إليها متاح فقط عبر استضافة علي بابا السحابية بسعر 27.60 دولارًا لكل مليون حرف.

صار رقم 1,236 هو المعيار الجديد الذي يتعين على أي نموذج صوتي تجاوزه. هذه هي درجة "إيلو" (Elo Score) التي حققها نموذج "Qwen-Audio-3.0-TTS-Plus" التابع لعلي بابا، لينتزع المركز الأول بين نماذج مزودي الخدمة في تصنيف "Artificial Analysis" لتحويل النص إلى كلام (Text-to-Speech)، متقدمًا على حشد من المنافسين التجاريين في هذا المجال.

النموذج الجديد من مختبر "تونغيي" (Tongyi Lab) لا يُطرح كأوزان مفتوحة (Open Weights) قابلة للتحميل، بل يُستضاف بشكل حصري عبر منصة "Alibaba Cloud Model Studio". ويأتي في نسختين مصممتين لمهام مختلفة: نسخة "Flash" الموجهة للتطبيقات الفورية، بزمن استجابة (Latency) يقارب 300 ميلي ثانية، ونسخة "Plus" المضبوطة لصالح جودة المخرجات على حساب السرعة. وتدعم النسختان 16 لغة، من بينها العربية والإنجليزية والصينية واليابانية والكورية والفرنسية والألمانية والإسبانية والبرتغالية والروسية والإيطالية والإندونيسية والماليزية والتايلاندية والفيتنامية والتاغالوغية، إضافة إلى 20 لهجة صينية إقليمية، وهو تنوع يرشّح النموذج للانتشار العالمي بدلًا من استهداف سوق واحدة.

الدقة في مقابل الحفاظ على هوية المتحدث

على مستوى معدل الخطأ في الكلمات والحروف (WER/CER)، وهو المقياس المعتمد لتقييم دقة النظام في نقل النص المنطوق، تتقدم نسخة "Flash" فعليًا على شقيقتها بتسجيلها 3.87 مقابل 3.96 لنسخة "Plus" في الاختبارات متعددة اللغات. لكن "Plus" تستعيد الصدارة في معيار تشابه الصوت مع المتحدث الأصلي (Speaker Similarity)، بمعدل 82.75 عبر جميع اللغات الست عشرة، مقارنة بـ80.44 لـ"Flash"، أي أنها أكثر قدرة على الحفاظ على الهوية الصوتية للمتحدث المستنسخ أو المرجعي. هذا التباين يعكس فلسفة تصميم كل نموذج: "Flash" تتنازل عن جزء من الدقة لصالح السرعة التفاعلية، بينما تعطي "Plus" الأولوية للطبيعية والاتساق المطلوبين في إنتاج المحتوى.

استنساخ الصوت (Voice Cloning) ميزة أساسية في النسختين، ويقول مختبر "تونغيي" إن النظام يتعامل الآن بموثوقية أكبر مع التسجيلات المرجعية التي تحتوي على ضجيج أو صدى مقارنة بإصدارات "Qwen" الصوتية السابقة، وهي إضافة عملية لمن يعمل بتسجيلات مصدرية غير مثالية بعيدًا عن جودة الاستوديو. كما يستطيع المطورون التحكم في طريقة الأداء الصوتي عبر أوامر باللغة الطبيعية أو عبر وسوم نصية مضمّنة، مثل وضع علامة [angry] أو [giggles] على سطر معين، مما يمنحهم تحكمًا أدق في النغمة العاطفية دون الحاجة لإعادة التدريب أو الضبط الدقيق (Fine-tuning).

مقايضة زمن الاستجابة

لم يأتِ التصدر في الجودة مجانًا على صعيد سرعة المعالجة الخام. فنموذج "Qwen-Audio-3.0-TTS-Plus" يعالج النص بمعدل يقارب 16 حرفًا في الثانية، وهو معدل متأخر بوضوح عن منافسين مثل "Sonic 3.5" الذي يبلغ 120 حرفًا في الثانية، و"Simba 3.2" عند 30.2 حرفًا في الثانية. وبالنسبة لأعباء العمل التي تتطلب توليدًا سريعًا وبكميات كبيرة، قد تكون هذه الفجوة أكثر أهمية من موقع النموذج في التصنيفات.

من الناحية التقنية، يعتمد النموذج على مُرمِّز كلام (Speech Tokenizer) منخفض معدل الإطارات بتردد 12.5 هرتز، مقترنًا بخط أنابيب تدريب تدريجي (Progressive Training Pipeline) من خمس مراحل يجمع بين مكونات النموذج اللغوي (Language Model) ومطابقة التدفق (Flow-Matching)، وهو خيار معماري يهدف إلى تحقيق توازن بين الدقة اللغوية وطبيعية النغمة الصوتية (Prosody). ويدعم النموذج أيضًا التوليد بمرحلة واحدة (One-Pass Synthesis) لمقاطع صوتية تصل مدتها إلى ثلاث دقائق، ويتضمن تقنية تحسين دقة الصوت (Vocoder Super-Resolution) لإخراج بجودة 48 كيلوهرتز، مفيدة لإنتاج صوتي جاهز دون الحاجة لمعالجة لاحقة لرفع الجودة.

يتم الوصول إلى النموذج عبر "Alibaba Cloud Model Studio" بسعر 27.60 دولارًا لكل مليون حرف بالنسبة لنسخة "Plus"، ما يضعه في خانة الخيار المتميز والمستضاف حصريًا للفرق التي تُقدّم جودة الصوت والتغطية متعددة اللغات على سرعة التوليد أو مرونة الاستضافة الذاتية.

واكب

فريق تحرير واكب

تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.

اشترك في النشرة البريدية

احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.

قناة التليجرام

تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.

انضم إلينا على تليجرام