Kyutai وMirelo تطرحان MuScriptor: نموذج Transformer مفتوح يحوّل الصوت الخام إلى ملفات MIDI

الزبدة
- Kyutai وMirelo تطلقان MuScriptor، نموذج ذكاء اصطناعي مفتوح يحوّل أي تسجيل صوتي إلى نوتات MIDI دقيقة تحدد كل آلة موسيقية على حدة
- النسخة الكبيرة من النموذج ضربت رقمًا قياسيًا بتحقيق دقة تتجاوز ضعف أقوى نموذج مفتوح سابق (YourMT3+) في تفريغ الموسيقى متعددة الآلات
- الكود مجاني للاستخدام التجاري بترخيص MIT، لكن أوزان النموذج نفسها محصورة بالاستخدام البحثي فقط عبر ترخيص CC BY-NC 4.0
دخلت Kyutai في شراكة مع Mirelo لإطلاق MuScriptor، نموذج محوّل من نوع فك التشفير فقط (Decoder-only Transformer) بأوزان مفتوحة، صُمم خصيصًا لتفريغ الموسيقى متعددة الآلات (Multi-instrument Music Transcription) وتحويل التسجيلات الصوتية مباشرة إلى ملفات MIDI. النموذج متاح الآن على منصة Hugging Face بثلاثة أحجام: نسخة صغيرة بـ103 مليون معامل (Parameters)، ونسخة متوسطة بـ307 مليون معامل معتمدة كخيار افتراضي، ونسخة كبيرة بـ1.4 مليار معامل تستهدف أعلى درجات الدقة.
يعمل MuScriptor عبر قراءة أطياف ميل (Mel-spectrograms) مستخرجة من مقاطع صوتية قصيرة، ثم يُولّد بشكل تسلسلي تلقائي (Autoregressive) رموزًا شبيهة بصيغة MIDI تُرمّز درجة الصوت والتوقيت وهوية الآلة الموسيقية. يعتمد النموذج في ذلك على مخطط ترميز MT3، وهي صيغة سبق اعتمادها في أبحاث التفريغ الموسيقي، وتسمح للنموذج بإخراج أحداث نوتات موسيقية منظمة بدلًا من الموجات الصوتية الخام أو صور لفافة البيانو (Piano-roll).
تفوّق ملموس على YourMT3+
النتيجة الأبرز جاءت من النسخة الكبيرة، التي حققت درجة Multi F1 بلغت 48.2 على مجموعة اختبار D_Test المكوّنة من 372 مقطوعة مخصصة للتقييم فقط. هذا الرقم يتجاوز ضعف درجة 21.9 التي سجّلها YourMT3+، الذي كان يُعد من أقوى النماذج المفتوحة المصدر في هذا المجال. الفارق الكبير يشير إلى أن MuScriptor ليس مجرد تحسين تدريجي، بل نقلة نوعية في قدرة نموذج واحد على فصل وتدوين آلات متعددة تُعزف في آنٍ واحد، وهي مهمة صعبة تاريخيًا لأن الأخطاء في درجة الصوت والتوقيت وتصنيف الآلة تتراكم بسرعة وتُفسد النتيجة النهائية.
مسار تدريب على ثلاث مراحل
يعود التحسن في الأداء إلى خطة تدريب مدروسة بعناية على ثلاث مراحل متتالية. تبدأ العملية بتدريب مسبق (Pre-training) على D_Synth، وهي مجموعة بيانات تركيبية تضم حوالي 1.45 مليون ملف MIDI، تمنح النموذج فهمًا واسعًا لأنماط النوتات قبل تعرّضه لأي تسجيل صوتي حقيقي. بعد ذلك يخضع النموذج لضبط دقيق (Fine-tuning) على D_Real، مجموعة بيانات تضم 170 ألف تسجيل بإجمالي يتجاوز 11 ألف ساعة، كل منها مرفق بتعليقات توضيحية على مستوى النوتة الفردية مستمدة من صوت حقيقي.
المرحلة الأخيرة تضيف تعلمًا معززًا (Reinforcement Learning) على D_RL، مجموعة أصغر تضم 300 مقطوعة تم التحقق منها يدويًا. استخدم فريق Kyutai أسلوبًا شبيهًا بـGRPO، يجمع بين خوارزمية REINFORCE وتقنية تسوية الميزة النسبية للمجموعة (Group-relative Advantage Normalization)، حيث تتكوّن إشارة المكافأة من جمع ثلاث درجات F منفصلة تقيس دقة بداية النوتة ومنتصفها ونهايتها. هذه المرحلة من التعلم المعزز مصممة خصيصًا لصقل دقة التوقيت التي يصعب على الضبط الدقيق الخاضع للإشراف وحده تحقيقها بالكامل.
ترخيص مزدوج بين الكود والأوزان
تفصل Kyutai وMirelo بوضوح بين كود الاستدلال (Inference Code) وأوزان النموذج. الكود يصدر بموجب ترخيص MIT المرن، مما يتيح للمطورين دمجه وتعديله وإعادة توزيعه بحرية كاملة. أما الأوزان نفسها فتصدر بموجب ترخيص CC BY-NC 4.0، الذي يمنع الاستخدام التجاري دون الحصول على ترخيص منفصل. هذا التقسيم يفتح الباب للباحثين والهواة للتجربة بحرية، بينما تحتفظ Kyutai وMirelo بالسيطرة على أي نشر تجاري للنماذج المدربة مسبقًا، وهو نمط شائع بين المعامل البحثية التي توازن بين الانفتاح العلمي وخطط تحقيق الدخل مستقبلًا.
في مجال اعتاد على الاختيار بين برمجيات تفريغ موسيقي مملوكة وباهظة التكلفة أو نماذج مفتوحة المصدر أضعف بكثير في دقة التعامل مع الآلات المتعددة، يمنح تفوّق MuScriptor على YourMT3+ المطورين المستقلين والباحثين في الصوتيات نقطة انطلاق مفتوحة أقوى بكثير للبناء عليها.
التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.
فريق تحرير واكب
تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.
اشترك في النشرة البريدية
احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.
قناة التليجرام
تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.
