فلوكس 3 من Black Forest Labs: فيديو بالذكاء الاصطناعي مع صوت أصلي متزامن

LLMsAI Agents
صورة توضيحية مُولّدة بالذكاء الاصطناعي لهذا المقال

الزبدة

  • Black Forest Labs تطلق Flux 3، أول نموذج من سلسلتها يولّد فيديو بصوت أصلي متزامن مباشرة، بمقاطع تصل إلى 20 ثانية دون أي معالجة صوتية لاحقة
  • نتائج داخلية غير مستقلة تقول إن Flux 3 يتفوق على منافسين بارزين مثل Luma Ray 3.2 بنسبة 93% و Runway Gen-4.5 بنسبة 77%، لكن BFL نفسها تصف هذه الأرقام بالأولية وغير المؤكدة من طرف ثالث
  • نسخة روبوتية باسم Flux-mimic تُجرَّب فعلياً على خطوط تصنيع أودي، بينما يبدأ سعر توليد الفيديو من 0.06 دولار للثانية ويصل إلى 0.53 دولار حسب الجودة ونوع التحويل

أطلقت Black Forest Labs نموذجها الجديد Flux 3، وهو نموذج تأسيسي (Foundation Model) متعدد الوسائط يولّد مقاطع فيديو مع صوت متزامن يُنتج منذ اللحظة الأولى، لا يُضاف لاحقاً كطبقة منفصلة. تقول الشركة إن هذه أول مرة تُنتج فيها سلسلة Flux مقاطع بصوت أصلي، وقد تصل مدة هذه المقاطع إلى 20 ثانية.

هذه القدرة على توليد الصوت الأصلي هي الميزة الأبرز في الإصدار. نموذج Flux 3 Video، المتاح الآن في مرحلة وصول مبكر، يستطيع توليد حوار متزامن مع حركة الشفاه بأكثر من 14 لغة، إلى جانب المؤثرات الصوتية والأصوات المحيطة، وكل ذلك يُنتج في عملية واحدة مع الصورة دون معالجة لاحقة.

يقوم النموذج على معمارية Self-Flow الخاصة بـ BFL، وهي طريقة لتدريب نظام واحد على توليد المحتوى وفهمه في الوقت نفسه. تقنياً، يعتمد Flux 3 على الـمُحوِّل (Transformer) متعدد الوسائط، بمرمّزات وفواكّ ترميز مستقلة تتعامل مع الصور والفيديو والصوت، وأيضاً حركات الروبوتات.

هذه النقطة الأخيرة تكشف عن طموح Flux 3 خارج نطاق إنتاج المحتوى. تعاونت BFL مع Mimic Robotics لبناء نسخة تُدعى Flux-mimic، متخصصة في الفيديو المرتبط بالحركة، وتخضع الآن لتجارب على مهام تصنيعية حقيقية في شركة أودي (Audi)، بهدف تطبيقها على مهام تحكّم الروبوتات في بيئات المصانع.

القدرات ونتائج الاختبارات الأولية

بالإضافة إلى تحويل النص إلى فيديو والصورة إلى فيديو، يدعم Flux 3 تحويل الفيديو إلى فيديو، والانتقالات بين المشاهد بالاعتماد على لقطات مفتاحية، وتوليد حوار متعدد اللغات، وربط المقاطع تلقائياً عبر وكلاء لبناء تسلسلات أطول متعددة اللقطات.

نشرت BFL نتائج مقارنات داخلية باستخدام مقاطع بدقة 720p ومدة 10 ثوان. وبحسب الشركة، تفوّق Flux 3 في 93 بالمئة من المقارنات المباشرة مع Luma Ray 3.2، وفي 77 بالمئة مع Runway Gen-4.5، وفي 69 بالمئة مع Grok Imagine Video.

الفروق كانت أضيق أمام منافسين آخرين: 60 بالمئة مع Kling v3 Pro، وما بين 57 و59 بالمئة مع نسختي Happy Horse، و52 بالمئة أمام كل من Seedance 2.0 و Gemini Omni Flash. كما تستشهد BFL بدرجات إيلو (Elo) بلغت 1,135 لتحويل النص إلى فيديو و1,051 لتحويل الصورة إلى فيديو.

تحذّر BFL نفسها من أن هذه التقييمات داخلية وأولية، ولا تتوفر حتى الآن اختبارات مستقلة تؤكد هذه النتائج.

التسعير والتوافر

يُسعَّر Flux 3 Video حسب نوع التحويل والدقة. يبلغ سعر التوليد في وضع المسودة 0.06 دولار للثانية عند تحويل النص أو الصورة إلى فيديو، و0.12 دولار للثانية عند تحويل الفيديو إلى فيديو.

يرتفع السعر في وضع الجودة الكاملة بدقة HD إلى 0.17 و0.41 دولار للثانية على التوالي، بينما يصل بدقة Full HD إلى 0.29 و0.53 دولار للثانية. النموذج متاح عبر واجهة برمجة تطبيقات BFL وشركاء مختارين.

أما Flux 3 Image، النسخة المخصصة للصور الثابتة، فلم تُطرح بعد، لكن BFL تقول إنها تخطط لإتاحتها في وصول مبكر خلال الأسابيع المقبلة. حالياً، يبقى توليد الفيديو بصوت متزامن أوضح ما يميّز هذا النموذج عن المنافسين الذين يتسابقون لدمج توليد الصورة والصوت في نظام واحد.

واكب

فريق تحرير واكب

تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.

اشترك في النشرة البريدية

احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.

قناة التليجرام

تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.

انضم إلينا على تليجرام