نموذج الانتشار بخطوة واحدة "OSOR" يقلّص زمن إزالة العناصر من الصور حتى 30 مرة

ResearchDeveloper Tools
صورة توضيحية مُولّدة بالذكاء الاصطناعي: Editorial image for One-Step Diffusion Model OSOR Cuts Object Removal Times by Up to 30x

الزبدة

  • نموذج جديد اسمه OSOR يزيل العناصر من الصور بخطوة واحدة فقط بدل عشرات الخطوات، بسرعة تصل إلى 30 مرة أسرع من الطرق التقليدية بدون خسارة الجودة
  • الحل يعتمد على مكوّنين ذكيين: أحدهما يحافظ على حواف الصورة نظيفة أثناء التدريب، والآخر يعوّض عن الأقنعة غير الدقيقة التي تحدد العنصر المطلوب حذفه
  • الفريق بنى مجموعة بيانات ضخمة من 280 ألف زوج إزالة موثّق، بالإضافة لمعيارين جديدين لاختبار الحالات الصعبة كالرسوم المتحركة والنصوص داخل الصور، والكود متاح للجميع للتحقق من النتائج

إزالة عنصر من صورة بشكل مقنع كانت تتطلب تقليديًا عشرات الخطوات المتتالية من نماذج الانتشار (Diffusion Models) للوصول إلى نتيجة نظيفة خالية من التشوّهات. لكن ورقة بحثية جديدة تقدّم نموذجًا يُدعى "OSOR" (اختصارًا لـ One-Step Object Removal)، يزعم أنه يضغط هذه العملية بأكملها في خطوة انتشار واحدة فقط، بسرعة تتراوح بين 4 و30 مرة أسرع من النماذج التقليدية متعددة الخطوات، مع جودة بصرية تضاهيها أو تتفوق عليها.

نُشرت الورقة على منصة "آركايف" (arXiv) في 26 يونيو 2026، وتتصدى لمشكلة عرقلت طويلًا تطوير نماذج الانتشار السريعة: فالتدريب بخطوة واحدة معروف بعدم استقراره، والنماذج التي تتجاوز عملية التحسين التكراري غالبًا ما تنتج حواف غير واضحة أو بقايا "شبحية" (Ghosting) في المكان الذي كان يحتله العنصر المحذوف. لمعالجة هذا التحدي، طوّر فريق الباحثين ما يسمّونه "مُميّز موجّه بالإشغال" (Occupancy-Guided Discriminator)، وهو مكوّن مصمّم لتزويد النموذج بتغذية راجعة دقيقة حول حدود العناصر أثناء التدريب، بما يضمن أن تبقى مخرجات الخطوة الواحدة حادة ومتماسكة، بدلًا من أن تتحلل إلى تشويش بصري.

أما الجزء الثاني من البنية، ويُعرف بـ"رأس ألفا" (Alpha Head)، فيستفيد من نماذج انتشار مُدرّبة مسبقًا (Pretrained Diffusion Models) للتنبؤ بالمناطق التي تحتاج فعليًا إلى الإزالة. هذه الخطوة مهمة عمليًا، لأن الأقنعة (Masks) التي تحدد العنصر المراد محوه في العالم الحقيقي غالبًا ما تكون غير دقيقة، إما ضيقة جدًا أو متسربة إلى البكسلات المحيطة. وبالتنبؤ بمناطق الإزالة بدلًا من الاعتماد الحرفي على القناع المُدخل، صُمّم "OSOR" لتعويض هذا النقص بدلًا من ترحيله إلى الصورة النهائية.

بناء بيانات تدريب أنظف على نطاق واسع

السرعة والاستقرار في الاستدلال (Inference) ليست القصة كاملة. تدريب "OSOR" يعتمد أيضًا على خط أنابيب تحقّق يُعرف بـ"التحقق المرتكز دلاليًا" (SAVP)، يقوم بتصفية الثلاثيات التدريبية المبنية على تعليمات نصية والمشوبة بالضجيج أو عدم التطابق، قبل أن تصل إلى النموذج. استخدم الباحثون هذا الخط لبناء مجموعة بيانات أسموها "CORNE"، تضم 280 ألف زوج إزالة موثّق، ويصفها الفريق كأساس أنظف وأكثر موثوقية من الثلاثيات التدريبية المعتادة التي تُجمع بشكل تلقائي أو عبر الزحف على الويب.

ولاختبار كيفية تعامل "OSOR" مع الحالات الأكثر صعوبة، جمع الفريق أيضًا مجموعتي تقييم جديدتين: "AnimeEraseBench"، المركّزة على إزالة العناصر من الرسوم التوضيحية المُصممة وصور الأنيمي، و"TextEraseBench"، الموجّهة لسيناريوهات محو النصوص بنظافة من داخل المشهد. تستهدف المعيارتان فئات من الصور عانت تاريخيًا أنظمة الرسم الداخلي التوليدي (Generative Inpainting) وأنظمة إزالة العناصر من دقة التعامل معها.

يذكر الباحثون أن الكود المصدري والموارد الداعمة لـ"OSOR" أصبحت متاحة، وهو ما يتيح لباحثين آخرين التحقق بشكل مستقل من مزاعم السرعة والجودة، وربما دمج "المُميّز الموجّه بالإشغال" أو "رأس ألفا" في خطوط أنابيب انتشار أخرى.

إذا صمدت هذه المكاسب المُعلنة أمام الاختبار المستقل، فالتطبيقات العملية واضحة: أدوات إزالة العناصر المستخدمة في برامج تحرير الصور، وتنظيف صور التجارة الإلكترونية، وما بعد إنتاج الفيديو، قد تتحول من عملية تستغرق ثوانٍ أو خطوات متعددة إلى ما يقارب الزمن الفعلي (Real-Time)، دون أن يضطر المستخدمون للتضحية بالجودة مقابل السرعة. وهذا النوع من التسريع يصبح أكثر أهمية في بيئات الإنتاج التي تتطلب تشغيل عمليات الإزالة على نطاق واسع عبر كميات ضخمة من الصور، لا صورة واحدة في كل مرة.

التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.

  1. 1Rendering-Aware Bayesian 3D Gaussian Splatting with Native Uncertainty and Adaptive Complexity Controlarxiv.org
  2. 2Mind the Gap: Quantifying the Domain Gap in Cross-Sensor Diffusion Super-Resolutionarxiv.org
  3. 3Exposure Bias Can Alleviate Itself via Directional and Frequency Rectification in Flow Matchingarxiv.org
  4. 4Compression-Driven Anomaly Detection in Brain MRI Using an Interpretable Quantum Autoencoderarxiv.org
  5. 5Toward Robust In-Context Segmentation via Concept Guidancearxiv.org
  6. 6Automated brain tumor detection in MRI images using CNN and ResNet architecturesarxiv.org
  7. 7Hippocampus-DETR: An Explicit Memory Object Detection Framework Based on Hippocampus Modelingarxiv.org
  8. 8Learning Topology-Aware Representations via Test-Time Adaptation for Anomaly Segmentationarxiv.org
  9. 9ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answeringarxiv.org
  10. 10OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removalarxiv.org
  11. 11Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understandingarxiv.org
  12. 12Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generationarxiv.org
  13. 13MLVC: Multi-platform Learned Video Codec for Real-World Deploymentarxiv.org
  14. 14HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaborationarxiv.org
  15. 15GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Modelsarxiv.org
  16. 16Improving Adversarial Robustness via Activation Amplification and Attenuationarxiv.org
  17. 17PreferThinker: Reasoning-based Personalized Image Preference Assessmentarxiv.org
  18. 18Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Designarxiv.org
  19. 19BiDeMem: Bidirectional Degradation Memory for Explainable Image Restorationarxiv.org
  20. 20Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Modelsarxiv.org
  21. 21Class-frequency Guided Noise Schedule for Diffusion Modelsarxiv.org
واكب

فريق تحرير واكب

تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.

اشترك في النشرة البريدية

احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.

قناة التليجرام

تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.

انضم إلينا على تليجرام

المزيد من الأبحاث

عرض الكل في الأبحاث