داتالاب تعيد كتابة Marker من الصفر... وتتفوق على MinerU بخمسة أضعاف في سرعة استخلاص المستندات

الزبدة
- داتالاب تطلق ماركر 2 بإعادة بناء كاملة، محققةً دقة 76% على اختبار olmOCR-bench مع سرعة تفوق منافسها MinerU بخمسة أضعاف على الأقل
- الأداة الجديدة تقدم ثلاثة أوضاع تحويل: متوازن للدقة العالية، وسريع للإنتاجية، وخيار تعطيل التعرف الضوئي بالكامل لمعالجة الملفات الرقمية الأصلية بسرعة تصل إلى 23.7 صفحة في الثانية
- ماركر 2 لم يعد مجرد أداة OCR بل طبقة استيعاب مستندات شاملة تدعم PDF وWord وExcel وPowerPoint وEPUB وتصدّرها كنصوص جاهزة لأنظمة الذكاء الاصطناعي والتوليد المعزز بالاسترجاع
أطلقت شركة داتالاب (Datalab) في 21 يوليو 2026 النسخة الثانية من أداتها مفتوحة المصدر لتحويل المستندات "ماركر 2" (Marker 2)، بعد إعادة بنائها بالكامل من الصفر. الهدف واضح: تحويل ملفات PDF الفوضوية إلى نصوص منظمة ونظيفة دون استنزاف ساعات معالج الرسوميات (GPU).
الرقم الذي يتصدر المشهد هو سرعة المعالجة. ففي اختبار olmOCR-bench، وهو معيار قياس مستقل طورته Allen AI اعتماداً على 1,403 ملف PDF ونحو 8,400 اختبار نجاح/فشل، حقق "الوضع المتوازن" في ماركر 2 دقة إجمالية بلغت 76.0%، وارتفعت إلى 83.5% مع ملفات PDF الرقمية الأصلية. في المقابل، سجلت الواجهة الخلفية لخط أنابيب MinerU دقة 72.7% فقط، لكنها لم تعالج سوى 0.54 صفحة في الثانية، أي أقل من خُمس سرعة ماركر 2 في الوضع نفسه.
هذه السرعة لم تأتِ من حيلة واحدة، بل من إعادة هيكلة داخلية شاملة. أعادت داتالاب بناء ماركر 2 حول ثلاثة مكونات رئيسية: نموذج التعرف الضوئي على الحروف "سوريا 2" (Surya OCR 2)، ونموذج مدمج لتحليل تخطيط الصفحة بحجم 20 مليون معامل (Parameter)، ومحرك pdftext المعاد كتابته والذي يعمل بسرعة ثلاثة أضعاف سابقه. مجتمعةً، تتيح هذه المكونات معالجة 2.9 صفحة في الثانية على معالج رسوميات واحد من طراز Nvidia B200 في الوضع المتوازن.
مسارات متعددة بدل الحل الواحد
لا يعتمد ماركر 2 على خط أنابيب واحد يناسب الجميع، بل يقدم مسارات تحويل متدرجة. الوضع المتوازن يحقق 76.0% على olmOCR-bench، بينما ينخفض الوضع السريع إلى 66.6% مقابل سرعة أعلى، أما خيار --disable_ocr فيضحي بالدقة (43.6%) لصالح سرعة خام تصل إلى 23.7 صفحة في الثانية عندما لا تكون هناك حاجة للتعرف الضوئي على الحروف (OCR) أصلاً. هذه المرونة مفيدة للفرق التي تعالج دفعات ضخمة من الملفات الرقمية الأصلية حيث يصبح التعرف الضوئي الكامل عبئاً زائداً غير ضروري.
كيف يقارن بمنافسيه؟
الفجوة مع Docling، المنافس مفتوح المصدر الآخر، صارخة: يسجل Docling 50.3% فقط على olmOCR-bench بسرعة 2.1 صفحة في الثانية، متأخراً كثيراً عن أرقام ماركر 2 في الوضع المتوازن من ناحيتي الدقة والسرعة معاً. تسوّق داتالاب أداتها باعتبارها الحل الذي لم يعد يجبر المستخدمين على التضحية بأحدهما لصالح الآخر.
تمتد إعادة الكتابة لتشمل صيغ إدخال تتجاوز ملفات PDF والصور الممسوحة ضوئياً، مثل PPTX وDOCX وXLSX وHTML وEPUB، مع خيارات إخراج بصيغة Markdown أو JSON أو HTML أو نصوص مجزأة (Chunks) مناسبة لأنظمة التوليد المعزز بالاسترجاع (RAG). هذا النطاق الواسع يجعل من ماركر 2 أقرب إلى طبقة عامة لاستيعاب المستندات لأنظمة الذكاء الاصطناعي، لا مجرد أداة تعرف ضوئي محدودة.
تحديثات على الصعيد التقني
على مستوى البنية التحتية، يتطلب ماركر 2 لغة بايثون 3.10 أو أحدث، وانتقلت أدواته من Poetry إلى uv، مع اعتماد hatchling كخلفية بناء. أضافت داتالاب أيضاً دعماً كاملاً لوحدة المعالجة المركزية (CPU)، وجعلت الأداة "واعية بالجهاز" تلقائياً: تعمل بالوضع المتوازن على معالج الرسوميات، وتتحول للوضع السريع على المعالج المركزي أو خلفية MPS من آبل، بحيث تتكيف الشفرة البرمجية نفسها تلقائياً مع أي عتاد تعمل عليه.
بالنسبة للفرق التي تبني خطوط معالجة مستندات مكثفة لأنظمة الذكاء الاصطناعي، سواء لتغذية النماذج اللغوية الكبيرة (LLMs) أو تعبئة قواعد بيانات المتجهات (Vector Databases) أو أتمتة استخلاص بيانات المؤسسات، فإن الجمع بين دقة أعلى وسرعة أضعاف مضاعفة قد يقلص تكاليف البنية التحتية بشكل ملموس عند التوسع.
التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.
فريق تحرير واكب
تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.
اشترك في النشرة البريدية
احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.
قناة التليجرام
تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.
