← كل المقالات

استخراج النص من PDF والصور بالذكاء الاصطناعي: شرح Baidu Unlimited OCR

دليل عملي لفهم Baidu Unlimited OCR واستخراج النص والبيانات من ملفات PDF والصور والفواتير والعقود، مع تقييم خاص للمستندات العربية.

يبني بكري عبدالسلام مواقع الويب والتطبيقات والتكاملات ومنتجات ووردبريس، ويوثق مركز بكري التقني القرارات التقنية وراء هذا العمل.

الخلاصة

Unlimited OCR نموذج مفتوح لمعالجة صور صفحات كثيرة بكفاءة، لكنه يحتاج إلى تحويل PDF إلى صور واختبار عربي واقعي ومراجعة بشرية قبل استخدام بياناته في القرارات المالية أو القانونية.

لا تبدأ مشكلة المستندات في الشركات من سؤال «ما أفضل نموذج OCR؟»، بل من صندوق بريد ممتلئ بفواتير، وعقود ممسوحة ضوئيا، وتقارير PDF لا يمكن البحث داخلها، وصور إيصالات أرسلها الموظفون عبر الهاتف. في شركة تعمل بين الرياض ودبي والقاهرة، قد تكون الصفحة عربية، أو إنجليزية، أو تجمع اللغتين مع أرقام ضريبية وجداول وأختام. نسخ هذه البيانات يدويا بطيء، والخطأ في مبلغ أو تاريخ قد يكون مكلفا.

هنا يأتي Baidu Unlimited OCR بوصفه نموذجا مفتوح الأوزان يركز على قراءة عدد كبير من صور الصفحات ضمن عملية استدلال واحدة. الاسم جذاب، لكنه لا يعني أن طول المستند غير محدود حرفيا. القيمة التقنية هي تقليل نمو ذاكرة الانتباه أثناء التعامل مع صفحات متتابعة، بما يسمح ـ وفقا للورقة البحثية ـ بمعالجة عشرات الصفحات ضمن حد سياق قياسي قدره 32 ألف رمز.

هذا الدليل يشرح ما يفعله النموذج فعلا، وكيف يمكن تحويل ملف PDF إلى مسار عمل مفيد، وما الذي يجب اختباره قبل الاعتماد عليه مع العربية في مصر والسعودية والإمارات والكويت وقطر وعمان.

نية البحث: فهم طريقة استخراج النص من PDF والصور بالذكاء الاصطناعي، وتقييم Unlimited OCR للفواتير والعقود والأرشيف العربي، ثم تحديد هل يناسب تجربة محلية أم يحتاج إلى خدمة مستندات جاهزة.

ما هو Baidu Unlimited OCR؟

Unlimited OCR نموذج رؤية ولغة من Baidu منشور بأوزانه على Hugging Face وبشفرة على GitHub تحت رخصة MIT. بطاقة النموذج تصنفه كنموذج يحول الصورة والنص إلى نص، وتذكر أن حجمه ثلاثة مليارات معامل. بني العمل على DeepSeek-OCR، ثم غيّر آلية الانتباه في وحدة فك الترميز لمعالجة تسلسل طويل من الصفحات بكلفة ذاكرة أكثر ثباتا.

يستقبل النموذج صور صفحات متتابعة ويخرج نصها. إذا كان PDF رقميا ونصه قابلًا للتحديد، فقد تكفي مكتبة استخراج بسيطة؛ أما الصفحات الممسوحة أو ذات البنية المرئية فتحتاج إلى OCR.

النموذج متاح للتجربة والدمج، لكن بطاقة Hugging Face لا تعرض حاليا مزود Inference Provider يستضيفه مباشرة. توجد تجربة على Hugging Face Space وخيار عبر Baidu Cloud، بينما التشغيل الخاص يحتاج إلى إعداد بيئة الاستدلال بنفسك.

كيف يعمل OCR عادة؟ وما المختلف هنا؟

أنظمة OCR التقليدية تمر غالبا بثلاث مراحل: اكتشاف مناطق النص في الصورة، والتعرف على الحروف، ثم ترتيب السطور والحقول. هذا ممتاز للصفحات الواضحة، وقد يكون أسرع وأخف من نموذج متعدد الوسائط. لكن المستندات الواقعية تحتوي على جداول، ورؤوس صفحات، وأعمدة، وأختام، وصور، وتحتاج أحيانا إلى فهم العلاقة بين العناصر لا مجرد نسخ الحروف.

نماذج الرؤية واللغة تتعامل مع الصفحة كصورة وتولد وصفا نصيا منظما لها. المشكلة أن إدخال صفحات كثيرة يرفع عادة حجم ذاكرة KV cache مع امتداد التسلسل. Unlimited OCR يستبدل الانتباه المعتاد بآلية تسميها الورقة Reference Sliding Window Attention (R-SWA). يحتفظ النموذج بمرجع ثابت ويستخدم نافذة منزلقة بدلا من العودة إلى كل الرموز السابقة بالطريقة نفسها، لذلك تبقى كلفة KV cache ثابتة بحسب تصميم الباحثين.

لا يلغي ذلك حدود السياق أو وقت المعالجة أو حجم ذاكرة بطاقة الرسوم. كلمة Unlimited تصف اتجاه التصميم، لا وعدا بإرسال أرشيف كامل بلا تقسيم. في نظام إنتاجي ستظل بحاجة إلى تحديد عدد الصفحات في الدفعة، ومراقبة الاستهلاك، وإعادة المحاولة عند الفشل.

هل يقرأ PDF مباشرة؟

المسار الرسمي يبدأ بتحويل صفحات PDF إلى صور. مثال بطاقة النموذج يستخدم PyMuPDF لفتح الملف ورسم كل صفحة بدقة 300 DPI، ثم يمرر قائمة الصور إلى دالة الاستدلال متعدد الصفحات. لذلك فالتعبير الأدق هو «OCR لصور صفحات PDF»، وليس قارئا يتعامل مع بنية الملف الأصلية مباشرة.

يمكن بناء خط معالجة من خمس خطوات:

  1. فحص الملف والتأكد من نوعه وعدم احتوائه على برمجيات ضارة.
  2. استخراج النص المباشر أولا إن كانت للملف طبقة نص جيدة، لتجنب OCR غير الضروري.
  3. تحويل الصفحات التي تحتاج إلى OCR إلى صور بدقة مناسبة.
  4. تمرير الصفحات إلى Unlimited OCR على دفعات، وحفظ رقم الصفحة مع كل نتيجة.
  5. التحقق من الحقول المهمة ثم إرسال النص إلى البحث أو الأرشفة أو نظام الأعمال.

رفع الدقة قد يساعد الحروف الصغيرة، لكنه يزيد الذاكرة والوقت؛ اختبر قيمة تناسب مستنداتك.

تشغيل Unlimited OCR للمطورين

المستودع الرسمي يشرح التثبيت والتشغيل عبر Transformers، كما توجد وصفة vLLM رسمية للاستدلال. البيئة التي اختبرها ناشرو النموذج تتضمن Python 3.12.3 وCUDA 12.9 وPyTorch 2.10 وTransformers 4.57.1، لكنها لقطة توافق وليست قاعدة تقول إن كل إصدار آخر سيفشل. الأفضل تثبيت الإصدارات الموصى بها في بيئة منفصلة قبل تغييرها.

في التطبيق، سجّل الزمن والذاكرة ونسبة إعادة المعالجة، واربط كل نتيجة بصورتها للمراجعة. استخدم الـSpace على بيانات عامة فقط، ولا ترفع عقودا أو هويات إلى واجهة تجريبية.

تطبيقات عملية في الشركات العربية

قراءة الفواتير والإيصالات

يحول النموذج الفاتورة إلى نص، ثم تستخرج طبقة لاحقة المورد والرقم الضريبي والتاريخ والإجمالي والعملة. اختبر ضريبة القيمة المضافة في الخليج والجنيه والعناوين العربية في مصر، وطابق المجموع قبل أي قيد محاسبي.

العقود والمستندات القانونية

يمكن تحويل العقود الممسوحة إلى نص قابل للبحث حسب الصفحة والبند. لكن خطأ في «لا يجوز» أو مدة العقد يغير المعنى؛ تبقى الصورة والمراجعة القانونية مرجعين أساسيين.

التقارير والأرشيف

يمكن للمؤسسات فهرسة التقارير والمحاضر والأرشيف، بشرط ربط كل مقطع باسم الملف ورقم الصفحة حتى تبقى النتيجة قابلة للتتبع.

هل يدعم المستندات العربية جيدا؟

بطاقة Hugging Face تحمل وسم «multilingual»، لكن المصادر الرسمية المتاحة لا تقدم معيارا منشورا خاصا بدقة العربية، ولا تفصل الأداء حسب اللهجات أو أشكال الأرقام أو أنواع المستندات الخليجية والمصرية. لذلك لا يصح أن نستنتج من الوسم وحده أن النموذج هو «أفضل OCR عربي».

قبل الشراء أو النشر، أنشئ مجموعة اختبار تمثل عملك، لا مجموعة صفحات مثالية. يجب أن تشمل:

  • العربية من اليمين إلى اليسار مع عناوين إنجليزية داخل السطر.
  • الأرقام العربية والهندية والغربية والتواريخ بصيغ مختلفة.
  • أسماء شركات وأشخاص وعناوين من دول التشغيل.
  • الريال والدرهم والجنيه والدينار والرموز الضريبية.
  • جداول، وأختاما، وتوقيعات، وصفحات مائلة أو منخفضة الدقة.
  • خطوطا مطبوعة متنوعة، مع استبعاد الخط اليدوي إن لم يكن ضمن الحالة المطلوبة.

قِس معدل خطأ الحروف والكلمات للنص العام، لكن استخدم مقياسا منفصلا للحقول الحساسة. قد تبدو الصفحة صحيحة بنسبة عالية بينما أخطأ النظام في إجمالي الفاتورة. في الأعمال، دقة الحقل أهم أحيانا من جمال النص الكامل.

من النص الخام إلى بيانات مفيدة

OCR هو أول السلسلة فقط. بعد استخراج النص، تستطيع استخدام قواعد ثابتة أو نموذج لغوي لتحويله إلى JSON، مثلا: رقم الفاتورة، التاريخ، المورد، المبلغ والعملة. بعدها طبّق مخططا صارما وأنواع بيانات واختبارات منطقية: هل الإجمالي يساوي صافي البنود والضريبة؟ هل التاريخ صالح؟ هل العملة ضمن القائمة؟

يمكن فهرسة النص لمساعد داخلي يعرض الصفحة الأصلية ولا يخمن حقولا مفقودة. يشرح دليل استخدام الذكاء الاصطناعي البدء بحالة محددة، وتساعدك مقارنة أفضل نماذج الذكاء الاصطناعي على اختيار نموذج التحليل التالي.

الخصوصية والأمان في مصر والخليج

حدد أين تتم المعالجة ومن يصل إلى الصور ومدة الاحتفاظ، وشفّر التخزين والنقل. التشغيل المحلي يمنح تحكما لكنه يحتاج صلاحيات وسجلات ونسخا احتياطية؛ والسحابة تتطلب مراجعة موقع البيانات والحذف والمتطلبات القانونية مع مختص.

مقارنة Unlimited OCR بالبدائل

Tesseract: خفيف ومحلي للنص البسيط والصفحات المتجانسة، لكنه يحتاج عملا إضافيا للتخطيط والجداول.

PaddleOCR وحلول مفتوحة أخرى: توفر مكونات لاكتشاف النص والتخطيط؛ قارن دعم العربية على بياناتك.

DeepSeek-OCR: هو الأساس السابق؛ مع صفحات قليلة قد لا تحسم ميزة الذاكرة الاختيار.

خدمات Document AI المُدارة: تقدم حقولا وقوالب جاهزة وقد تكون أسرع، مقابل تسعير وسياسات بيانات خاصة بالمزود.

اختر بالمهمة: جودة العربية، ودقة الحقول، والخصوصية، وحجم الدفعات، وتكلفة التشغيل، وسهولة المراجعة. لا تختَر لأن الاسم يوحي بعدد صفحات لا نهائي.

المميزات

  • أوزان وشفرة متاحتان تحت رخصة MIT، ما يسمح بالتجربة والتخصيص وفق شروط الرخصة.
  • تصميم موجه لمعالجة صور صفحات كثيرة مع KV cache ثابت بحسب الورقة.
  • حجم ثلاثة مليارات معامل أصغر من نماذج لغوية عملاقة، مع بقاء الحاجة إلى قياس العتاد فعليا.
  • مسار رسمي عبر Transformers ووصفة vLLM، ما يمنح المطور أكثر من خيار للاستدلال.
  • مناسب كبداية لبحث المستندات، والأرشفة، واستخراج بيانات الأعمال.

القيود التي يجب معرفتها

  • Unlimited لا يعني غياب حدود السياق أو الذاكرة أو زمن التنفيذ.
  • PDF يحتاج إلى تحويل الصفحات إلى صور قبل الاستدلال في المسار الرسمي.
  • لا يوجد معيار عربي رسمي مفصل يثبت الدقة على الفواتير والعقود المحلية.
  • النموذج يستخرج النص، لكنه لا يضمن صحة قرار محاسبي أو قانوني مبني عليه.
  • جودة الصورة والتخطيط والأختام والخطوط المختلطة تؤثر في النتيجة.
  • لا يتوفر حاليا عبر Hugging Face Inference Providers، لذلك تحتاج إلى استضافة أو مزود آخر.

من ينبغي أن يجربه؟

يناسب فرق البيانات القادرة على تشغيل نموذج وبناء طبقة تحقق. أما شركة تريد حقول فاتورة جاهزة ولا تملك فريق تعلم آلي، فقد تبدأ بخدمة مُدارة.

ابدأ بعينة صغيرة تمثل أسوأ المستندات، وحدد حقولا ومقاييس نجاح قبل التشغيل. إذا لم يتفوق النموذج على المسار الحالي في الدقة أو الوقت أو التكلفة، فلا توجد فائدة من اعتماده لمجرد أنه جديد.

أسئلة شائعة

هل Baidu Unlimited OCR مفتوح المصدر؟

الأوزان والشفرة منشورتان، ويذكر المستودع وبطاقة النموذج رخصة MIT. راجع نص الرخصة ومتطلبات مكونات بيئتك قبل الاستخدام التجاري.

هل يحول PDF إلى نص مباشرة؟

المثال الرسمي يحول صفحات PDF إلى صور باستخدام PyMuPDF ثم يعالجها. تستطيع تغليف الخطوات في تطبيق واحد، لكن النموذج نفسه يستقبل صور الصفحات.

هل عدد الصفحات غير محدود فعلا؟

لا. التصميم يجعل KV cache ثابتة، والباحثون يعرضون معالجة عشرات الصفحات ضمن سياق 32K. ستظل هناك حدود للسياق والعتاد والوقت وجودة النتائج.

هل هو أفضل أداة لاستخراج النص العربي؟

لا توجد في المصادر الرسمية نتيجة عربية تفصيلية تسمح بهذا الحكم. اختبره أمام البدائل على فواتيرك وعقودك وصورك، وقِس الحقول المهمة لا النص العام فقط.

هل يمكن استخدامه لقراءة الفواتير آليا؟

نعم كطبقة استخراج أولية، ثم تحتاج إلى تحويل منظم وقواعد تحقق ومراجعة للحالات الحساسة. لا ترسل النتيجة مباشرة إلى المحاسبة بلا مطابقة.

هل يمكن تشغيله محليا؟

نعم، يوفر المستودع تعليمات Transformers وتوجد وصفة vLLM. متطلباتك الفعلية تعتمد على عدد الصفحات والدقة والتزامن، لذا نفذ اختبار حمل على العتاد المستهدف.

مراجع رسمية موصى بها

راجع هذه المصادر قبل النشر لأن تعليمات التشغيل قد تتغير.

لديك سؤال عن هذا الدليل أو فكرة لتعاون تقني؟ تواصل مع بكري عبر المركز التقني.

نهاية الملاحظة.