OCR لملفات PDF (التعرف على النص)
يحوّل ملف PDF ممسوحًا ضوئيًا أو صورة إلى PDF قابل للبحث أو إلى نص.
تعمل هذه الأداة بـ JavaScript. لاستخدامها فعّل JavaScript في المتصفح وأعد تحميل الصفحة.
صفحة ممسوحة، ونص قابل للبحث.
تقرأ أداة «OCR لملفات PDF (التعرف على النص)» الكتابة في PDF ممسوح ضوئيًا أو في صورة مستند وتحوّلها إلى نص. ويجري التعرف على خادم RUPO بمحرك Tesseract مفتوح المصدر؛ ولا يُرسل المستند إلى أي خدمة أخرى. وتُرسم كل صفحة من PDF بدقة 300 نقطة في البوصة وتُقرأ واحدة تلو الأخرى. ومع «PDF قابل للبحث» تبقى الصفحات كما هي تمامًا وتُضاف تحتها طبقة نص غير مرئية: فيمكنك تحديد النص ونسخه والبحث في المستند. أما «نص عادي (TXT)» فيعطي النص المتعرَّف عليه فقط؛ ومع عدة صفحات تُفصل الصفحات بأسطر مرقّمة.
«لغة المستند» هي لغة الصفحة افتراضيًا؛ وإذا كان المستند بلغة أخرى فاخترها من القائمة. يُتعرَّف على التركية والإنجليزية والألمانية والفرنسية والإسبانية والإيطالية والبرتغالية واليابانية والكورية والهندية والعربية؛ وتُقرأ الكلمات الإنجليزية أيضًا في كل لغة. واختيار اللغة الصحيحة مهم لتخرج الحروف صحيحة. وفي PDF يتيح حقل «الصفحات» التعرف على بعض الصفحات فقط (مثل 1، 3-5)؛ وتُعالج 200 صفحة على الأكثر في المرة الواحدة. ويمكن رفع صور JPG وPNG وWebP وTIFF وBMP أيضًا. ويمكنك رفع حتى 8 ملفات دفعة واحدة؛ تُعالج كلها بالإعدادات نفسها وتُنزَّل في ملف ZIP واحد. ولا يُتعرَّف على الكتابة اليدوية والصور شديدة الضبابية.
من البداية إلى النهاية
- ارفع مستندك. PDF ممسوح أو صورة JPG أو PNG أو WebP أو TIFF أو BMP؛ حتى 8 ملفات دفعة واحدة.
- اختر الناتج واللغة. PDF قابل للبحث أو نص عادي. وإذا لم يكن المستند بلغة الصفحة فاختر اللغة الصحيحة من قائمة «لغة المستند».
- تعرّف ونزّل. تعرض بطاقة النتيجة عدد الصفحات والأحرف. نزّل الملف؛ وعند مغادرة الأداة تُحذف النسخة الموجودة على الخادم.
الأسئلة الشائعة
هل تُقرأ الحروف العربية بدقة؟
نعم. عند اختيار العربية لغةً للمستند تُقرأ الحروف المتصلة بأشكالها المختلفة بدقة؛ وفي الصفحة العربية تكون العربية هي اللغة الافتراضية أصلًا. وتكون الحروف المطبوعة الواضحة أدق نتيجة، وقد تكثر الأخطاء مع الخطوط الزخرفية أو الصغيرة جدًا. وإذا كانت اللغة خاطئة فلن تُقرأ الحروف بشكل صحيح؛ فاختر حينها اللغة الصحيحة وأعد المحاولة.
ما الفرق بين PDF القابل للبحث والنص العادي؟
في PDF القابل للبحث تظهر الصفحة كما مُسحت تمامًا؛ وبفضل طبقة النص غير المرئية يمكن تحديد المكتوب ونسخه والبحث فيه. أما النص العادي فيعطي المكتوب فقط؛ ولا تُنقل التنسيقات والصور وترتيب الجداول. فإذا كنت ستلصق النص في مكان آخر فاختر TXT، وإذا كنت ستحتفظ بالمستند وتبحث فيه فاختر PDF القابل للبحث.
ماذا يحدث مع PDF يحتوي على نص أصلًا؟
تُعاد قراءة الصفحات من الصورة، وتظهر ملاحظة على بطاقة النتيجة تذكر ذلك. ولا حاجة إلى OCR لاستخراج نص مثل هذا الملف؛ فأداة «PDF → Word» تستخرجه مباشرة وبسرعة أكبر.
هل يبقى ملفي على الخادم؟
لا. يصل ملفك إلى الخادم للمعالجة فقط ويُحذف عند انتهاء العمل، ويُحذف الناتج أيضًا بعد تنزيله والخروج من الأداة. لا تحتاج إلى حساب أو اسم أو بريد إلكتروني، ولا تُرسل ملفاتك إلى أي خدمة خارجية. الاستخدام مجاني: لا نضع حصة بالساعة أو باليوم لعدد العمليات، ولا نطلب منك مشاهدة إعلان قبل المعالجة، ولا نضيف علامة مائية إلى الناتج.
أدوات PDF أخرى
RUPO Studio