PDF OCR (टेक्स्ट पहचान)
स्कैन की गई PDF या फ़ोटो को सर्च करने योग्य PDF या टेक्स्ट में बदलता है।
यह टूल JavaScript से चलता है। इसे इस्तेमाल करने के लिए ब्राउज़र में JavaScript चालू करें और पेज रीलोड करें।
स्कैन किया पेज, सर्च होने वाला टेक्स्ट।
‘PDF OCR (टेक्स्ट पहचान)’ स्कैन की गई PDF या दस्तावेज़ की फ़ोटो में लिखे अक्षरों को पढ़कर टेक्स्ट में बदलता है। पहचान ओपन-सोर्स Tesseract इंजन से RUPO के सर्वर पर होती है; दस्तावेज़ किसी दूसरी सेवा को नहीं भेजा जाता। PDF का हर पेज 300 dpi पर बनाया जाता है और एक-एक करके पढ़ा जाता है। ‘सर्च करने योग्य PDF’ में पेज बिल्कुल वैसे ही दिखते हैं और उनके नीचे एक अदृश्य टेक्स्ट परत जुड़ जाती है: आप टेक्स्ट चुनकर कॉपी कर सकते हैं और दस्तावेज़ में सर्च कर सकते हैं। ‘सादा टेक्स्ट (TXT)’ सिर्फ़ पहचाना गया टेक्स्ट देता है; कई पेज हों तो पेज नंबर वाली लाइनों से अलग किए जाते हैं।
‘दस्तावेज़ की भाषा’ डिफ़ॉल्ट रूप से पेज की भाषा होती है; दस्तावेज़ किसी दूसरी भाषा में हो तो सूची से चुनें। तुर्की, अंग्रेज़ी, जर्मन, फ़्रेंच, स्पेनिश, इतालवी, पुर्तगाली, जापानी, कोरियाई, हिंदी और अरबी पहचानी जाती हैं; अंग्रेज़ी शब्द हर भाषा में अलग से भी पढ़े जाते हैं। अक्षर सही आएँ, इसके लिए सही भाषा चुनना ज़रूरी है। PDF में ‘पेज’ फ़ील्ड से सिर्फ़ कुछ पेज पहचाने जा सकते हैं (जैसे 1, 3-5); एक बार में ज़्यादा से ज़्यादा 200 पेज प्रोसेस होते हैं। JPG, PNG, WebP, TIFF और BMP इमेज भी अपलोड की जा सकती हैं। एक बार में ज़्यादा से ज़्यादा 8 फ़ाइलें अपलोड कर सकते हैं; सब एक ही सेटिंग से प्रोसेस होकर एक ZIP में डाउनलोड होती हैं। हाथ की लिखावट और बहुत धुंधली इमेज नहीं पहचानी जातीं।
शुरू से आख़िर तक
- अपना दस्तावेज़ अपलोड करें। स्कैन की गई PDF या JPG, PNG, WebP, TIFF, BMP इमेज; एक बार में ज़्यादा से ज़्यादा 8 फ़ाइलें।
- आउटपुट और भाषा चुनें। सर्च करने योग्य PDF या सादा टेक्स्ट। दस्तावेज़ पेज की भाषा में न हो तो ‘दस्तावेज़ की भाषा’ सूची से सही भाषा चुनें।
- पहचानें और डाउनलोड करें। नतीजे के कार्ड में पेज और अक्षरों की संख्या दिखती है। डाउनलोड करें; टूल से बाहर निकलने पर सर्वर की कॉपी हटा दी जाती है।
अक्सर पूछे जाने वाले सवाल
क्या देवनागरी अक्षर सही पहचाने जाते हैं?
हाँ। दस्तावेज़ की भाषा हिंदी चुनने पर मात्राएँ और संयुक्त अक्षर सही पढ़े जाते हैं; हिंदी पेज पर डिफ़ॉल्ट भाषा पहले से हिंदी होती है। छपे हुए साफ़ अक्षर सबसे सटीक आते हैं; बहुत छोटे या सजावटी फ़ॉन्ट में गलतियाँ बढ़ सकती हैं। भाषा गलत हो तो अक्षर सही नहीं आते; तब सही भाषा चुनकर फिर से आज़माएँ।
सर्च करने योग्य PDF और सादे टेक्स्ट में क्या फ़र्क है?
सर्च करने योग्य PDF में पेज बिल्कुल स्कैन जैसा दिखता है; अदृश्य टेक्स्ट परत की वजह से लिखा हुआ चुना, कॉपी और सर्च किया जा सकता है। सादा टेक्स्ट सिर्फ़ लिखा हुआ देता है; फ़ॉर्मैटिंग, इमेज और टेबल की बनावट नहीं आती। टेक्स्ट कहीं और चिपकाना हो तो TXT, दस्तावेज़ रखकर उसमें सर्च करना हो तो सर्च करने योग्य PDF सही है।
जिस PDF में पहले से टेक्स्ट हो, उसका क्या होता है?
पेज फिर भी इमेज से दोबारा पढ़े जाते हैं और नतीजे के कार्ड पर यह बताने वाला नोट आता है। ऐसी PDF का टेक्स्ट निकालने के लिए OCR की ज़रूरत नहीं; ‘PDF → Word’ उसे सीधे और ज़्यादा तेज़ी से निकाल देता है।
क्या मेरी फ़ाइल सर्वर पर रहती है?
नहीं। आपकी फ़ाइल सिर्फ़ प्रोसेसिंग के लिए सर्वर पर आती है और काम पूरा होते ही हटा दी जाती है; नतीजा डाउनलोड करके टूल से बाहर निकलने पर आउटपुट भी हटा दिया जाता है। अकाउंट, नाम या ईमेल की ज़रूरत नहीं है, और आपकी फ़ाइलें किसी थर्ड-पार्टी सेवा को नहीं भेजी जातीं। इस्तेमाल मुफ़्त है: काम की संख्या पर कोई घंटेवार या रोज़ाना सीमा नहीं है, प्रोसेसिंग से पहले विज्ञापन देखना नहीं पड़ता और आउटपुट पर कोई वॉटरमार्क नहीं लगाया जाता।
और PDF टूल
RUPO Studio