PDF OCR (Metin Tanıma)
Taranmış PDF'i ya da fotoğrafı aranabilir PDF'e veya metne çevirir.
Bu araç JavaScript ile çalışır. Kullanmak için tarayıcında JavaScript’i açıp sayfayı yenile.
TARANMIŞ SAYFA, ARANABİLİR METİN.
PDF OCR, taranmış bir PDF'teki ya da belgenin fotoğrafındaki yazıyı tanır ve metne çevirir. Tanıma, açık kaynak Tesseract motoruyla RUPO sunucusunda yapılır; belge başka bir hizmete gönderilmez. PDF'in her sayfası 300 dpi'da çizilir ve tek tek okunur. “Aranabilir PDF” çıktısında sayfalar aynen görünür, altına görünmez bir metin katmanı eklenir: metni seçip kopyalayabilir, belgede arama yapabilirsin. “Düz metin (TXT)” yalnızca tanınan yazıyı verir; birden çok sayfada sayfalar numaralı çizgilerle ayrılır.
“Belgenin dili” varsayılan olarak sayfanın dilidir; belge başka bir dildeyse listeden seç. Türkçe, İngilizce, Almanca, Fransızca, İspanyolca, İtalyanca, Portekizce, Japonca, Korece, Hintçe ve Arapça tanınır; İngilizce kelimeler her dilde ayrıca okunur. Doğru dil, ç, ğ, ı ve ş gibi harflerin doğru çıkması için önemlidir. PDF'te “Sayfalar” alanıyla yalnızca bazı sayfaları tanıtabilirsin (örneğin 1, 3-5); tek seferde en çok 200 sayfa işlenir. JPG, PNG, WebP, TIFF ve BMP görseller de yüklenebilir. Tek seferde en çok 8 dosya yüklenir; hepsi aynı ayarla işlenir ve tek ZIP olarak iner. El yazısı ve çok bulanık görüntüler tanınmaz.
İşin başından sonuna
- Belgeni yükle. Taranmış PDF ya da JPG, PNG, WebP, TIFF, BMP görsel; tek seferde en çok 8 dosya.
- Çıktıyı ve dili seç. Aranabilir PDF ya da düz metin. Belge sayfanın dilinde değilse “Belgenin dili” listesinden doğru dili seç.
- Tanıt ve indir. Sonuç kartında sayfa ve karakter sayısı görünür. İndir; araçtan çıkınca sunucudaki kopya silinir.
Sık sorulan sorular
Türkçe harfler doğru çıkar mı?
Evet, belgenin dili Türkçe seçiliyse ç, ğ, ı, İ, ö, ş ve ü doğru tanınır; Türkçe sayfada varsayılan dil zaten Türkçedir. Dil yanlış seçilirse bu harfler düz harflere dönebilir; o zaman doğru dili seçip yeniden dene.
Aranabilir PDF ile düz metin arasındaki fark ne?
Aranabilir PDF'te sayfa taranmış hâliyle aynen görünür; görünmez metin katmanı sayesinde yazı seçilir, kopyalanır ve aranır. Düz metin yalnızca yazıyı verir; biçim, görsel ve tablo düzeni taşınmaz. Metni başka bir yere yapıştıracaksan TXT, belgeyi saklayıp içinde arayacaksan aranabilir PDF uygundur.
Zaten metin içeren PDF'te ne olur?
Sayfalar yine görüntüden yeniden tanınır ve sonuç kartında bunu belirten bir not çıkar. Böyle bir PDF'in metnini almak için OCR gerekmez; “PDF → Word” metni doğrudan çıkarır ve daha hızlıdır.
Dosyam sunucuda kalır mı?
Hayır. Dosyan yalnızca işlem için sunucuya gelir, iş bitince silinir; sonucu indirip araçtan çıktığında çıktı da silinir. Hesap açman, ad ya da e-posta vermen gerekmez; dosyaların üçüncü taraf bir servise gönderilmez. Kullanım ücretsizdir: işlem sayısına saatlik ya da günlük kota koymuyoruz, işlemden önce reklam izletmiyoruz ve çıktıya filigran eklemiyoruz.
Diğer PDF araçları
RUPO Studio