PDF-OCR (Texterkennung)
Macht aus einem gescannten PDF oder einem Foto ein durchsuchbares PDF oder reinen Text.
Dieses Tool benötigt JavaScript. Aktiviere JavaScript in deinem Browser und lade die Seite neu.
GESCANNTE SEITE, DURCHSUCHBARER TEXT.
PDF-OCR liest die Schrift in einem gescannten PDF oder im Foto eines Dokuments und wandelt sie in Text um. Die Erkennung läuft mit der Open-Source-Engine Tesseract auf dem RUPO-Server; das Dokument wird an keinen anderen Dienst geschickt. Jede PDF-Seite wird mit 300 dpi gezeichnet und einzeln gelesen. Bei „Durchsuchbares PDF“ sehen die Seiten genau gleich aus, darunter liegt eine unsichtbare Textebene: Du kannst den Text markieren, kopieren und im Dokument suchen. „Reiner Text (TXT)“ liefert nur die erkannte Schrift; bei mehreren Seiten werden die Seiten durch nummerierte Linien getrennt.
„Sprache des Dokuments“ ist standardmäßig die Sprache der Seite; ist das Dokument in einer anderen Sprache, wähle sie aus der Liste. Erkannt werden Türkisch, Englisch, Deutsch, Französisch, Spanisch, Italienisch, Portugiesisch, Japanisch, Koreanisch, Hindi und Arabisch; englische Wörter werden in jeder Sprache zusätzlich gelesen. Die richtige Sprache ist wichtig, damit Buchstaben wie ä, ö, ü und ß korrekt herauskommen. Bei einem PDF kannst du mit dem Feld „Seiten“ nur einzelne Seiten erkennen lassen (zum Beispiel 1, 3-5); höchstens 200 Seiten werden auf einmal verarbeitet. Auch JPG-, PNG-, WebP-, TIFF- und BMP-Bilder lassen sich hochladen. Bis zu 8 Dateien können auf einmal hochgeladen werden; alle werden mit denselben Einstellungen verarbeitet und als eine ZIP-Datei heruntergeladen. Handschrift und sehr unscharfe Bilder werden nicht erkannt.
Von Anfang bis Ende
- Lade dein Dokument hoch. Ein gescanntes PDF oder ein JPG-, PNG-, WebP-, TIFF- oder BMP-Bild; bis zu 8 Dateien auf einmal.
- Wähle Ausgabe und Sprache. Durchsuchbares PDF oder reiner Text. Ist das Dokument nicht in der Sprache der Seite, wähle die richtige aus der Liste „Sprache des Dokuments“.
- Erkennen und herunterladen. Die Ergebniskarte zeigt die Seiten- und Zeichenzahl. Lade herunter; wenn du das Werkzeug verlässt, wird die Kopie auf dem Server gelöscht.
Häufige Fragen
Werden Umlaute richtig erkannt?
Ja. Mit der richtigen Dokumentsprache werden ä, ö, ü und ß korrekt gelesen; auf einer deutschen Seite ist Deutsch bereits voreingestellt. Ist die falsche Sprache gewählt, können diese Buchstaben zu einfachen Buchstaben werden; wähle dann die richtige Sprache und versuche es noch einmal.
Was ist der Unterschied zwischen durchsuchbarem PDF und reinem Text?
Im durchsuchbaren PDF sieht die Seite genau wie gescannt aus; dank der unsichtbaren Textebene lässt sich die Schrift markieren, kopieren und durchsuchen. Reiner Text liefert nur die Schrift; Formatierung, Bilder und Tabellenaufbau werden nicht übernommen. Willst du den Text woanders einfügen, nimm TXT; willst du das Dokument aufbewahren und darin suchen, nimm das durchsuchbare PDF.
Was passiert bei einem PDF, das schon Text enthält?
Die Seiten werden trotzdem erneut aus dem Bild gelesen, und ein Hinweis auf der Ergebniskarte sagt das. Für den Text eines solchen PDFs brauchst du kein OCR; „PDF → Word“ holt ihn direkt heraus und ist schneller.
Bleibt meine Datei auf dem Server?
Nein. Deine Datei kommt nur zur Verarbeitung auf den Server und wird gelöscht, sobald der Auftrag fertig ist; auch das Ergebnis wird gelöscht, wenn du es heruntergeladen und das Werkzeug verlassen hast. Du brauchst kein Konto, keinen Namen und keine E-Mail-Adresse, und deine Dateien werden an keinen Drittanbieter gesendet. Die Nutzung ist kostenlos: Es gibt kein stündliches oder tägliches Kontingent für die Anzahl der Vorgänge, vor der Verarbeitung musst du keine Werbung ansehen, und wir fügen der Ausgabe kein Wasserzeichen hinzu.
Weitere PDF-Tools
RUPO Studio