PDF OCR(文字認識)
スキャンした PDF や写真を、検索できる PDF かテキストに変えます。
このツールはJavaScriptで動作します。使うには、ブラウザでJavaScriptを有効にしてページを再読み込みしてください。
スキャンしたページを、検索できる文字に。
PDF OCR は、スキャンした PDF や文書の写真に書かれた文字を読み取り、テキストに変えます。認識はオープンソースの Tesseract エンジンで RUPO のサーバー上で行われ、文書がほかのサービスに送られることはありません。PDF の各ページは 300 dpi で描画し、1 ページずつ読み取ります。「検索できる PDF」ではページの見た目はそのままで、下に見えない文字の層が加わります。文字を選択してコピーしたり、文書の中を検索したりできます。「プレーンテキスト(TXT)」は認識した文字だけを出力し、複数ページのときは番号付きの線でページを区切ります。
「文書の言語」の初期設定はページの言語です。文書が別の言語なら一覧から選んでください。トルコ語、英語、ドイツ語、フランス語、スペイン語、イタリア語、ポルトガル語、日本語、韓国語、ヒンディー語、アラビア語を認識でき、英語の単語はどの言語でもあわせて読み取ります。文字を正しく出すには、正しい言語を選ぶことが大切です。PDF では「ページ」欄で一部のページだけを認識できます(例:1, 3-5)。一度に処理できるのは最大 200 ページです。JPG、PNG、WebP、TIFF、BMP の画像もアップロードできます。一度に最大 8 ファイルまでアップロードでき、すべて同じ設定で処理されて一つの ZIP でダウンロードされます。手書き文字と、ひどくぼやけた画像は認識されません。
最初から最後まで
- 文書をアップロードします。 スキャンした PDF、または JPG、PNG、WebP、TIFF、BMP の画像。一度に最大 8 ファイル。
- 出力と言語を選びます。 検索できる PDF かプレーンテキスト。文書がページの言語でなければ、「文書の言語」の一覧から正しい言語を選びます。
- 認識してダウンロードします。 結果カードにページ数と文字数が表示されます。ダウンロードしてください。ツールを離れると、サーバー上のコピーは削除されます。
よくある質問
日本語の文字は正しく認識されますか?
はい。文書の言語を日本語にすれば、ひらがな・カタカナ・漢字を読み取ります。日本語のページでは初期設定がすでに日本語です。横書きの印刷文字がいちばん正確で、縦書きや小さすぎる文字は誤りが増えることがあります。言語が違うと正しく読めないので、そのときは正しい言語を選んでもう一度試してください。
検索できる PDF とプレーンテキストの違いは?
検索できる PDF では、ページはスキャンしたままの見た目で、見えない文字の層のおかげで文字を選択・コピー・検索できます。プレーンテキストは文字だけを出力し、書式、画像、表の配置は引き継がれません。ほかの場所に貼り付けるなら TXT、文書を保存して中を検索したいなら検索できる PDF が向いています。
すでに文字を含む PDF ではどうなりますか?
ページは画像からもう一度読み取られ、結果カードにそのことを示す注記が出ます。こうした PDF の文字を取り出すのに OCR は必要ありません。「PDF → Word」ならそのまま、より速く取り出せます。
ファイルはサーバーに残りますか?
いいえ。ファイルは処理のためだけにサーバーへ送られ、処理が終わると削除されます。結果もダウンロードしてツールを閉じると削除されます。アカウント、名前、メールアドレスは不要で、ファイルが第三者のサービスに送られることはありません。利用は無料です。処理回数に 1 時間あたり・1 日あたりの上限はなく、処理の前に広告を見る必要もなく、出力に透かしを入れることもありません。
その他のPDFツール
RUPO Studio