PDF OCR(문자 인식)
스캔한 PDF나 사진을 검색 가능한 PDF 또는 텍스트로 바꿉니다.
이 도구는 JavaScript로 작동합니다. 사용하려면 브라우저에서 JavaScript를 켜고 페이지를 새로 고치세요.
스캔한 페이지를 검색 가능한 텍스트로.
PDF OCR은 스캔한 PDF나 문서 사진 속 글자를 읽어 텍스트로 바꿉니다. 인식은 오픈 소스 Tesseract 엔진으로 RUPO 서버에서 이루어지며, 문서는 다른 서비스로 보내지지 않습니다. PDF의 각 페이지는 300dpi로 그린 뒤 한 장씩 읽습니다. ‘검색 가능한 PDF’에서는 페이지 모양이 그대로이고 그 아래에 보이지 않는 텍스트 층이 더해져, 텍스트를 선택해 복사하고 문서 안을 검색할 수 있습니다. ‘일반 텍스트(TXT)’는 인식한 글자만 내보내며, 여러 페이지일 때는 번호가 붙은 줄로 페이지를 나눕니다.
‘문서 언어’는 기본으로 페이지 언어입니다. 문서가 다른 언어라면 목록에서 고르세요. 터키어, 영어, 독일어, 프랑스어, 스페인어, 이탈리아어, 포르투갈어, 일본어, 한국어, 힌디어, 아랍어를 인식하며, 영어 단어는 어떤 언어에서도 함께 읽습니다. 글자가 정확히 나오려면 올바른 언어를 고르는 것이 중요합니다. PDF에서는 ‘페이지’ 칸으로 일부 페이지만 인식할 수 있습니다(예: 1, 3-5). 한 번에 최대 200페이지까지 처리합니다. JPG, PNG, WebP, TIFF, BMP 이미지도 올릴 수 있습니다. 한 번에 최대 8개 파일을 올릴 수 있으며, 모두 같은 설정으로 처리되어 ZIP 하나로 내려받습니다. 손글씨와 아주 흐린 이미지는 인식되지 않습니다.
처음부터 끝까지
- 문서를 올리세요. 스캔한 PDF 또는 JPG, PNG, WebP, TIFF, BMP 이미지. 한 번에 최대 8개 파일.
- 출력과 언어를 고르세요. 검색 가능한 PDF 또는 일반 텍스트. 문서가 페이지 언어가 아니라면 ‘문서 언어’ 목록에서 올바른 언어를 고르세요.
- 인식하고 내려받으세요. 결과 카드에 페이지 수와 글자 수가 나옵니다. 내려받으세요. 도구를 나가면 서버의 사본은 삭제됩니다.
자주 묻는 질문
한글은 제대로 인식되나요?
네. 문서 언어를 한국어로 하면 한글을 정확히 읽습니다. 한국어 페이지에서는 기본 언어가 이미 한국어입니다. 인쇄된 가로쓰기 글자가 가장 정확하며, 세로쓰기나 아주 작은 글자는 오류가 늘 수 있습니다. 언어가 맞지 않으면 제대로 읽지 못하니, 그때는 올바른 언어를 골라 다시 해 보세요.
검색 가능한 PDF와 일반 텍스트는 무엇이 다른가요?
검색 가능한 PDF에서는 페이지가 스캔한 모습 그대로 보이고, 보이지 않는 텍스트 층 덕분에 글자를 선택·복사·검색할 수 있습니다. 일반 텍스트는 글자만 내보내며 서식, 이미지, 표 배치는 옮겨지지 않습니다. 텍스트를 다른 곳에 붙여 넣으려면 TXT, 문서를 보관하며 안에서 검색하려면 검색 가능한 PDF가 알맞습니다.
이미 텍스트가 있는 PDF는 어떻게 되나요?
페이지를 이미지에서 다시 읽고, 결과 카드에 그 사실을 알리는 메모가 나옵니다. 이런 PDF의 텍스트를 얻는 데는 OCR이 필요 없습니다. ‘PDF → Word’가 텍스트를 바로, 더 빠르게 꺼냅니다.
파일이 서버에 남나요?
아니요. 파일은 처리를 위해서만 서버로 전송되고 작업이 끝나면 삭제됩니다. 결과 파일도 다운로드한 뒤 도구를 나가면 삭제됩니다. 계정, 이름, 이메일 주소는 필요 없으며 파일이 제3자 서비스로 전송되는 일은 없습니다. 이용은 무료입니다. 처리 횟수에 시간당·일일 한도가 없고, 처리 전에 광고를 볼 필요가 없으며, 결과물에 워터마크를 넣지 않습니다.
다른 PDF 도구
RUPO Studio