PDF OCR 텍스트 인식

원래 페이지 모양을 유지하면서 스캔을 검색 가능하게 만드세요.

선택: PDF 파일

파일을 여기에 끌어 놓거나 아래 버튼을 사용하세요.

최대 100 MB 합계 · 파일은 내 기기에 유지

목차항목 수: 12

PDF에 OCR이 필요한 경우는 언제인가요?

브라우저에서 실행되는 Tesseract로 스캔 PDF에 검색 가능한 텍스트 레이어를 추가하세요. 원본과 일치하는 언어를 선택하세요. 기본적으로 영어가 선택되어 있습니다. 지원되는 뷰어에서는 스캔 페이지의 원래 모양을 유지하면서 인식된 단어를 검색하고 선택할 수 있습니다.

기본 설정에서는 이미 텍스트가 있는 페이지를 유지합니다. 선택한 모든 페이지를 인식할 수도 있지만, 새 레이어가 추가되어 기존 텍스트가 중복될 수 있습니다. OCR 정확도는 초점, 대비, 언어 및 페이지 정렬에 따라 달라집니다. 작은 글씨, 손글씨, 특수한 글꼴 및 노이즈가 많은 스캔은 결과를 그대로 믿지 말고 꼼꼼히 검토해야 합니다.

PDF OCR 텍스트 인식 기능

검색 가능한 PDF 또는 TXT

인식한 문구를 일반 텍스트로 다운로드하거나 PDF에서 유지된 스캔 모양 위에 텍스트 레이어를 추가하세요.

선택한 페이지 최대 20개

다운로드에는 선택한 페이지만 포함됩니다. 최대 20페이지를 선택하세요. 전체 문서를 포함하려면 문서가 20페이지 이하인 경우에만 페이지 입력란을 비워 두세요.

인식 설정

원본 언어, 200 또는 300 DPI, 인식용 회전 및 자동·단일 블록·분산 텍스트 페이지 레이아웃을 선택하세요. 지원 언어는 아래 자주 묻는 질문에 나와 있습니다.

기본적으로 기존 텍스트 유지

이미 텍스트가 있는 페이지는 유지할 수 있습니다. 텍스트 레이어가 중복될 가능성을 고려한 경우에만 강제 인식을 사용하세요.

스캔에 검색 가능한 텍스트 레이어를 추가하는 이유는 무엇인가요?

스캔은 페이지를 그림으로 저장하므로 일반적인 텍스트 검색으로 인쇄된 단어를 찾을 수 없습니다. 선택한 언어의 OCR로 타이핑된 스캔을 검색 가능하게 만들고 복사하여 붙여넣거나 나중에 텍스트를 추출할 수 있습니다. 페이지를 새로 디자인하는 것보다 알고 있는 이름이나 문구를 찾는 것이 중요한 자료 보관에 특히 유용합니다. 스캔이 선명해 보여도 인식된 레이어에는 오류가 있을 수 있습니다. 검색과 선택을 확인한 다음 추출한 문구를 사용하기 전에 이름, 참조 및 숫자를 페이지 이미지와 비교하세요.

PDF 스캔의 OCR은 누가 사용하나요?

도서관 및 기록 관리 담당자

짧은 타이핑 기록을 제목, 이름 또는 참조 번호로 검색할 수 있게 만드세요. 원본 스캔을 보관하고 다운로드한 사본에서 해당 검색어를 확인하세요. 쉽게 혼동되는 문자도 포함하여 확인하세요.

스캔 배포 자료를 사용하는 학생

학습 노트를 만들기 전에 타이핑된 수업 자료를 검색 가능하게 만드세요. 손글씨 주석의 인식은 여전히 신뢰하기 어려울 수 있으므로 인용할 문구를 스캔과 대조하세요.

일반 인사 행정 담당자

사용이 승인된 스캔 메모에서 내부 색인용 문구를 추출하세요. 인식된 문자 하나가 식별자를 바꿀 수 있으므로 날짜, 직원 이름 및 참조 번호를 꼼꼼히 비교하세요.

스캔 PDF를 검색 가능하게 만들려면 어떻게 하나요?

  1. 암호화되지 않은 스캔을 선택하고 최대 20페이지를 지정하세요. PDF 다운로드에는 선택한 페이지만 포함됩니다. 이런 종류의 스캔을 처음 사용한다면 짧은 샘플부터 시작하세요.
  2. 텍스트 언어에서 원본 언어를 선택하세요. 검색 가능한 PDF 또는 일반 텍스트를 선택하고 인식 해상도를 설정한 다음, 스캔에 필요하다면 회전이나 페이지 레이아웃을 선택하세요.
  3. 기본 설정대로 기존 텍스트를 유지하거나, 필요를 판단하여 선택한 모든 페이지 인식을 선택하세요. OCR을 시작하고 인식이 끝날 때까지 기다리세요.
  4. 결과를 다운로드하세요. 알고 있는 문구를 검색하고 한 줄을 복사한 다음 철자와 숫자를 원본 스캔과 비교하세요.

원본 파일 선택

지원되는 언어의 스캔을 선택하고 최대 20페이지를 지정하세요.

스크린샷을 선택하면 확대할 수 있습니다.
PDF OCR 텍스트 인식, 1단계: 지원되는 언어의 스캔을 선택하고 최대 20페이지를 지정하세요.

도구 설정 검토

원본 언어, OCR 출력, 해상도, 레이아웃 및 인식 방향을 선택하세요.

스크린샷을 선택하면 확대할 수 있습니다.
PDF OCR 텍스트 인식, 2단계: 원본 언어, OCR 출력, 해상도, 레이아웃 및 인식 방향을 선택하세요.

결과 다운로드 및 확인

결과를 다운로드하고 인식한 텍스트를 원본 스캔과 대조하세요.

스크린샷을 선택하면 확대할 수 있습니다.
PDF OCR 텍스트 인식, 3단계: 결과를 다운로드하고 인식한 텍스트를 원본 스캔과 대조하세요.

스크린샷은 무해한 예제 파일로 이 도구 모음을 사용하는 모습을 보여 줍니다. 실제 파일 이름, 페이지 수 및 설정은 다를 수 있습니다.

검색 가능하게 만든 이미지 전용 확인 목록

원본 페이지는 추출할 텍스트가 없는 이미지입니다. OCR은 페이지의 보이는 모양을 유지하면서 텍스트 레이어를 추가합니다. 따라서 두 이미지는 같아 보이며, 다운로드 가능한 결과에는 인식된 단어도 들어 있습니다.

이전: 이미지로만 된 페이지

원본에서 텍스트를 추출한 결과는 0자였습니다.

선택 가능한 텍스트 레이어가 없는 OCR 전의 실제 이미지 점검표.

이후: 같은 페이지, 검색 가능한 텍스트

결과에는 샘플의 6줄이 모두 포함됩니다. 시험한 1,300픽셀 이미지 크기에서 렌더링된 픽셀이 원본과 일치합니다.

같은 점검표 모양과 새 텍스트 레이어가 있는 실제 검색 가능한 결과 PDF.
원본 텍스트
0자
결과 텍스트
93자
인식 확인
샘플 6줄 중 6줄
이 결과에서 추출한 텍스트 읽기
문서 확인 목록
페이지 순서를 확인합니다
원본 파일을 보관합니다
공유 전에 이름과 숫자를 확인합니다
글자가 선명하게 읽히는지 확인합니다
이것은 가상의 테스트 문서입니다

사용한 설정: 1페이지, 검색 가능한 PDF, 200 DPI 인식, 단일 텍스트 블록, 한국어, 원래 방향.

글자가 크고 선명한 이 한국어 샘플은 작은 글자, 손글씨, 기울어진 스캔, 다른 언어의 정확도 벤치마크가 아닙니다. 자신의 결과에서 이름, 금액, 날짜를 교정하세요.

확인일: . 직접 만든 민감한 정보가 없는 한국어 샘플을 버전 3.17.0으로 로컬 Chromium에서 처리했습니다. 이 예시는 제공된 파일의 결과를 보여 주며 실제 운영 호스팅 환경의 벤치마크는 아닙니다. 3.18.0 버전에서는 이 다운로드용 예제 PDF의 내장 글꼴에서 사용하지 않는 글리프를 줄였습니다. 페이지 모양과 추출된 텍스트가 원래 결과와 같은지 확인했습니다. 다운로드 크기와 체크섬은 최적화된 사본의 값입니다.

설정 및 결과 확인

설정예상 결과
지원 입력 형식PDF
처리 위치내 기기의 브라우저
파일 선택입력 파일 1개
입력 크기최대 100 MB. 기기 메모리 및 디코딩한 페이지 제한이 적용됩니다.
인식 작업 범위선택한 페이지 최대 20개. 검색 가능한 PDF 다운로드에는 해당 페이지만 포함됩니다.

도구는 텍스트 레이어를 추가하며, 표를 편집 가능한 스프레드시트로 재구성하거나 내용상의 사실을 수정하지는 않습니다. OCR은 이름, 계좌 번호 및 정확성이 중요한 다른 텍스트를 검토하는 일을 대신할 수 없습니다.

스캔을 바꾸지 않고 인식 방향 확인

회전 설정은 인식에 제공되는 렌더링된 스캔을 돌리며, 검색 가능한 PDF는 원본 페이지의 보이는 모양을 유지합니다. 독자가 페이지를 똑바로 보게 하려면 PDF 회전이 필요하며 이 설정으로 대신할 수 없습니다. 기존 텍스트 레이어에 오류가 있다면 강제 인식으로 다른 레이어가 추가되어 검색 결과가 중복될 수 있습니다. 이런 경우 일반 텍스트 OCR로 추출한 뒤 확인하는 방식이 유용할 수 있습니다. 0/O, 1/l 및 소수점처럼 혼동하기 쉬운 문자를 이미지와 비교하세요.

PDF OCR 텍스트 인식 문제 해결

상황해결 방법
이름이나 숫자가 틀린 경우인식한 텍스트를 이미지와 비교하세요. 다시 사용하기 전에 후속 작업에 적합한 편집기에서 수정하세요.
기존의 잘못된 OCR 레이어가 개선되지 않는 경우선택한 모든 페이지 인식을 선택하여 새 레이어를 추가하세요. 기존 텍스트는 유지되므로 기존 레이어 때문에 검색 결과가 중복될 수 있습니다. 깔끔한 추출 결과가 필요하다면 일반 텍스트로 내보내세요.
긴 문서 묶음이 거부되는 경우20페이지 이하의 묶음들로 나누고 각 묶음에 OCR을 적용한 다음 확인하고 병합하세요.

실용적인 예시와 최종 확인 사항

타이핑된 점검표라면 검색 가능한 PDF에서 알고 있는 장비 ID를 검색한 다음 그 ID와 측정값 하나를 텍스트 편집기에 복사하세요. 두 값을 스캔과 비교하고 의도한 줄이 선택 강조되는지 확인하세요. 단어 검색이 성공했다는 것만으로 올바른 읽기 순서나 신뢰할 수 있는 숫자 추출이 확인되는 것은 아닙니다.

자주 묻는 질문

OCR을 적용하면 페이지가 편집 가능한 Word 내용으로 바뀌나요?

출력은 텍스트 레이어가 추가된 PDF입니다. 흐름을 다시 구성한 텍스트 문서가 필요하다면 이후 PDF를 Word로 변환을 사용하세요.

어떤 언어를 사용할 수 있나요?

이 릴리스에는 영어, 스페인어, 포르투갈어, 독일어, 인도네시아어, 러시아어, 프랑스어, 이탈리아어, 터키어, 아랍어, 중국어 간체, 일본어, 한국어, 폴란드어 및 힌디어 인식 모델이 포함되어 있습니다. 기본값은 영어이며 원본과 일치하는 언어를 선택하세요. OCR은 문자를 인식할 뿐 문서를 번역하지 않습니다. 다른 언어에는 별도로 구성된 OCR 작업 절차가 필요합니다.

페이지를 건너뛴 이유는 무엇인가요?

기본 설정은 기존 텍스트 레이어가 있는 페이지를 유지합니다. 해당 페이지에도 인식을 실행하려면 선택한 모든 페이지 인식을 선택하세요.

선택하지 않은 페이지도 출력에 포함되나요?

아니요. 검색 가능한 PDF에는 선택한 페이지만 포함됩니다. 긴 문서를 하나로 유지하려면 최대 20페이지씩 인식하고 확인한 출력을 원래 순서대로 결합하세요.

인식용 회전이 눈에 보이는 PDF 페이지도 돌리나요?

아니요. 인식에 제공되는 이미지만 돌리고 PDF에는 원본 페이지의 보이는 모양을 유지합니다. 저장된 페이지 자체가 똑바로 보여야 한다면 먼저 PDF 회전을 사용하세요.

이 도구가 손글씨를 정확하게 읽거나 표를 재구성할 수 있나요?

도구는 선택한 언어의 텍스트를 인식하며, 신뢰할 수 있는 손글씨 인식이나 표 셀 재구성을 보장하지 않습니다. 선명하고 바른 방향의 타이핑된 스캔을 사용하고 Word나 스프레드시트 작업에 가져가기 전에 문구를 확인하세요.

관련 도구 및 가이드

다음 도구를 이용해 보세요: PDF를 Word로 변환, PDF를 텍스트로 변환, 스캔 이미지를 PDF로 변환. 장기 보관 요구 사항은 PDF를 PDF/A로을 참조하세요. 검색 가능한 PDF가 자동으로 PDF/A가 되는 것은 아닙니다.