기존 텍스트 추출
스캔 이미지의 글자를 인식하는 대신 문서에서 선택 가능한 텍스트 레이어를 읽습니다.
기존 텍스트 레이어를 UTF-8 텍스트 파일로 추출하세요.
파일을 여기에 끌어 놓거나 아래 버튼을 사용하세요.
최대 100 MB 합계 · 파일은 내 기기에 유지
여기에서 문서를 미리 보세요. 내용을 추가할 때는 배치 안내용이므로 저장된 출력물도 확인하세요.
검색, 복사 또는 추가 편집을 위해 PDF의 기존 텍스트 레이어를 추출하세요. 페이지에서의 위치를 기준으로 줄을 묶습니다. 텍스트 중심의 보고서와 문서 보관 자료에 특히 유용합니다.
출력에는 글꼴, 이미지, 페이지 디자인 없이 일반 텍스트만 들어 있습니다. 여러 단으로 된 페이지의 읽기 순서는 시각적 레이아웃과 다를 수 있습니다. 텍스트 레이어가 없는 스캔 페이지는 이 작업으로 문자로 옮길 수 없습니다.
스캔 이미지의 글자를 인식하는 대신 문서에서 선택 가능한 텍스트 레이어를 읽습니다.
페이지 입력란을 사용해 내보낼 범위를 한 장, 편지 또는 부록으로 제한하세요.
워드 프로세서 레이아웃 없이 일반적인 텍스트 편집기에서 열리는 일반 텍스트 파일을 다운로드하세요.
가까이 있는 텍스트 조각을 줄로 묶습니다. 여러 단의 읽기 순서는 여전히 원본 페이지와 대조해야 합니다.
인쇄된 레이아웃보다 단어가 더 중요할 때 일반 텍스트가 유용합니다. 로컬 폴더에서 검색하거나, 문구를 편집기에 복사하거나, 노트 작성을 위한 깔끔한 출발점을 마련할 수 있습니다. 텍스트 작업에 이미지가 많은 페이지 디자인을 끌어올 필요도 없습니다. 텍스트 레이어가 페이지에 보이는 내용과 항상 같지는 않습니다. 합자, 숨은 OCR 오류, 단의 순서가 내보내기를 바꿀 수 있습니다. 결과를 추가 작업에 사용하기 전에 대표적인 단락과 중요한 이름 또는 숫자를 확인하세요.
사용이 허용된 논문의 텍스트를 내보내 인용문을 모으고 독서 노트를 작성하세요. 각 인용문을 원본 페이지와 대조하고 페이지 번호를 따로 기록하세요.
표준 서신의 문구를 텍스트 편집기로 옮겨 수정 초안을 작성하세요. 기관 서식으로 옮기기 전에 인사말, 날짜, 줄 바꿈을 확인하세요.
사양 문구를 가져와 검색 가능한 작업용 노트를 만드세요. 특이한 글꼴 인코딩은 추출된 문자를 바꿀 수 있으므로 단위, 기호, 번호가 붙은 단계를 PDF와 비교하세요.
기존의 선택 가능한 텍스트 레이어가 있는 PDF를 선택하세요.
스크린샷을 선택하면 확대할 수 있습니다.
페이지를 선택하고 필요한 경우 다운로드 이름을 지정하세요.
스크린샷을 선택하면 확대할 수 있습니다.
TXT 파일을 다운로드하고 문구를 PDF와 대조하세요.
스크린샷을 선택하면 확대할 수 있습니다.
스크린샷은 무해한 예제 파일로 이 도구 모음을 사용하는 모습을 보여 줍니다. 실제 파일 이름, 페이지 수 및 설정은 다를 수 있습니다.
| 설정 | 예상되는 동작 |
|---|---|
| 지원하는 입력 형식 | |
| 처리 위치 | 사용자의 브라우저 |
| 파일 선택 | 입력 파일 1개 |
| 입력 크기 | 총 100 MB이며, 디코딩한 이미지와 페이지에는 픽셀 수 제한도 적용됩니다 |
| 페이지 선택 | 작업당 최대 200페이지를 선택할 수 있습니다. 페이지 입력란을 비워 두면 PDF가 200페이지 이하일 때만 모든 페이지를 의미합니다. 더 긴 문서는 범위를 나누어 처리하세요. |
페이지가 스캔본이어서 어떤 문구도 선택할 수 없다면 텍스트 추출 전에 OCR 텍스트 레이어를 추가하고 확인하세요.
PDF의 텍스트 조각은 눈에 보이는 위치와 다른 순서로 들어 있을 수 있습니다. 사이드바, 각주, 2단 레이아웃은 내보낸 문장이 중간에 끊어지는 흔한 원인입니다. 화면의 글자가 추출 시 동일한 문자를 제공하지 않는 글꼴 매핑에 의존할 수도 있습니다. TXT를 신뢰할 수 있는 원문으로 취급하기 전에 단이나 페이지 경계를 가로지르는 단락을 비교하고, 기술 기호와 “fi” 같은 합자를 확인하세요.
| 상황 | 해결 방법 |
|---|---|
| 텍스트 파일이 비어 있거나 변환이 거부됩니다 | 선택한 페이지에 텍스트 레이어가 없을 수 있습니다. 사용할 수 있다면 먼저 OCR을 사용하세요. |
| 일부 글자가 올바르지 않습니다 | PDF의 텍스트 인코딩이나 OCR 레이어에 결함이 있을 수 있습니다. 이름, 숫자, 기호를 눈에 보이는 페이지와 비교하세요. |
| 편집 가능한 서식 있는 문서가 필요합니다 | PDF를 Word로 변환을 사용해 DOCX 초안을 만드세요. 정확한 레이아웃은 여전히 검토가 필요합니다. |
왼쪽 단에 A1, A2, 오른쪽 단에 B1, B2가 있다고 생각해 보세요. 위치 기반 묶기는 A1 B1 다음에 A2 B2를 만들면서 두 단을 섞을 수 있습니다. 추출한 줄을 재배열하기 전에 PDF의 각 단을 읽으세요. 깔끔해 보이는 텍스트 파일도 서로 무관한 문장을 이어 붙일 수 있습니다.
먼저 OCR을 실행해 인식한 텍스트를 추가하세요. 이미지로만 된 원본을 선택하면 텍스트가 없다는 명확한 메시지가 표시됩니다.
위치 기반 줄 묶기는 줄 순서를 대략적으로 재현합니다. 단락 나누기와 복잡한 단 구성은 편집 검토가 필요합니다.
선택한 페이지의 텍스트는 빈 줄로 연결됩니다. PDF에 대한 정확한 인용이 필요하다면 실제 파일의 페이지 범위를 노트에 기록하세요.
다음으로 PDF OCR 텍스트 인식, PDF 뷰어를 이용하세요. 다른 언어의 출력이 필요하면 PDF 번역 절차를 읽어 보세요. 텍스트 추출 자체는 번역하지 않습니다.