페이지별 요소
원본 페이지 번호, 회전, 보이는 페이지 경계를 추출한 텍스트 옆에 유지합니다. 선택한 범위를 검토할 때 유용한 참조가 됩니다.
PDF 텍스트 항목과 페이지 기하 정보를 명세가 설명된 XML 구조로 추출합니다.
파일을 여기에 끌어 놓거나 아래 버튼을 사용하세요.
최대 25 MB 합계 · 파일은 내 기기에 유지
여기에서 문서를 미리 보세요. 내용을 추가할 때는 배치 안내용이므로 저장된 출력물도 확인하세요.
PDF의 선택 가능한 텍스트 레이어를 XML로 내보내세요. 파일은 텍스트 항목을 원래 페이지 번호별로 묶고 페이지 기하 정보, 텍스트 방향, 위치 변환을 기록합니다. 검토와 후속 처리를 위한 구조화된 근거 자료를 제공합니다.
XML은 PDF 텍스트 리더가 추출한 내용을 설명합니다. 문서를 생성할 때 사용했을 수 있는 원래 XML이 아니며, 청구서 필드를 식별하거나 표의 관계를 재구성하거나 이미지를 내보내지 않습니다. 이미지만 있는 페이지에는 먼저 OCR이 필요합니다.
원본 페이지 번호, 회전, 보이는 페이지 경계를 추출한 텍스트 옆에 유지합니다. 선택한 범위를 검토할 때 유용한 참조가 됩니다.
앰퍼샌드와 꺾쇠괄호 같은 문자는 XML 요소 안에서 데이터로 유지됩니다. 마크업처럼 보이는 텍스트가 이 내보내기를 통해 실행 가능한 페이지 내용으로 바뀌지 않습니다.
XML에서 직접 표현할 수 없는 문자는 명확하게 표시된 JSON 문자열 인코딩을 사용합니다. 수신 프로그램은 이 표시를 이용해 값을 정확히 복원할 수 있습니다.
기기에서 XML 파일을 만듭니다. 원본을 변환용으로 업로드하거나 다시 작성하지 않습니다.
읽을 수 있는 텍스트 레이어가 있는 PDF를 선택하세요.
스크린샷을 선택하면 확대할 수 있습니다.
XML 추출에 필요한 페이지를 선택하세요.
스크린샷을 선택하면 확대할 수 있습니다.
XML을 다운로드하고 페이지 요소를 살펴보세요.
스크린샷을 선택하면 확대할 수 있습니다.
스크린샷은 무해한 예제 파일로 이 도구 모음을 사용하는 모습을 보여 줍니다. 실제 파일 이름, 페이지 수 및 설정은 다를 수 있습니다.
XML 기반 작업 흐름은 자체 변환 규칙을 적용하기 전에 명확한 페이지 요소와 항목 요소가 필요할 수 있습니다. 팀은 요소를 검토하고 원본 페이지 참조를 유지하며, 알려진 문서 유형에 대해 별도 매핑을 구축할 수 있습니다. 매핑과 추출은 구분하세요. 한 텍스트 항목이 다른 항목 근처에 있다는 것만으로 업무상 관계가 확정되지는 않습니다.
페이지 요소와 항목 요소를 통제된 문서 처리 과정의 입력으로 사용할 수 있습니다.
원본 PDF를 보존하면서 텍스트도 계속 사용할 수 있는지 확인할 수 있습니다.
변환 규칙을 채택하기 전에 출력 값 샘플을 원본 페이지와 비교할 수 있습니다.
| 설정 | 예상 결과 |
|---|---|
| 원본 | 최대 25 MiB의 PDF 한 개, 원본 500페이지 이하. |
| 페이지 범위 | 최대 200페이지 선택. 범위를 비워 두면 전체 페이지 수가 이 제한 안에 있을 때만 모든 페이지를 포함합니다. |
| 텍스트 제한 | 페이지당 최대 20,000항목, 작업당 100,000항목, 텍스트 200만 자. |
| 다운로드 파일 | 최대 64 MiB의 XML 문서. 외부 DTD나 스키마를 가져오지 않습니다. |
납품 문서에서는 한 페이지를 내보내고 익숙한 참조 번호를 찾으세요. 텍스트 변환과 주변 항목을 원본 페이지와 대조하세요. 그런 다음 애플리케이션에서 해당 문서 유형의 규칙을 적용할 수 있습니다. 서로 다른 레이아웃에서 근처에 있는 모든 숫자를 같은 필드로 취급하지 마세요.
| 상황 | 확인할 사항 |
|---|---|
| XML이 공급업체의 스키마와 맞지 않음 | 내보내기는 자체 추출 구조를 사용합니다. 수신 시스템이 기대하는 스키마에 맞는 별도 매핑을 만드세요. |
| 요소에 encoding 속성이 있음 | encoding 값이 json이면 요소의 텍스트를 JSON 문자열로 파싱하여 XML에 직접 넣을 수 없는 문자를 복원하세요. |
| 단어가 없거나 예상과 다른 순서로 나타남 | 스캔한 페이지나 특이한 텍스트 배치가 있는지 확인하세요. 필요한 곳에 OCR을 적용하고 좌표를 검토하세요. |
아니요. PDF는 일반적으로 원본 데이터 모델을 보관하지 않습니다. 이 내보내기는 리더가 추출할 수 있는 텍스트 레이어와 기하 정보를 기록합니다.
아니요. 태그가 있는 PDF의 의미 구조, 제목, 표 구조를 재구성하지 않습니다. 페이지 요소와 항목 요소는 추출 결과를 설명합니다.
XML을 PDF로 변환하는 도구는 XML 소스를 인쇄할 수 있지만, 이 추출 파일로 원래 페이지 디자인을 재현할 수는 없습니다. 원본 PDF를 보관하세요.