PDF를 XML로 변환

PDF 텍스트 항목과 페이지 기하 정보를 명세가 설명된 XML 구조로 추출합니다.

선택: PDF 파일

파일을 여기에 끌어 놓거나 아래 버튼을 사용하세요.

최대 25 MB 합계 · 파일은 내 기기에 유지

목차항목 수: 10

XML 내보내기에는 무엇이 포함되나요?

PDF의 선택 가능한 텍스트 레이어를 XML로 내보내세요. 파일은 텍스트 항목을 원래 페이지 번호별로 묶고 페이지 기하 정보, 텍스트 방향, 위치 변환을 기록합니다. 검토와 후속 처리를 위한 구조화된 근거 자료를 제공합니다.

XML은 PDF 텍스트 리더가 추출한 내용을 설명합니다. 문서를 생성할 때 사용했을 수 있는 원래 XML이 아니며, 청구서 필드를 식별하거나 표의 관계를 재구성하거나 이미지를 내보내지 않습니다. 이미지만 있는 페이지에는 먼저 OCR이 필요합니다.

PDF를 XML로 변환하는 기능

페이지별 요소

원본 페이지 번호, 회전, 보이는 페이지 경계를 추출한 텍스트 옆에 유지합니다. 선택한 범위를 검토할 때 유용한 참조가 됩니다.

이스케이프된 텍스트 값

앰퍼샌드와 꺾쇠괄호 같은 문자는 XML 요소 안에서 데이터로 유지됩니다. 마크업처럼 보이는 텍스트가 이 내보내기를 통해 실행 가능한 페이지 내용으로 바뀌지 않습니다.

복원 가능한 예외 문자열

XML에서 직접 표현할 수 없는 문자는 명확하게 표시된 JSON 문자열 인코딩을 사용합니다. 수신 프로그램은 이 표시를 이용해 값을 정확히 복원할 수 있습니다.

브라우저 내 처리

기기에서 XML 파일을 만듭니다. 원본을 변환용으로 업로드하거나 다시 작성하지 않습니다.

PDF에서 XML을 추출하려면 어떻게 하나요?

  1. 선택 가능한 텍스트가 포함된 암호화되지 않은 PDF를 선택하세요.
  2. 페이지 입력란에 필요한 페이지 번호나 범위를 입력하세요.
  3. 파일을 변환하고 XML 결과를 다운로드하세요.
  4. 텍스트 편집기나 XML을 지원하는 애플리케이션에서 XML을 여세요.
  5. 요소를 다른 시스템에 매핑하기 전에 익숙한 페이지와 구절을 비교하세요.

원본 PDF 선택

읽을 수 있는 텍스트 레이어가 있는 PDF를 선택하세요.

스크린샷을 선택하면 확대할 수 있습니다.
PDF를 XML로: 원본 PDF 선택.

페이지 범위 제한

XML 추출에 필요한 페이지를 선택하세요.

스크린샷을 선택하면 확대할 수 있습니다.
PDF를 XML로: 페이지 범위 및 추출 제한.

XML 저장

XML을 다운로드하고 페이지 요소를 살펴보세요.

스크린샷을 선택하면 확대할 수 있습니다.
PDF를 XML로: 완료된 XML 내보내기 다운로드.

스크린샷은 무해한 예제 파일로 이 도구 모음을 사용하는 모습을 보여 줍니다. 실제 파일 이름, 페이지 수 및 설정은 다를 수 있습니다.

PDF 텍스트를 확인할 때 XML을 사용하는 이유는 무엇인가요?

XML 기반 작업 흐름은 자체 변환 규칙을 적용하기 전에 명확한 페이지 요소와 항목 요소가 필요할 수 있습니다. 팀은 요소를 검토하고 원본 페이지 참조를 유지하며, 알려진 문서 유형에 대해 별도 매핑을 구축할 수 있습니다. 매핑과 추출은 구분하세요. 한 텍스트 항목이 다른 항목 근처에 있다는 것만으로 업무상 관계가 확정되지는 않습니다.

누가 이 XML 출력을 사용할 수 있나요?

통합 개발자

페이지 요소와 항목 요소를 통제된 문서 처리 과정의 입력으로 사용할 수 있습니다.

문서 기록 관리자

원본 PDF를 보존하면서 텍스트도 계속 사용할 수 있는지 확인할 수 있습니다.

데이터 감사자

변환 규칙을 채택하기 전에 출력 값 샘플을 원본 페이지와 비교할 수 있습니다.

설정 및 출력 확인

설정예상 결과
원본최대 25 MiB의 PDF 한 개, 원본 500페이지 이하.
페이지 범위최대 200페이지 선택. 범위를 비워 두면 전체 페이지 수가 이 제한 안에 있을 때만 모든 페이지를 포함합니다.
텍스트 제한페이지당 최대 20,000항목, 작업당 100,000항목, 텍스트 200만 자.
다운로드 파일최대 64 MiB의 XML 문서. 외부 DTD나 스키마를 가져오지 않습니다.

페이지를 확인한 뒤 익숙한 레이블을 매핑하세요

납품 문서에서는 한 페이지를 내보내고 익숙한 참조 번호를 찾으세요. 텍스트 변환과 주변 항목을 원본 페이지와 대조하세요. 그런 다음 애플리케이션에서 해당 문서 유형의 규칙을 적용할 수 있습니다. 서로 다른 레이아웃에서 근처에 있는 모든 숫자를 같은 필드로 취급하지 마세요.

PDF를 XML로 변환할 때 문제 해결

상황확인할 사항
XML이 공급업체의 스키마와 맞지 않음내보내기는 자체 추출 구조를 사용합니다. 수신 시스템이 기대하는 스키마에 맞는 별도 매핑을 만드세요.
요소에 encoding 속성이 있음encoding 값이 json이면 요소의 텍스트를 JSON 문자열로 파싱하여 XML에 직접 넣을 수 없는 문자를 복원하세요.
단어가 없거나 예상과 다른 순서로 나타남스캔한 페이지나 특이한 텍스트 배치가 있는지 확인하세요. 필요한 곳에 OCR을 적용하고 좌표를 검토하세요.

자주 묻는 질문

PDF를 XML로 변환하면 원래 소스 XML이 복원되나요?

아니요. PDF는 일반적으로 원본 데이터 모델을 보관하지 않습니다. 이 내보내기는 리더가 추출할 수 있는 텍스트 레이어와 기하 정보를 기록합니다.

PDF 태그가 XML 문서 모델로 변환되나요?

아니요. 태그가 있는 PDF의 의미 구조, 제목, 표 구조를 재구성하지 않습니다. 페이지 요소와 항목 요소는 추출 결과를 설명합니다.

이 XML을 다시 같은 PDF로 변환할 수 있나요?

XML을 PDF로 변환하는 도구는 XML 소스를 인쇄할 수 있지만, 이 추출 파일로 원래 페이지 디자인을 재현할 수는 없습니다. 원본 PDF를 보관하세요.

관련 도구

XML을 PDF로 변환, PDF를 JSON으로 변환, PDF 문자 인식.