PDF를 JSON으로 변환

선택 가능한 텍스트, 페이지 기하 정보, 텍스트 위치를 JSON으로 내보냅니다.

선택: PDF 파일

파일을 여기에 끌어 놓거나 아래 버튼을 사용하세요.

최대 25 MB 합계 · 파일은 내 기기에 유지

목차항목 수: 10

PDF에서 JSON으로 무엇을 추출할 수 있나요?

PDF의 텍스트 레이어를 JSON 파일로 바꾸어 살펴보거나 후속 처리에 사용하세요. 내보내기에는 선택한 페이지, 페이지 크기, PDF 리더가 반환한 텍스트 항목이 위치 및 변환 정보와 함께 기록됩니다.

PDF에는 페이지를 표시하기 위한 명령이 저장됩니다. 이 도구는 청구서 필드를 추론하거나 표를 재구성하거나 원래 제목 수준을 식별하지 않습니다. 스캔한 페이지의 단어를 내보내려면 먼저 OCR 문자 인식이 필요합니다.

PDF를 JSON으로 변환하는 기능

페이지 선택

원래 페이지 번호를 유지하면서 특정 페이지 범위를 내보내세요. 긴 문서를 처리하기 전에 작은 샘플을 더 쉽게 확인할 수 있습니다.

좌표가 포함된 텍스트

텍스트 항목을 페이지 기하 정보 및 위치 정보와 함께 보관하세요. 좌표를 해석하고 항목 간의 시각적 관계를 확인할 때는 원본 PDF를 참조하세요.

기계가 읽을 수 있는 출력

자체 파서나 검토 과정에서 사용할 수 있는 유효한 JSON을 다운로드하세요. 내보낸 텍스트는 데이터로서 이스케이프 처리되며, 도구는 문서 내용을 실행하지 않습니다.

기기 내 처리

선택한 PDF를 브라우저에서 읽습니다. 문서를 변환 서버로 보내지 않으며 원본 파일도 수정하지 않습니다.

PDF 텍스트를 JSON으로 변환하려면 어떻게 하나요?

  1. 리더에서 텍스트를 선택할 수 있는 암호화되지 않은 PDF를 선택하세요.
  2. 1, 3-5와 같은 페이지 번호를 입력하거나, 허용되는 모든 페이지를 포함하려면 페이지 입력란을 비워 두세요.
  3. 변환을 시작하고 JSON 파일을 다운로드하세요.
  4. JSON 뷰어나 편집기에서 파일을 열고, 익숙한 구절을 해당 PDF 페이지와 비교하세요.
  5. 데이터를 다른 애플리케이션에서 사용하기 전에 좌표, 읽기 순서, 빈 페이지 여부를 확인하세요.

PDF 선택

선택 가능한 텍스트가 포함된 PDF를 선택하세요.

스크린샷을 선택하면 확대할 수 있습니다.
PDF를 JSON으로: 텍스트 레이어가 있는 샘플 PDF 선택.

페이지 선택

페이지 범위를 설정하고 추출 제한을 검토하세요.

스크린샷을 선택하면 확대할 수 있습니다.
PDF를 JSON으로: 페이지 선택 및 추출 설정.

JSON 다운로드

JSON을 저장하고 원본 페이지와 비교하세요.

스크린샷을 선택하면 확대할 수 있습니다.
PDF를 JSON으로: 완료된 구조화 텍스트 내보내기 다운로드.

스크린샷은 무해한 예제 파일로 이 도구 모음을 사용하는 모습을 보여 줍니다. 실제 파일 이름, 페이지 수 및 설정은 다를 수 있습니다.

PDF 텍스트를 JSON으로 내보내는 이유는 무엇인가요?

문서 작업에서 텍스트와 위치 정보가 모두 필요할 때 JSON이 유용합니다. 개발자는 추출 품질을 살펴보고 반복되는 레이블을 찾거나 별도의 매핑 과정을 준비할 수 있습니다. 매핑 규칙은 명확하게 정의하세요. 근처에 있는 금액이 자동으로 청구서 합계가 되는 것은 아니며, 추출 순서가 사람이 읽는 순서와 일치한다고 보장할 수도 없습니다.

누가 이 내보내기 기능을 사용할 수 있나요?

문서 처리 개발자

파서를 만들기 전에 텍스트 레이어를 확인하고 디버깅에 필요한 페이지 참조를 유지할 수 있습니다.

데이터 검토팀

추출 규칙을 채택하기 전에 샘플 값을 원본 페이지와 비교할 수 있습니다.

학생과 연구자

고정 레이아웃 문서에서 눈에 보이는 텍스트가 어떻게 표현되는지 살펴볼 수 있습니다.

설정 및 출력 확인

설정예상 결과
입력최대 25 MiB의 PDF 한 개, 원본 최대 500페이지.
선택 범위최대 200페이지 선택, 페이지당 텍스트 항목 20,000개, 작업당 100,000개, 텍스트 200만 자까지.
출력추출한 텍스트와 기하 정보를 포함하는 JSON, 최대 64 MiB.
스캔한 페이지자동 OCR, 이미지 내보내기, 문서 필드 인식은 수행하지 않습니다.

파서를 만들기 전에 작은 샘플부터 확인하세요

두 단으로 된 명세서는 먼저 한 페이지를 내보내세요. 익숙한 레이블을 찾아 인쇄된 값과 위치를 비교하세요. 두 단의 항목이 서로 섞여 있다면 배열이 이미 완성된 표라고 가정하지 말고, 자체 코드에서 좌표를 기준으로 묶으세요.

PDF를 JSON으로 변환할 때 문제 해결

상황확인할 사항
선택 가능한 텍스트를 찾을 수 없음스캔한 페이지에 OCR을 실행한 뒤, 생성된 PDF 텍스트 레이어를 내보내세요.
텍스트가 예상과 다른 순서로 표시됨페이지와 텍스트 위치를 비교하세요. 추출 순서가 읽기 순서를 정해 주지는 않습니다.
큰 선택 범위가 거부됨페이지 수를 줄이세요. 내용이 빽빽한 페이지는 페이지 수 제한보다 먼저 텍스트 항목 제한에 도달할 수 있습니다.

자주 묻는 질문

PDF를 JSON으로 변환하면 청구서 필드가 인식되나요?

아니요. 결과에는 텍스트 항목과 기하 정보가 포함됩니다. 필드 이름과 관계를 정하고 업무 규칙을 검증하려면 별도의 매핑 과정이 필요합니다.

이미지와 표도 포함되나요?

이미지는 내보내지 않습니다. 표 안의 텍스트는 추출할 수 있지만 행과 열의 관계는 재구성하지 않습니다.

이 JSON으로 원본 PDF를 다시 만들 수 있나요?

이 출력은 확인용 형식이며 PDF의 완전한 표현이 아닙니다. 외관, 그래픽, 글꼴, 대화형 기능을 보존하려면 원본 PDF를 유지하세요.

관련 도구

JSON을 PDF로 변환, PDF를 XML로 변환, PDF 문자 인식.