ko

PDF 표 추출

PDF 속 표를 인식해 CSV, Excel(XLSX), JSON으로 내보냅니다. 테두리가 있어도 없어도 됩니다. 브라우저에서 로컬로 처리되며 업로드가 없습니다.

기기에서 로컬로 처리 중 ...

출력 형식 출력 파일의 목표 형식입니다.
  • CSV
  • Excel (XLSX)
  • JSON
표 인식
  • 자동
  • 테두리 있음(격자)
  • 테두리 없음(간격)
구분 기호
  • 쉼표
  • 세미콜론

내 파일

    기기에서 로컬로 처리 중 ...

    0%

    제 파일이 업로드되나요?

    아니요. 모든 처리가 브라우저에서 이루어지며, 파일이 기기를 떠나지 않습니다. 이것을 검증하는 방법

    업로드 없음100% 로컬 처리
    내용은 내 손안에제3자 접근 불가
    Hosted in GermanyGlobal Content Delivery
    외부 검증 완료TLS A+ · 헤더 A+

    숫자는 정작 쓸 수 없는 곳에 갇혀 있는 경우가 많습니다. 바로 PDF 안의 표입니다. 청구서, 보고서, 은행 거래 내역, 연구 자료 등에서 값을 Excel이나 데이터베이스, 스크립트로 옮기려면 지금까지는 손으로 다시 입력하거나, 붙여넣을 때마다 무너지는 열과 씨름해야 했습니다. 이 도구는 PDF 속 표를 자동으로 인식해 구조를 유지한 채 내보냅니다. 스프레드시트와 가져오기에 적합한 CSV, 표마다 시트를 나눈 Excel 통합 문서(XLSX), 코드에서 처리하기 좋은 좌표 포함 JSON 중에서 고를 수 있습니다.

    인식에는 이 분야의 유명 전문 도구들이 쓰는 것과 같은 두 가지 기법을 사용합니다. 테두리가 있는 표는 페이지에 실제로 그려진 선으로 인식합니다(격자 모드). 선이 셀 격자를 이루고 각 텍스트는 자기 셀에 배정됩니다. 테두리가 없는 표는 정렬로 인식합니다(간격 모드). 여러 줄에서 같은 열 위치에 놓인 텍스트 블록이 열이 되고, 끝까지 비어 있는 틈이 열 경계가 됩니다. 자동 모드는 먼저 선을 찾고 없으면 간격 분석으로 전환하며, 두 모드 모두 직접 지정할 수도 있습니다. 여러 개의 표와 여러 페이지의 PDF를 지원하며, 인식된 표는 각각 따로 내보내집니다.

    정직하고 중요한 점: 인식은 PDF의 텍스트 레이어를 읽습니다. 스캔했거나 이미지로만 이루어진 PDF에는 이 레이어가 없습니다. 그럴 때 도구는 빈 표나 지어낸 표를 내놓는 대신 그 사실을 솔직하게 알립니다. 스캔본은 먼저 "PDF OCR"로 검색 가능한 텍스트로 변환한 뒤 표를 추출하세요. 복잡한 레이아웃에는 한계도 있습니다. 병합 셀이나 중첩 표는 근사치로 처리되며 픽셀 단위로 재현되지는 않습니다. 모든 처리는 브라우저 안에서 pdf.js로 로컬 실행되며, 파일은 기기를 절대 떠나지 않습니다.

    기술 사양

    기술 사양
    입력 형식PDF
    자동 변환PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
    출력 형식CSV, XLSX, JSON
    일괄 처리미지원
    처리 방식브라우저에서 로컬 처리 (JavaScript)
    파일 업로드없음

    3단계로

    1. PDF를 끌어다 놓으세요.
    2. 출력 형식과 인식 방식을 선택하세요.
    3. 표를 CSV, XLSX, JSON으로 내려받으세요.

    제한: 테두리 선(격자) 또는 텍스트 정렬(간격)로 표를 인식하고 CSV(표마다 파일 하나, 여러 개는 ZIP), XLSX(표마다 시트 하나), JSON(페이지, 셀, PDF 포인트 단위 좌표 포함)으로 내보냅니다. 실제 텍스트 레이어가 필요합니다. 스캔한 PDF는 먼저 "PDF OCR"로 변환하세요. 병합 셀과 복잡한 레이아웃은 근사치로 처리됩니다. Excel 출력에서는 모호하지 않은 숫자(소수점이 마침표)만 숫자 셀이 됩니다. 암호로 보호된 PDF는 먼저 "PDF 잠금 해제"로 여세요.

    자주 묻는 질문

    표는 어떻게 인식하나요?

    두 가지 기법을 씁니다. 테두리가 있는 표에서는 그려진 선이 셀 격자를 이룹니다(격자 모드). 테두리가 없는 표에서는 텍스트 정렬과 끝까지 비어 있는 틈으로 열을 인식합니다(간격 모드). 자동 모드가 알맞은 기법을 스스로 고릅니다.

    스캔 문서에서는 왜 표를 찾지 못하나요?

    스캔본은 이미지 픽셀뿐이라 읽을 수 있는 텍스트 레이어가 없습니다. 먼저 "PDF OCR"로 PDF를 검색 가능한 텍스트로 변환한 뒤 표를 추출하세요.

    여러 표와 여러 페이지를 한 번에 내보낼 수 있나요?

    네. 모든 페이지를 훑어 인식된 표를 각각 따로 내보냅니다. 표마다 별도 CSV 파일(여러 개는 ZIP으로 묶음), Excel 파일 안의 별도 시트, 또는 JSON 안의 항목으로 저장됩니다.

    JSON 내보내기에는 무엇이 들어 있나요?

    전체 구조가 들어 있습니다. 표마다 페이지, 인식 모드, 위치가, 셀마다 텍스트와 PDF 포인트 단위 경계 상자(원점은 왼쪽 아래)가 포함됩니다. 스크립트와 데이터 파이프라인에 이상적입니다.

    병합 셀은 왜 정확하지 않나요?

    여러 열에 걸친 병합 셀은 격자 안에서 위치가 하나로 정해지지 않습니다. 내용은 관련 셀 중 하나에 들어가고 나머지는 비게 됩니다. 이는 정직한 근사치입니다. 전문 데스크톱 도구도 이를 완벽하게 해결하지 못합니다.

    PDF가 업로드되나요?

    아니요. 인식과 내보내기는 모두 브라우저 안에서 pdf.js로 로컬 실행되며, 파일은 기기를 절대 떠나지 않습니다.

    표 추출은 스마트폰이나 Chromebook에서도 되나요?

    네, 최신 브라우저가 있는 기기라면 어디서든 됩니다 - Windows, Mac, Linux, Chromebook 또는 스마트폰. 아주 큰 PDF는 모바일 기기에서 시간과 메모리가 더 들 뿐입니다.

    관련 도구

    PDF를 텍스트로 · PDF OCR 검색 가능화 · XLSX에서 CSV로 변환 · CSV에서 XLSX로 변환 · CSV에서 JSON으로 변환 · PDF를 Markdown으로 변환