PDF를 텍스트로
PDF의 텍스트 층을 단순한 .txt 파일로 뽑아냅니다. 복사, 재사용, 검색에 쓰세요. 로컬, 업로드 없음.
기기에서 로컬로 처리 중 ...
내 파일
기기에서 로컬로 처리 중 ...
0%
파일이 기기를 떠난 적이 없습니다
제 파일이 업로드되나요?
아니요. 모든 처리가 브라우저에서 이루어지며, 파일이 기기를 떠나지 않습니다. 이것을 검증하는 방법
PDF의 텍스트 층을 단순한 .txt 파일로 뽑아냅니다. 복사, 재사용, 검색에 쓰세요. 로컬, 업로드 없음.
기기에서 로컬로 처리 중 ...
기기에서 로컬로 처리 중 ...
0%
파일이 기기를 떠난 적이 없습니다
아니요. 모든 처리가 브라우저에서 이루어지며, 파일이 기기를 떠나지 않습니다. 이것을 검증하는 방법
가끔은 PDF에서 순수한 텍스트만 필요할 때가 있습니다: 인용문을 문서에 옮기거나, 계약서를 편집기에 복사하거나, 검색이나 보관을 위해 내용을 색인하거나, 텍스트를 음성 안내나 스크린 리더 도구에 넘기는 경우입니다. 이 도구는 PDF에 내장된 텍스트 레이어를 읽어, 글꼴이나 이미지, 색상, 레이아웃 없이 문자만 담긴 간단한 .txt 파일로 돌려줍니다.
순서는 페이지별로 재구성됩니다. 같은 높이에 있는 텍스트 조각들이 한 줄로 묶이며, 위에서 아래로, 왼쪽에서 오른쪽으로 읽힙니다. 페이지 사이는 빈 줄로 구분되어 있어 결과물을 재사용하거나 가져오거나 검색하기 편리합니다.
중요하고 솔직하게 말씀드리면, 이 도구는 PDF에 이미 텍스트 레이어로 들어 있는 내용만 추출합니다. 스캔했거나 순전히 사진으로만 이루어진 PDF에는 그런 레이어가 없어 결과가 비어 있게 되며, 대신 픽셀에서 글자를 인식하는 "PDF OCR" 도구가 필요합니다. 여러 단이나 표, 각주가 있는 복잡한 레이아웃도 언제나 완벽하게 한 줄의 텍스트 순서로 바뀌지는 않습니다. 다만 오피스 프로그램, 브라우저, 조판 시스템으로 만든 일반적인 "진짜" PDF라면 추출 결과는 깔끔하고 재사용하기 좋은 텍스트가 됩니다. 모든 작업은 pdf.js를 통해 브라우저에서 로컬로 이루어지며, 파일이 기기를 벗어나지 않습니다.
| 입력 형식 | |
|---|---|
| 자동 변환 | PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP |
| 출력 형식 | TXT |
| 일괄 처리 | 미지원 |
| 처리 방식 | 브라우저에서 로컬 처리 (JavaScript) |
| 파일 업로드 | 없음 |
제한: PDF의 기존 텍스트 층을 뽑아 UTF-8 .txt 파일로 돌려줍니다. 줄은 텍스트 위치에서 다시 만들어집니다. 스캔했거나 이미지만 있는 PDF에는 텍스트 층이 없어 출력이 비어 있습니다. 그럴 때는 PDF OCR을 쓰세요. 글꼴, 이미지, 색, 정확한 배치(여러 단 쪽, 표)는 사라지거나 선형으로만 근사됩니다. 비밀번호로 보호된 PDF는 먼저 PDF 잠금 해제로 여세요.
아마 PDF가 스캔본이거나 이미지로 되어 있어 텍스트 층이 없을 것입니다. 그럴 때는 픽셀에서 텍스트를 알아보는 PDF OCR을 쓰세요.
아니요. 읽는 순서대로 된 순수한 텍스트를 받습니다. 글꼴, 이미지, 단, 표는 원본 그대로 재현되지 않습니다.
UTF-8이라 한글과 특수 문자도 올바르게 유지됩니다.
페이지 사이는 빈 줄로 구분됩니다.
아니요, 텍스트 추출은 전부 브라우저 안에서 로컬로 이루어집니다.
PDF OCR 검색 가능화 · PDF를 Word로 · PDF 페이지 추출 · PDF를 Markdown으로 변환 · DOCX를 HTML로 · DOCX를 Markdown으로