PDF OCR 검색 가능화
스캔 PDF를 OCR로 검색 가능하게 변환 - 브라우저에서 로컬 처리, 원본 페이지 아래에 불가시 텍스트 레이어 추가, 업로드 없음.
기기에서 로컬로 처리 중 ...
내 파일
기기에서 로컬로 처리 중 ...
0%
파일이 기기를 떠난 적이 없습니다
제 파일이 업로드되나요?
아니요. 모든 처리가 브라우저에서 이루어지며, 파일이 기기를 떠나지 않습니다. 이것을 검증하는 방법
스캔 PDF를 OCR로 검색 가능하게 변환 - 브라우저에서 로컬 처리, 원본 페이지 아래에 불가시 텍스트 레이어 추가, 업로드 없음.
기기에서 로컬로 처리 중 ...
기기에서 로컬로 처리 중 ...
0%
파일이 기기를 떠난 적이 없습니다
아니요. 모든 처리가 브라우저에서 이루어지며, 파일이 기기를 떠나지 않습니다. 이것을 검증하는 방법
스캔 PDF는 본질적으로 이미지 더미입니다. 텍스트가 보이지만 선택, 검색, 복사가 불가능합니다. OCR(광학 문자 인식)은 이미지에서 글자를 읽어 각 페이지 위에 불가시 텍스트 레이어로 정확하게 얹습니다. 외관은 그대로이지만 PDF가 검색 가능해지고 텍스트를 선택할 수 있게 됩니다. 이것이 관공서, 기록 보관소, 전문 검색 시스템이 기대하는 표준 형식입니다.
출력 형식은 검색 가능 PDF(원본 페이지에 텍스트 레이어 추가) 또는 TXT 순수 텍스트 중 선택할 수 있습니다. 목록에서 문서 언어를 설정하세요. 독일어, 영어, 러시아어, 아랍어, 힌디어부터 일본어, 한국어, 중국어까지 113개 언어가 각자의 명칭으로 표시됩니다. 모든 처리는 WebAssembly로 브라우저 내에서 실행됩니다. "이미지 텍스트 추출" 도구와 동일한 오픈소스 Tesseract 엔진을 PDF 전체에 페이지별로 적용합니다. 처음 사용 시 브라우저가 엔진과 선택한 언어 모델을 한 번 내려받습니다(수 MB, 동일 출처). 이후에는 오프라인에서도 동작합니다.
이 도구는 스캔이나 이미지 기반 PDF를 위한 것입니다. 인식 품질은 스캔 품질에 크게 좌우됩니다. 선명하고 반듯하며 대비가 높은 인쇄 페이지는 매우 잘 인식되지만, 기울어지거나 흐릿한 페이지는 정확도가 떨어지며 손글씨는 신뢰할 만하게 인식되지 않습니다. 검색 가능 PDF에서는 각 페이지가 이미지로 재삽입됩니다. 이미 실제 텍스트가 있는 PDF에는 OCR이 필요 없습니다. 숫자와 고유명사는 결과를 확인하세요.
문자 인식은 보통 클라우드의 영역입니다. 유명 OCR 서비스는 스캔본을 처리하러 자사 서버로 업로드합니다 - 하필 계약서, 진단서, 신분증 같은 문서를요. 여기서는 인식 전체가 WebAssembly로 컴파일된 Tesseract로 브라우저 안에서 돌아가고, 113개 언어 팩 전부를 gottrix가 직접 호스팅합니다 - 인식 중에 제3자에게서 불러오는 것은 아무것도 없습니다. 게다가 언어 목록은 인터페이스 언어에 맞춰 미리 선택된 상태로 시작합니다. 무료, 계정 불필요, 쪽수 제한 없음.
| 입력 형식 | |
|---|---|
| 자동 변환 | PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP |
| 출력 형식 | PDF, TXT |
| 일괄 처리 | 지원 |
| 처리 방식 | 브라우저에서 로컬 처리 (WebAssembly) |
| 파일 업로드 | 없음 |
제한: 스캔/이미지 PDF를 OCR로 검색 가능하게 만들거나(불가시 텍스트 레이어) 순수 텍스트로 출력합니다. 113개 언어와 다양한 문자 체계의 인쇄 텍스트를 인식합니다. 손글씨는 신뢰할 만하게 인식되지 않습니다. 주의: 검색 가능 PDF의 불가시 텍스트 레이어는 모든 발음 구별 부호를 포함한 라틴 문자(113개 언어 중 23개 언어, 예: 폴란드어, 체코어, 베트남어, 터키어 등)와 그리스 문자, 키릴 문자를 지원합니다. 그 밖의 문자 체계(CJK, 아랍어, 히브리어, 데바나가리, 태국어 등)는 깨진 형태로 넣는 대신 의도적으로 생략합니다. 이러한 문자 체계에는 "텍스트만 (TXT)" 출력을 이용하세요. 검색 가능 PDF에서는 각 페이지가 이미지로 재삽입되어 레이아웃은 유지되지만 파일이 커질 수 있습니다. 이미 실제 텍스트가 있는 PDF에는 OCR이 불필요합니다. 인식이 완벽하지 않으므로 특히 숫자와 고유명사를 확인하세요. 엔진과 언어 모델은 처음 한 번만 내려받습니다(수 MB, 동일 출처). 이후 오프라인 사용 가능. 대용량 PDF는 페이지 수와 기기에 따라 시간과 메모리가 필요할 수 있습니다.
아니요. 렌더링과 텍스트 인식은 전부 브라우저 내 로컬에서 실행됩니다(WebAssembly). PDF는 기기를 벗어나지 않습니다. 계약서나 공문서를 처리할 때 특히 중요한 장점입니다.
페이지는 스캔 원본처럼 보이지만, 그 아래에 불가시 텍스트 레이어가 추가되어 있습니다. 이를 통해 PDF 내에서 검색하고, 텍스트를 선택하거나 복사할 수 있습니다. 시각적 표시는 동일하게 유지됩니다.
네. 각 페이지는 원본 페이지의 이미지로 재삽입되고, 불가시 텍스트 레이어가 그 위에 정렬됩니다. 외관은 변하지 않지만 파일 크기가 약간 커질 수 있습니다.
다른 언어는 가능합니다. 아랍어, 러시아어, 힌디어, 일본어, 한국어, 중국어 등 100개 이상의 언어를 선택할 수 있습니다. 손글씨는 신뢰할 만하게 인식되지 않으며 인쇄 텍스트만 지원합니다. 검색 가능 PDF 텍스트 레이어는 모든 발음 구별 부호를 포함한 라틴 문자와 그리스 문자, 키릴 문자를 지원합니다. CJK, 아랍어, 히브리어, 데바나가리, 태국어에는 인식된 텍스트가 모두 담기는 "텍스트만 (TXT)" 출력을 이용하세요.
113개입니다 - 한국어, 영어, 독일어부터 아랍어, 힌디어, 태국어를 거쳐 일본어와 중국어까지. 각 언어는 목록에 해당 언어 자체의 이름으로 표시되며, 언어 팩 전부를 제3자가 아니라 gottrix가 직접 호스팅합니다.
네, 완전히 무료입니다 - 계정 불필요, 워터마크 없음, 쪽수 제한도 일일 제한도 없습니다. 쪽이 많으면 그만큼 시간이 더 걸릴 뿐입니다. 인식을 계산하는 것이 내 기기이기 때문입니다.
스캔본이 기기를 전혀 떠나지 않기 때문입니다. 업로드 없음, 서버 처리 없음, 남의 클라우드에 복사본 없음. 첫 로딩 후에는 오프라인에서도 인식이 돌아갑니다 - 아무것도 전송되지 않는다는 가장 강력한 증거입니다.
이미지 텍스트 추출 (OCR) · PDF를 Word로 · PDF 압축 · PDF를 Markdown으로 변환 · PDF를 텍스트로 · PDF를 EPUB로