Tidak ada pemrosesan atas isi berkasmu di server mana pun. Kamu tidak perlu perjanjian pemrosesan data dengan gottrix untuk menangani dokumen rahasia maupun bisnis.
Hosted in GermanyGlobal Content Delivery
Server origin berada di Hetzner di Jerman, dengan pengiriman ke seluruh dunia melalui jaringan pengiriman konten (CDN). Isi berkasmu tidak pernah dikirimkan dalam proses ini - berkas tidak pernah meninggalkan perangkatmu.
PDF yang dipindai pada dasarnya adalah kumpulan gambar: kamu bisa melihat teksnya, tetapi tidak bisa memilih, mencari, atau menyalinnya. OCR (pengenalan karakter optis) membaca huruf dari gambar dan menempatkannya sebagai lapisan teks tersembunyi tepat di atas halaman. Tampilan tetap identik, namun PDF menjadi bisa dicari dan teksnya bisa dipilih - persis yang dibutuhkan oleh instansi, arsip, dan pencarian teks lengkap.
Pilih keluaran: PDF yang bisa dicari (halaman asli plus lapisan teks) atau teks biasa sebagai TXT. Atur bahasa dokumen dari daftar - 113 bahasa dari bahasa Indonesia dan Inggris hingga Rusia, Arab, dan Hindi ke Jepang, Korea, dan Tionghoa, masing-masing dalam namanya sendiri - agar karakter dikenali dengan benar. Semua berjalan di peramban via WebAssembly: mesin Tesseract sumber terbuka yang sama seperti alat "Gambar ke Teks", diterapkan halaman demi halaman pada seluruh PDF. Saat pertama digunakan, peramban mengunduh mesin dan model bahasa yang dipilih sekali (beberapa MB, same-origin); setelah itu bisa digunakan offline.
Alat ini dirancang untuk PDF yang dipindai atau berbasis gambar. Pengenalan sangat bergantung pada kualitas pindaian: halaman yang tajam, lurus, dan kontras tinggi dengan teks cetak dikenali sangat baik; halaman yang miring atau buram jauh lebih buruk; tulisan tangan tidak andal. Dalam PDF yang bisa dicari, setiap halaman disematkan kembali sebagai gambar - PDF yang sudah mengandung teks asli tidak memerlukan OCR. Periksa hasilnya untuk angka dan nama diri.
Pengenalan teks biasanya wilayah kekuasaan cloud: layanan OCR terkenal mengunggah setiap pindaian ke server mereka untuk diproses - justru dokumen seperti kontrak, surat medis, atau kartu identitas. Di sini seluruh pengenalan berjalan dengan Tesseract sebagai WebAssembly di peramban Anda, dan semua 113 paket bahasa dihosting di gottrix sendiri - selama pengenalan tidak ada yang dimuat dari pihak ketiga. Daftar bahasa juga dimulai dengan pilihan awal yang sesuai bahasa antarmuka Anda. Gratis, tanpa akun, dan tanpa batas halaman.
Pilih keluaran (PDF yang bisa dicari atau teks) dan bahasa dari daftar.
Unduh PDF yang bisa dicari atau TXT.
Batasan: Untuk PDF PINDAIAN/berbasis gambar: membuat PDF bisa dicari via OCR (lapisan teks tersembunyi) atau menghasilkan teks biasa. Mengenali teks CETAK dalam 113 bahasa dan berbagai aksara; tulisan tangan tidak andal. Catatan: lapisan teks tersembunyi dalam PDF yang bisa dicari mencakup aksara Latin lengkap dengan semua huruf beraksen (23 dari 113 bahasa, misalnya Polandia, Ceko, Vietnam, Turki), Yunani, dan Sirilik. Karakter dari aksara lain (misalnya CJK, Arab, Ibrani, Dewanagari, Thai) sengaja dihilangkan di sana daripada tampil rusak; untuk aksara tersebut, keluaran "Hanya Teks (TXT)" memberikan teks yang sepenuhnya dikenali. Dalam PDF yang bisa dicari, setiap halaman disematkan kembali sebagai gambar sehingga tata letak dipertahankan namun ukuran berkas bisa bertambah; PDF yang sudah memiliki teks asli tidak memerlukan OCR. Pengenalan tidak bebas kesalahan - periksa terutama angka dan nama diri. Mesin dan model bahasa yang dipilih diunduh sekali (beberapa MB, same-origin), lalu bisa digunakan offline. PDF besar membutuhkan waktu dan memori tergantung jumlah halaman dan perangkat.
Pertanyaan umum
Apakah PDF saya diunggah?
Tidak. Rendering dan pengenalan berjalan sepenuhnya secara lokal di peramban (WebAssembly); PDF tidak pernah meninggalkan perangkatmu - keunggulan utama untuk kontrak dan surat resmi.
Apa itu PDF yang bisa dicari?
Halaman terlihat seperti pindaian, tetapi di baliknya terdapat lapisan teks tersembunyi. Dengan itu kamu bisa mencari dalam PDF, memilih dan menyalin teks - sementara tampilan visualnya tetap sama.
Apakah tata letak dipertahankan?
Ya. Setiap halaman disematkan sebagai gambar halaman asli, dengan lapisan teks tersembunyi tepat di atasnya. Tampilan tidak berubah, meskipun ukuran berkas bisa sedikit bertambah.
Apakah bisa mengenali tulisan tangan atau bahasa lain?
Bahasa lain ya: lebih dari 100 tersedia (termasuk Arab, Rusia, Hindi, Jepang, Korea, Tionghoa). Tulisan tangan tidak dikenali secara andal, hanya teks cetak. Lapisan teks PDF yang bisa dicari mencakup aksara Latin dengan semua huruf beraksen, Yunani, dan Sirilik; untuk CJK, Arab, Ibrani, Dewanagari, atau Thai, gunakan keluaran "Hanya Teks (TXT)" yang memuat teks yang sepenuhnya dikenali.
Berapa banyak bahasa yang dikenali OCR?
113 - dari bahasa Indonesia, Inggris, dan Jerman melalui Arab, Hindi, dan Thai hingga Jepang, Korea, dan Mandarin. Setiap bahasa tercantum dengan namanya sendiri di daftar, dan semua paket bahasa dihosting di gottrix sendiri, bukan di pihak ketiga.
Apakah OCR PDF gratis, dan adakah batas halaman?
Ya, sepenuhnya gratis - tanpa akun, tanpa tanda air, dan tanpa batas halaman atau harian. Halaman yang banyak hanya butuh waktu yang sebanding, karena perangkat Anda sendirilah yang menghitung pengenalannya.
Mengapa pengenalan teks lokal lebih baik untuk pindaian rahasia?
Karena pindaian tidak pernah meninggalkan perangkat Anda: tanpa unggahan, tanpa pemrosesan server, tanpa salinan di cloud pihak lain. Setelah pemuatan pertama, pengenalan bahkan berfungsi offline - bukti terkuat bahwa tidak ada yang dikirim.
Hanya dengan persetujuan Anda, kami mengukur penggunaan secara anonim melalui cookie untuk menyempurnakan gottrix. Berkas Anda selalu tetap lokal, di perangkat Anda. Privasi