Dosya içeriklerinizin sunucuda işlenmesi söz konusu değildir. Gizli veya ticari belgeleri işlemek için gottrix ile bir veri işleme sözleşmesine ihtiyacınız yoktur.
Hosted in GermanyGlobal Content Delivery
Almanya'da Hetzner'deki kaynak sunucular, bir içerik dağıtım ağı (CDN) üzerinden dünya çapında dağıtılır. Bu sırada dosya içerikleriniz asla aktarılmaz - cihazınızdan hiç ayrılmaz.
Taranmış bir PDF temelde bir görüntü yığınıdır: metni görürsünüz ama seçemez, arayamaz ya da kopyalayamazsınız. OCR (optik karakter tanıma) harfleri görüntüden okur ve onları görünmez bir metin katmanı olarak tam sayfaların üzerine yerleştirir. Görünüm aynı kalır, ama PDF aranabilir hale gelir ve metin seçilebilir olur - resmi kurumların, arşivlerin ve tam metin aramanın tam da beklediği şey.
Çıktı olarak aranabilir bir PDF (orijinal sayfalar artı metin katmanı) ya da düz metin olarak TXT seçin. Belgenin dilini listeden ayarlayın - Almanca ve İngilizceden Rusça, Arapça ve Hintçeye, oradan Japonca, Korece ve Çinceye kadar 113 dil, her biri kendi adıyla listelenir - böylece karakterler doğru tanınır. Her şey tarayıcıda WebAssembly ile çalışır: “Görüntü OCR” aracındaki açık kaynaklı Tesseract motorunun aynısı, yalnızca tüm PDF'ye sayfa sayfa uygulanır. İlk kullanımda tarayıcı motoru ve seçilen dil modelini bir kez indirir (birkaç MB, aynı kaynak); sonrasında çevrimdışı çalışır.
Araç, taranmış ya da görüntü temelli PDF'ler için tasarlanmıştır. Tanıma, tarama kalitesine büyük ölçüde bağlıdır: net, düz, yüksek kontrastlı baskı metin sayfaları çok iyi tanınır; eğik veya bulanık sayfalar çok daha kötü; el yazısı güvenilir değildir. Aranabilir PDF'de her sayfa görüntü olarak yeniden gömülür; bu yüzden zaten gerçek metin içeren bir PDF'nin OCR'a ihtiyacı yoktur. Sonucu sayılar ve özel adlar için kısaca gözden geçirin.
Metin tanıma genelde bulutun alanıdır: tanınmış OCR hizmetleri her taramayı işlemek için kendi sunucularına yükler - üstelik sözleşmeler, tıbbi raporlar veya kimlik belgeleri gibi evrakları. Burada tanımanın tamamı, tarayıcınızda WebAssembly olarak derlenmiş Tesseract ile çalışır ve 113 dil paketinin tümü gottrix'in kendisinde barındırılır - tanıma sırasında üçüncü taraflardan hiçbir şey yüklenmez. Dil listesi ayrıca arayüz dilinize göre önceden seçilmiş olarak başlar. Ücretsiz, hesapsız ve sayfa sınırı olmadan.
Çıktıyı (aranabilir PDF veya metin) ve dili listeden seçin.
Aranabilir PDF'yi ya da TXT'yi indirin.
Sınırlar: TARANMIŞ / görüntü PDF'leri için: OCR ile aranabilir yapar (görünmez metin katmanı) ya da düz metin verir. 113 dilde ve pek çok alfabede BASKI metni tanır; el yazısı güvenilir değildir. Not: aranabilir PDF'deki görünmez metin katmanı, tüm aksanlı harfleriyle birlikte Latin alfabesini (113 dilin 23'ü, örneğin Lehçe, Çekçe, Vietnamca, Türkçe), Yunan alfabesini ve Kiril alfabesini kapsar. Diğer yazı sistemlerinin karakterleri (örneğin CJK, Arapça, İbranice, Devanagari, Tayca) oraya bozuk biçimde yazılmak yerine bilinçli olarak atlanır; bu yazı sistemleri için “Yalnızca metin (TXT)” çıktısı tam olarak tanınan metni verir. Aranabilir PDF'de her sayfa görüntü olarak yeniden gömülür, yani düzen korunur ama dosya büyüyebilir; zaten gerçek metin içeren bir PDF'nin OCR'a ihtiyacı yoktur. Tanıma kusursuz değildir - özellikle sayıları ve özel adları kontrol edin. Motor ve seçilen dil modeli bir kez indirilir (birkaç MB, aynı kaynak), sonrasında çevrimdışı kullanılabilir. Büyük PDF'ler, sayfa sayısına ve cihaza göre biraz zaman ve bellek ister.
Sık sorulan sorular
PDF'im yükleniyor mu?
Hayır. İşleme ve metin tanıma tamamen tarayıcıda yerel olarak çalışır (WebAssembly); PDF cihazınızdan hiç ayrılmaz - özellikle sözleşmeler ve resmi yazışmalar için en önemli avantaj.
Aranabilir PDF nedir?
Sayfa tarama gibi görünür, ama altında görünmez bir metin katmanı bulunur. Böylece PDF'de arama yapabilir, metni seçebilir ve kopyalayabilirsiniz - görsel görünüm aynı kalır.
Düzen korunur mu?
Evet. Her sayfa orijinal sayfanın görüntüsü olarak gömülür; görünmez metin katmanı tam üzerine hizalanır. Görünüm değişmez, ama dosya biraz büyüyebilir.
El yazısını veya başka dilleri tanır mı?
Başka diller evet: 100'den fazla seçenek var (Arapça, Rusça, Hintçe, Japonca, Korece, Çince dahil). El yazısı güvenilir biçimde tanınmaz, yalnızca baskı metin. Aranabilir PDF metin katmanı, tüm aksanlı harfleriyle Latin alfabesini, Yunan alfabesini ve Kiril alfabesini kapsar; CJK, Arapça, İbranice, Devanagari veya Tayca için tam olarak tanınan metni içeren “Yalnızca metin (TXT)” çıktısını kullanın.
Metin tanıma kaç dili destekliyor?
113 - Türkçe, İngilizce ve Almancadan Arapça, Hintçe ve Taycaya, oradan Japonca, Korece ve Çinceye kadar. Her dil listede kendi adıyla yer alır ve tüm dil paketleri üçüncü bir tarafta değil, gottrix'in kendisinde barındırılır.
PDF OCR ücretsiz mi, sayfa sınırı var mı?
Evet, tamamen ücretsiz - hesapsız, filigransız, sayfa veya günlük sınır olmadan. Çok sayıda sayfa yalnızca orantılı olarak daha uzun sürer, çünkü tanımayı kendi cihazınız hesaplar.
Gizli taramalar için yerel metin tanıma neden daha iyidir?
Çünkü tarama cihazınızdan asla ayrılmaz: yükleme yok, sunucu işlemesi yok, yabancı bir bulutta kopya yok. İlk yüklemeden sonra tanıma çevrimdışı bile çalışır - hiçbir şeyin iletilmediğinin en güçlü kanıtı.
Yalnızca onayınızla, gottrix'i iyileştirmek için kullanımı çerezlerle anonimleştirilmiş biçimde ölçeriz. Dosyalarınız her zaman yerelde, cihazınızda kalır. Gizlilik