Taranmış belgede yazı neden kopyalanamaz?
Tarayıcıdan veya telefon kamerasından çıkan bir PDF, göründüğü gibi "yazı" içermez, fotoğraf içerir. Ekranda harfleri siz görürsünüz ama dosyanın içinde harf yoktur, yalnızca koyu ve açık pikseller vardır. Metni seçmeye çalıştığınızda hiçbir şey seçilmemesinin sebebi budur.
OCR (optik karakter tanıma) bu piksellere bakıp hangi harf olduklarını çözer. Bu araç tanımayı sizin cihazınızda yapar: belge hiçbir sunucuya yüklenmez. Kimlik fotokopisi, tapu, bordro, sözleşme, hepsi cihazınızda kalır. Çoğu çevrimiçi OCR hizmeti belgenizi kendi sunucusuna gönderir; bu araçta gönderilecek bir şey yoktur.
Türkçe ve İngilizce
Dil seçimi tanıma kalitesini doğrudan belirler. İngilizce için hazırlanmış bir motor Türkçe metinde "ş" harfini "s", "ğ" harfini "g" okur ve noktasız "ı" ile noktalı "i" harfini birbirine karıştırır. Bu araçta Türkçe dil verisi ayrı yükleniyor.
Üçüncü bir seçenek daha var: Türkçe + İngilizce. Türkçe belgelerde İngilizce terim geçmesi kural, istisna değil: teknik belgeler, sözleşmeler, akademik metinler. Bu seçenek iki dili birlikte çalıştırır; biraz daha yavaştır ama karışık metinde belirgin biçimde doğrudur.
Ne kadar iniyor, neden?
Tanıma motoru ve dil verisi ilk kullanımda tarayıcınıza iner: motor yaklaşık 3,9 MB, Türkçe dil verisi 2,1 MB, İngilizce 2,9 MB. Sunucuda çalışan bir hizmette bu indirme olmaz, çünkü orada belgeniz karşıya çıkar. İndirme, belgenin cihazdan çıkmamasının bedeli. Tarayıcınız dosyaları sakladığı için sonraki kullanımlarda yeniden inmez.
Dosyalar bizim alan adımızdan gelir, üçüncü taraf bir dağıtım ağından değil. Böylece belgeniz cihazınızda kalırken tarayıcınız da başka bir siteye istek atmaz.
Tarayıcınız yoksa: belgeyi telefonla çekin
Elinizde tarayıcı olmak zorunda değil. Araç telefonunuzun kamerasını kullanabiliyor: belgeyi masaya koyup çekiyorsunuz, sonra dört köşesini işaretliyorsunuz ve eğrilik düzeltiliyor. Kağıdı kameraya tam dik tutmanız gerekmiyor, düzeltme işaretlediğiniz köşelere göre yapılıyor.
Bu adım tanıma başarısını doğrudan etkiliyor. Eğik duran bir sayfada satırlar da eğik oluyor ve motor satır sırasını karıştırıyor; düzeltilmiş sayfada bu sorun ortadan kalkıyor.
Köşeleri siz işaretliyorsunuz, otomatik bulunmuyor. Sebebi basit: masa deseni, gölge ve düşük kontrast otomatik köşe bulmayı yanıltıyor ve yanlış bulunan köşe sessizce eğri bir belge üretiyor, hatayı ancak metin bozuk çıkınca fark ederdiniz. Dört noktayı sürüklemek birkaç saniye alıyor ve ne olacağını görüyorsunuz.
Sınırlar: baştan bilinsin
- OCR hiçbir zaman tam doğru değildir. Sonuçta bir güven kademesi gösterilir ve metni kullanmadan önce gözden geçirmeniz istenir. Özellikle rakamlarda hata pahalıdır: bir faturayı veya bordroyu doğrulamadan kullanmayın.
- El yazısı okunmaz. Bu motor basılı yazı için eğitilmiştir.
- Tarama kalitesi belirleyicidir. Eğri, karanlık, gölgeli veya çok düşük çözünürlüklü görüntülerde sonuç düşer. En iyi sonuç düz konmuş, iyi aydınlatılmış, 300 dpi civarı taramadan çıkar. Telefonla çekiyorsanız gölge düşürmeyin ve dört köşeyi işaretlemeyi atlamayın.
- Sayfa sınırı var. Bir seferde en fazla 50 sayfa taranır. Daha uzun belgeyi önce PDF bölme aracıyla parçalayın.
Belgeniz zaten gerçek metin içeriyorsa OCR'a gerek yok: PDF metin çıkarma aracı metni doğrudan alır ve sonuç kusursuz olur. O araç belgenin taranmış olduğunu fark ederse sizi buraya yönlendirir.
Nasıl kullanılır?
- Dosyayı verin ya da belgeyi çekin, Taranmış PDF, fotoğraf veya ekran görüntüsü yükleyin. Tarayıcınız yoksa "Belgeyi kameraya tut" ile telefonunuzdan çekip dört köşesini işaretleyin; eğrilik düzeltilsin.
- Belgenin dilini seçin, Türkçe, İngilizce ya da ikisi birlikte. Türkçe metinde İngilizce terimler varsa karışık seçeneği belirgin biçimde daha doğrudur.
- Yazıyı tarayın, İlk kullanımda motor ve dil verisi iner; ne kadar ineceği düğmenin üstünde yazılıdır. İşlem sürerken durdurabilirsiniz.
- Metni gözden geçirin ve alın, Sonucu panoya kopyalayın veya .txt olarak indirin. Güven kademesi düşükse metni satır satır kontrol edin.