WrenPDF

Taranmış PDF'i Aranabilir Yapmak: OCR Gerçekten Nasıl Çalışır?

Taranmış bir PDF'te neden Ctrl+F çalışmaz, OCR bunu nasıl çözer ve elde ettiğiniz metne ne kadar güvenmelisiniz?

· 6 dk okuma

Bir taranmış belgeyi açıp Ctrl+F yaptığınızda hiçbir şey bulunamıyorsa, o PDF'te metin yoktur: sadece o metnin fotoğrafı vardır. Bu ayrımı anlamak, belgeyle ne yapabileceğinizi belirler.

"Görüntü PDF" ile "metin PDF" farkı

Bir PDF aslında bir kap. İçinde ne olduğu tamamen nasıl üretildiğine bağlı:

  • Metin PDF: Word'den, tarayıcıdan ya da bir yazılımdan "PDF olarak kaydet" ile üretilir. Karakterler gerçek metindir; seçilebilir, aranabilir, kopyalanabilir.
  • Görüntü PDF: Fotokopi makinesi veya tarayıcıyla üretilir. Sayfa, kağıdın fotoğrafıdır. Bilgisayar için bu, üzerinde yazı olan bir resimden farksızdır.

Çoğu ofis belgesi ikisinin karışımıdır: taranmış imzalı sayfa + dijital olarak eklenmiş kapak.

OCR bu boşluğu nasıl kapatır?

OCR (Optik Karakter Tanıma), görüntüdeki harf şekillerini tanıyıp bunları gerçek metne çevirir. İşlem sonunda PDF'in görüntüsü değişmez; arkasına görünmez bir metin katmanı eklenir. Sonuç: belge aynı görünür, ama artık aranabilir.

Kaliteyi belirleyen üç şey var:

  1. Tarama çözünürlüğü. 200 DPI'ın altındaki taramalarda OCR belirgin biçimde hata yapar.
  2. Sayfa eğikliği. 2–3 derece yatık bir tarama, satırları birbirine karıştırır.
  3. Dil. Türkçe'de ı/İ, ş, ğ gibi harfler, İngilizce eğitilmiş modellerde sık karışır.

Önce şunu kontrol edin

OCR'a başvurmadan önce belgenin gerçekten metin içerip içermediğini anlamak beş saniye sürer: sayfada bir cümleyi fareyle seçmeyi deneyin. Seçiliyorsa metin katmanı var demektir; OCR'a gerek yoktur.

Metin katmanı varsa, PDF → HTML aracıyla belgeyi başlık ve paragraf yapısını koruyarak düzenlenebilir metne çevirebilirsiniz. Bu, kopyala-yapıştırdan çok daha temiz bir sonuç verir.

OCR sonucuna ne kadar güvenmeli?

Sayılar ve özel adlar için hiç güvenmeyin. Bir sözleşmedeki tutar, TC kimlik numarası ya da tarih, OCR'da tek karakterle yanlış okunabilir ve bu hata gözden kaçabilir. Kritik belgelerde OCR çıktısını mutlaka gözle doğrulayın.

İyi bir kural: OCR'ı "aranabilirlik" için kullanın, "doğruluk" için değil. Metni bulmak için mükemmel, metne güvenmek için riskli.

WrenPDF yaklaşımı

WrenPDF'de OCR bilinçli olarak yok. Tarayıcıda çalışan OCR modelleri ya çok büyük (onlarca MB indirilir) ya da Türkçe'de zayıftır; ikisi de "hızlı ve gizli" vaadiyle çelişir. Metin katmanı olan PDF'lerde ise zaten OCR'a ihtiyacınız olmaz: PDF Ayıklayıcı ve PDF → HTML bu işi sunucuya hiç dokunmadan yapar.

Aç: PDF → HTML, dosyanız cihazınızdan çıkmadan, ücretsiz.