Alat PDF / 11

PDF Hasil Scan ke Teks (OCR)

Baca teks dari PDF hasil scan yang tidak punya teks yang bisa dipilih, halaman demi halaman, langsung di browser Anda.

PDF Hasil Scan ke Teks (OCR): TOEA merender setiap halaman menjadi gambar, menjalankan pengenalan karakter optik (OCR) pada masing-masingnya, dan memberi label output per halaman agar Anda tahu asalnya. Berjalan 100% lokal di browser Anda tanpa upload file ke server.

Kategori
Tools PDF
Dijalankan
Di browser Anda
Biaya
Gratis · tanpa daftar
Ketersediaan
Siap digunakan
Ruang kerja PDF hasil scan → teksPemrosesan lokal

Berjalan sepenuhnya di browser Anda

↥
Pilih PDF hasil scan

PDF · hingga 30 MB, tidak pernah di-upload

Mendapatkan hasil pembacaan yang lebih bersih

Setiap halaman dirender pada 200 DPI sebelum dibaca, jadi batasnya ditentukan oleh hasil scan itu sendiri. Teks isi yang dipindai pada 300 DPI terbaca dengan baik; foto halaman dari ponsel yang diambil miring atau scan berkualitas faks dengan tulisan kecil akan menghasilkan tebakan. Halaman yang menyamping atau terbalik terbaca sangat buruk, jadi tegakkan dengan rotate PDF sebelum menjalankan pengenalan.

Pilih bahasa yang digunakan dalam dokumen karena setiap bahasa memakai model terpisah. Bahasa Tionghoa tersedia dalam model Sederhana dan Tradisional, dan memilih model yang salah sangat mengurangi akurasi. Dokumen yang mencampur dua bahasa paling baik dibaca menggunakan bahasa yang mendominasi teks.

Memeriksa hasilnya

Angka confidence adalah rata-rata dari semua halaman, jadi satu halaman yang buruk bisa tersembunyi di balik skor yang baik. Sekitar 90 atau lebih biasanya berarti hanya ada kesalahan sesekali; di bawah 75, perkirakan ada kesalahan di sebagian besar paragraf. Kesalahan yang umum adalah 0 dan O, 1, l, dan I, rn yang terbaca sebagai m, serta 5 sebagai S. Hal ini paling penting pada nominal, tanggal, dan nomor referensi, jadi periksa setiap angka dengan halaman aslinya.

Biarkan opsi Gabungkan baris menjadi paragraf tetap aktif untuk prosa karena opsi ini menyatukan kalimat yang terputus di akhir setiap baris cetak. Matikan untuk alamat, daftar, dan tabel karena jeda baris memiliki makna.

Cara menggunakannya

  1. Pilih PDF hasil scan.
  2. Pilih bahasa teksnya.
  3. Baca hasilnya lalu salin atau download.

Privasi & batasan

File Anda tidak pernah di-upload. Mesin pengenalan dan model bahasa di-download sekali — sekitar 10 MB — dan disimpan di cache oleh browser Anda, lalu semuanya berjalan di komputer Anda. Layanan OCR hosted bekerja sebaliknya: mereka menginginkan dokumennya. Dokumen panjang butuh waktu, karena setiap halaman dirender lalu dibaca bergiliran.

Alat terkait

Pertanyaan umum

Kapan saya perlu ini ketimbang PDF to Text?

Pakai dulu PDF to Text — hasilnya instan dan presisi ketika dokumen berisi teks asli di dalamnya. Alat ini untuk kasus ketika itu tidak mengembalikan apa pun, yang berarti halaman-halamannya adalah foto.

Kenapa lambat?

Setiap halaman dirender menjadi gambar lalu dibaca karakter demi karakter. Beberapa halaman itu cepat; pemindaian seratus halaman butuh waktu sungguhan, dan tab harus tetap terbuka.

Apakah tata letaknya dipertahankan?

Tidak. Kolom, tabel, dan header akan keluar sebagai baris biasa dalam urutan baca, jadi halaman yang kompleks perlu dirapikan.

Bisakah membuat PDF menjadi searchable?

Tidak di sini — itu berarti menulis lapisan teks tak terlihat kembali ke dalam file. Di sini Anda mendapatkan teksnya untuk dipakai di tempat lain.

Alat gratis · berjalan di browser anda · tanpa perlu akun