Outil PDF / 11

PDF scanné en texte (OCR)

Extrayez, page par page, le texte d’un PDF scanné sans texte sélectionnable, entièrement dans votre navigateur.

PDF scanné en texte (OCR): TOEA convertit chaque page en image, exécute une reconnaissance optique de caractères sur chacune, et étiquette la sortie par page pour que vous sachiez d’où provient chaque extrait. Fonctionne 100 % localement dans votre navigateur, sans aucun téléversement de fichier vers le serveur.

Catégorie
Outils PDF
Exécutions
Dans votre navigateur
Coût
Gratuit · sans inscription
Disponibilité
Prêt à l'emploi
Espace PDF numérisé → texteTraitement local

Fonctionne entièrement dans votre navigateur

↥
Choisissez un PDF numérisé

PDF · jusqu'à 30 MB, jamais téléversé

Obtenir une lecture plus fiable

Chaque page est rendue à 200 DPI avant d’être lue : la limite vient donc du scan lui-même. Du texte courant numérisé à 300 DPI est bien reconnu ; une photo de page prise de biais avec un téléphone, ou un scan de qualité fax contenant de petits caractères, entraîne des approximations. Les pages placées sur le côté ou à l’envers sont très mal lues. Remettez-les à l’endroit avec rotation de PDF avant de lancer la reconnaissance.

Sélectionnez la langue du document, car chaque langue correspond à un modèle distinct. Le chinois est proposé avec des modèles simplifié et traditionnel, et choisir le mauvais modèle réduit fortement la précision. Pour un document mélangeant deux langues, la meilleure reconnaissance est généralement obtenue avec celle qui représente la plus grande partie du texte.

Vérifier le résultat

Le score de confiance est une moyenne calculée sur toutes les pages : une page illisible peut donc être masquée par un bon score général. Un score d’environ 90 ou plus signifie généralement que les erreurs sont occasionnelles ; en dessous de 75, attendez-vous à des erreurs dans la plupart des paragraphes. Les confusions courantes sont 0 et O, 1, l et I, rn lu comme m, ainsi que 5 lu comme S. Elles comptent surtout dans les montants, les dates et les numéros de référence : vérifiez donc chaque chiffre sur la page.

Laissez l’option Join lines into paragraphs activée pour le texte courant : elle reconstitue les phrases coupées à la fin de chaque ligne imprimée. Désactivez-la pour les adresses, les listes et les tableaux, où les retours à la ligne ont une signification.

Comment l'utiliser

  1. Choisissez un PDF scanné.
  2. Choisissez la langue du texte.
  3. Lisez le résultat puis copiez-le ou téléchargez-le.

Confidentialité et limitations

Votre fichier n’est jamais téléversé. Le moteur de reconnaissance et le modèle de langue sont téléchargés une fois — environ 10 MB — et mis en cache par votre navigateur, puis tout s’exécute sur votre propre machine. Les services d’OCR hébergés fonctionnent à l’inverse : ils veulent le document. Un document long prend du temps, car chaque page est rendue puis lue à son tour.

Outils associés

Questions fréquentes

Dans quels cas utiliser cet outil plutôt que PDF to Text ?

Commencez par PDF to Text — c’est instantané et exact lorsque le document contient du vrai texte. Cet outil sert quand celui-là ne renvoie rien, ce qui signifie que les pages sont des photographies.

Pourquoi est-ce lent ?

Chaque page est rendue en image puis lue caractère par caractère. Quelques pages, c’est rapide ; un scan de 100 pages prend du temps, et l’onglet doit rester ouvert.

La mise en page est-elle conservée ?

Non. Les colonnes, tableaux et en-têtes sortent en lignes simples dans l’ordre de lecture ; une page complexe devra être nettoyée.

Peut-il rendre le PDF interrogeable ?

Pas ici — cela impliquerait d’écrire une couche de texte invisible dans le fichier. Ici, vous obtenez le texte à utiliser ailleurs.

Outil gratuit · dans votre navigateur exécutions · aucun compte requis