Outil image / 28

Image en texte (OCR)

Extrayez le texte d’une photo ou d’une capture d’écran, dans votre navigateur, en douze langues, sans téléverser le fichier.

Image en texte (OCR): TOEA exécute un moteur complet de reconnaissance optique de caractères compilé en WebAssembly, lit les caractères dans l’image, puis regroupe les lignes en paragraphes pour que le résultat se lise comme un texte courant. Fonctionne 100 % localement dans votre navigateur, sans aucun téléversement de fichier vers le serveur.

Catégorie
Outils image
Exécutions
Dans votre navigateur
Coût
Gratuit · sans inscription
Disponibilité
Prêt à l'emploi
Espace image → texteTraitement local

Fonctionne entièrement dans votre navigateur

↥
Choisissez une image

PNG, JPG, WebP, or BMP · jusqu'à 30 MB, jamais téléversé

Choisir la langue

Sélectionnez la langue dans laquelle le texte est écrit avant de le lire. Le modèle linguistique fournit l’alphabet et le vocabulaire auxquels le moteur compare ses hypothèses. Ainsi, sélectionner l’anglais pour une page en français fait disparaître ou déforme les accents, tandis qu’un modèle en alphabet latin transforme un texte chinois, japonais, coréen, arabe ou russe en charabia. Pour une page multilingue, choisissez la langue principale et attendez-vous à des erreurs dans les autres.

Vérifier les paragraphes regroupés

Lorsque les lignes sont regroupées en paragraphes, un trait d’union en fin de ligne est interprété comme une coupure de mot et supprimé. Un mot composé réellement coupé à cet endroit, comme well- suivi de known, devient donc wellknown. Les lignes sont réunies avec un espace, ce qui ajoute également un espace à chaque saut de ligne dans les textes chinois ou japonais, où il ne devrait pas y en avoir. Désactivez cette option pour ces langues ainsi que pour les tableaux, les listes, les adresses et le code, où les sauts de ligne ont un sens. Pour un PDF numérisé, utilisez OCR PDF.

Comment l'utiliser

  1. Choisissez une image.
  2. Sélectionnez la langue du texte.
  3. Lisez le résultat, puis copiez-le ou téléchargez-le.

Confidentialité et limitations

Votre fichier n’est jamais téléversé. Le moteur de reconnaissance et le modèle de langue sont téléchargés une fois — environ 10 MB — et mis en cache par votre navigateur, puis tout s’exécute sur votre propre machine. Les services d’OCR hébergés fonctionnent à l’inverse : ils veulent le document.

Outils associés

Questions fréquentes

Pourquoi la première exécution est-elle lente ?

Le moteur et le modèle de langue doivent se télécharger la première fois, environ 10 MB. Ensuite, votre navigateur les met en cache et les lancements suivants démarrent immédiatement.

Quelle est la précision ?

Une capture d’écran nette est généralement quasi parfaite. Une photo de page prise au téléphone, en biais, ou un texte petit ou flou, contiendra des erreurs. Le score de confiance au-dessus du résultat vous indique dans quel cas vous vous trouvez, et il vaut toujours la peine de relire en comparant à l’original.

Peut-il lire l’écriture manuscrite ?

Non. Le moteur est entraîné sur des caractères imprimés ; l’écriture manuscrite est un autre problème et il produira du charabia.

Qu’est-ce qui améliore le résultat ?

Plus de pixels, un texte plus droit, et un meilleur contraste. Rognez pour ne garder que le texte, et photographiez la page à plat plutôt qu’en biais.

Outil gratuit · dans votre navigateur exécutions · aucun compte requis