Outil PDF / 09

PDF en texte

Extrayez le texte sélectionnable d’un PDF, page par page, entièrement dans votre navigateur.

PDF en texte: TOEA lit les fragments de texte positionnés que chaque page stocke et les regroupe en lignes, en étiquetant chaque page afin que le résultat reste facile à parcourir. Fonctionne 100 % localement dans votre navigateur, sans aucun téléversement de fichier vers le serveur.

Catégorie
Outils PDF
Exécutions
Dans votre navigateur
Coût
Gratuit · sans inscription
Disponibilité
Prêt à l'emploi
Extraction du texte PDFTraitement local

Fonctionne entièrement dans votre navigateur

↥
Choisir un PDF

PDF · jusqu'à 60 MB, rien n'est téléversé

Lorsque le texte est illisible

L’extraction renvoie parfois du texte, mais celui-ci est incorrect : symboles aléatoires, cases ou lettres décalées dans l’alphabet. Cela se produit lorsque les polices du PDF ne contiennent aucune correspondance entre leurs glyphes et les vrais caractères, ce que certains logiciels de conception et d’impression omettent. La page semble correcte parce qu’elle dessine des formes ; les caractères sous-jacents ne sont pas les lettres affichées. Traitez alors le fichier comme un scan et faites-le passer par PDF numérisé vers texte.

Des anomalies plus légères ont des causes plus simples : fi et fl ont été réunis en un seul caractère de ligature, ou un mot a été séparé parce que le PDF positionne chaque lettre individuellement.

Nettoyer le texte extrait

Les lignes imprimées sont extraites séparément : un paragraphe arrive donc avec un retour à la ligne toutes les quelques mots, et les mots coupés par un trait d’union en fin de ligne restent séparés. Les en-têtes, pieds de page et numéros de page se répètent une fois par page au milieu du texte. Supprimez-les avant de citer ou de réutiliser le texte, et retirez les repères de page si le texte doit être utilisé d’un seul bloc.

Pour compter les mots ou les caractères d’un document, collez le texte nettoyé dans le compteur de mots : un comptage effectué directement sur le résultat brut inclut tous les en-têtes et repères.

Comment l'utiliser

  1. Choisissez un PDF.
  2. Extrayez le texte.
  3. Copiez-le ou téléchargez un fichier .txt.

Confidentialité et limitations

Le fichier est ouvert et réécrit dans votre navigateur et n’est jamais téléversé, ce qui est l’objectif lorsque le document est un contrat, un document scanné ou tout autre fichier que vous ne confieriez pas à un inconnu. Un PDF scanné ne contient aucun texte à extraire, et il est signalé comme tel plutôt que de renvoyer un fichier vide.

Outils associés

Questions fréquentes

Pourquoi mon PDF n’a rien produit ?

Il s’agit presque certainement d’images scannées. Une photographie d’une page ne contient aucun texte, et le récupérer nécessite une reconnaissance optique de caractères (OCR), que cet outil ne fait pas.

Pourquoi la mise en page est-elle différente ?

Un PDF stocke le texte sous forme de fragments positionnés, pas de paragraphes. Ces fragments sont regroupés en lignes selon leur position, mais les colonnes et les tableaux ne seront pas préservés tels qu’ils apparaissaient.

Les sauts de page sont-ils indiqués ?

Oui. Chaque page est étiquetée dans le résultat pour que vous puissiez voir où chacune se termine.

Est-ce que cela fonctionne avec les fichiers protégés ?

Les documents protégés par mot de passe ne peuvent pas être ouverts. Supprimez d’abord le mot de passe.

Outil gratuit · dans votre navigateur exécutions · aucun compte requis