Convertir PDF en TXT

Vous pouvez convertir PDF en TXT gratuitement et sans compte : déposez le fichier ci-dessus et, une ou deux secondes plus tard, le résultat est prêt à télécharger. La conversion se fait dans votre propre navigateur : le fichier n’est donc jamais téléversé. Cela marche sous Windows, macOS et Linux comme sur iPhone et Android, et continue de marcher si vous coupez le réseau.

  • Où cela s’exécute Dans votre navigateur. Le fichier n’est pas téléversé.
  • Reconstruit TXT ne fonctionne pas comme PDF. Il ne s’agit donc pas de la dégradation progressive d’un codec avec perte : ce que TXT sait exprimer est reproduit fidèlement, et ce qui n’y a pas d’équivalent ne subsiste pas du tout.
  • Limite de taille Jusqu’à 100 Mo par fichier, gratuitement et sans compte.
  • Bon à savoir Ne fonctionne que sur les PDF munis d’une couche de texte. Les scans ressortent vides et réclament de la reconnaissance optique.

Jusqu’à 100 fichiers à la fois. Les formats mélangés ne posent pas de problème.

Le test qui décide si cela peut marcher

Il existe deux sortes de PDF et, vues de l’extérieur, elles sont identiques. La première vient d’un document — exporté depuis Word, imprimé en PDF, produit par un logiciel de gestion — et contient de vrais caractères. La seconde vient d’un scanner ou de l’appareil photo d’un téléphone et ne contient que l’image d’une page.

Cinq secondes suffisent à trancher. Ouvrez le PDF et essayez de sélectionner une ligne à la souris. Si des mots se surlignent un à un, les caractères sont bien dans le fichier et cette page va les sortir. Si la page entière se sélectionne d’un bloc, ou si rien ne se passe, c’est une image : il faut alors de la reconnaissance de caractères, ce que cette page ne prétend délibérément pas faire.

Pourquoi la mise en page ne suit pas

Le texte brut est une suite de caractères, et rien d’autre. Il ne connaît ni colonne, ni tableau, ni titre, ni page, ni police. Convertir un PDF en texte est donc volontairement destructeur — ce n’est pas la limite du procédé, c’est exactement ce que vous avez demandé.

Les conséquences sont prévisibles. Un article sur deux colonnes ressort d’un seul tenant, la colonne de gauche entière avant celle de droite, et non ligne à ligne. Un tableau se réduit à ses cellules devenues des mots, sans la grille qui leur donnait un sens. Les en-têtes et les pieds de page reviennent au milieu du flux à chaque page.

Là où l’ordre des mots peut basculer

Un PDF n’enregistre ni phrases ni paragraphes. Il enregistre des instructions du genre « dessine ces caractères à cet endroit », et l’ordre de ces instructions est le plus souvent celui de la lecture, sans que rien ne l’impose.

Les pages très travaillées sont le cas où cela casse : une maquette de magazine avec une citation en plein milieu de la colonne, un formulaire dont les champs entourent leurs libellés, une lettre d’information en encadrés. Le résultat peut sortir entrelacé, parce que le fichier ne dit effectivement pas ce qu’il faut lire en premier. Cette information n’a jamais été écrite nulle part.

Ici, le navigateur compte plus qu’ailleurs

Regardez de quoi les gens extraient du texte. Contrats, baux, comptes rendus médicaux, relevés bancaires, factures, manuscrits non publiés, articles en cours d’évaluation. La catégorie penche très fortement vers les documents dont le contenu ne regarde qu’une seule personne.

Tous les autres extracteurs de texte du web réclament un téléversement. Celui-ci lit le fichier avec pdf.js — le moteur avec lequel Firefox affiche les PDF, libre et sous licence Apache — dans la page que vous avez déjà ouverte. Et cela se vérifie au lieu de se croire : ouvrez les outils de développement, surveillez l’onglet réseau, convertissez quelque chose.

Si le texte est destiné à un modèle de langage

C’est devenu l’une des raisons les plus fréquentes, et le texte brut est le bon format pour cela. Un modèle lit du texte ; des polices et des coordonnées d’un PDF, il ne fait rien. Déposer un PDF dans une fenêtre de conversation revient d’ailleurs presque toujours à lui laisser faire cette conversion à votre place, en moins soigneux.

Deux choses aident. Convertissez le document entier plutôt que de photographier des pages à l’écran, car le texte est exact là où une image doit d’abord être devinée. Et lisez le début du résultat : si la première page est une page de garde, le fichier commence par très peu de mots — signe que cela a fonctionné, pas l’inverse.

Ligatures, césures et espaces à la française

L’extraction est fidèle à ce que dit le fichier, ce qui revient parfois à être fidèle à quelque chose d’étrange. Un mot coupé en fin de ligne garde son trait d’union. Certains documents codent fi et fl comme un seul caractère, et ils arrivent tels quels. Le français y ajoute le œ de « cœur » et le æ, que de vieux exports séparent en deux lettres ou perdent purement et simplement.

La typographie française réserve une deuxième surprise. Un document composé proprement met une espace fine insécable avant les deux-points, le point-virgule, le point d’interrogation et à l’intérieur des guillemets. Dans le texte extrait, ce caractère survit — il ressemble à une espace ordinaire, n’en est pas une, et fait échouer une recherche sur « mot : » écrite avec une espace normale. Un chercher-remplacer une bonne fois pour toutes règle la question, comme il règle celle des traits d’union.

L’encodage, et quel fichier vous obtenez au juste

La sortie est en UTF-8, et c’est ce que vous voulez dans la quasi-totalité des cas : accents, cédilles, majuscules accentuées, grec, cyrillique, japonais et émojis dans un même fichier, lisibles par tout programme récent.

Le seul endroit où cela coince est un logiciel Windows ancien, et Excel est le suspect habituel — un double-clic sur un fichier texte ou CSV lui fait deviner une vieille table de caractères, et « été » devient « été ». Passer par Données, Obtenir des données, À partir d’un fichier texte/CSV et choisir UTF-8 corrige la chose, tout comme ouvrir le fichier dans à peu près n’importe quoi d’autre.

Obtenir quand même le texte d’un scan

Si le test de sélection a montré une image, cette page ne peut rien pour vous, et le dire vaut mieux que de rendre un fichier vide. La reconnaissance de caractères est un autre procédé, avec une autre façon d’échouer : elle ne s’arrête pas bruyamment, elle se trompe en silence.

Les voies réalistes sont la reconnaissance intégrée à votre système — macOS et les versions récentes de Windows savent tirer du texte d’une image — ou un logiciel d’OCR dédié. Quelle que soit la méthode, relisez le résultat avant de lui faire confiance : dans une facture, un chiffre mal reconnu ressemble exactement à un chiffre juste.

Quelle taille de document cela supporte

L’extraction est rapide parce qu’elle lit une structure au lieu de dessiner quoi que ce soit. Quelques centaines de pages passent sans se faire remarquer, et le temps dépend à peu près de la quantité de texte, pas du poids du fichier.

Cela ralentit sur un document lourd parce qu’il est bourré d’images : il faut quand même les traverser. Une brochure scannée de 200 Mo demande un moment, puis rend, très correctement, presque aucun texte. C’est le test de sélection à nouveau, par le chemin le plus lent.

Comment convertir PDF en TXT

  1. Déposez votre fichier PDF sur cette page, ou cliquez pour en choisir un.
  2. Choisissez TXT comme destination. La conversion se fait dans votre navigateur et le fichier n’est pas téléversé.
  3. Téléchargez le fichier TXT terminé.

PDF et TXT : ce qui change

PDF face à TXT
PDFTXT
Nom completPortable Document FormatTexte brut
Extension de fichier.pdf.txt, .text, .log
Type de médiaapplication/pdftext/plain
CompressionLes deux, selon le réglage
Première publication19931963
Publié parAdobe
SpécificationISO 32000-2Unicode
LicenceStandard ouvertStandard ouvert
Situation actuelleActuelActuel
Couleur qu’il peut décrireRVB, CMJN, niveaux de gris
S’ouvre dans un navigateurTous les navigateursTous les navigateurs
Envisagé à la placeDOCX, HTMLMD, RTF

Ce que le format cible apporte

TXT est un format de travail, PDF un format fini. Ce qui revient est du texte modifiable plutôt qu’une image de la page — c’est en général la raison de la conversion, et aussi sa limite.

Ouvrir le résultat

Les logiciels habituels ne se recoupent pas : PDF s’ouvre dans Adobe Acrobat, Preview et LibreOffice Draw, TXT dans Notepad, TextEdit et Visual Studio Code — celui qui reçoit le résultat a donc besoin d’un logiciel de la seconde liste.

À quoi sert chaque format

PDF est le format de Adobe, publié en 1993. La spécification est ISO 32000-2, et elle mérite d’être connue si le fichier doit survivre à l’outil qui l’a écrit.

TXT date de 1963, décrit par Unicode. Notepad, TextEdit et Visual Studio Code le lisent.

TXT a été publié en 1963 et PDF en 1993. Le plus ancien est en général le fichier le plus sûr à remettre ; le plus récent fait le même travail en moins d’octets.

De PDF à TXT : questions fréquentes

Mon fichier PDF est-il téléversé quelque part ?

Non. Cette conversion se fait entièrement dans votre navigateur : le fichier ne quitte donc pas votre appareil. Vous pouvez le vérifier vous-même — ouvrez l’onglet réseau des outils de développement et convertissez quelque chose. Vous verrez la page elle-même et les requêtes de statistiques et de publicité qui financent ce service, et pas une seule qui transporte votre fichier. Le moteur de cette paire précise est PDF.js, le moteur PDF de Mozilla, celui qu’utilise Firefox ; votre navigateur le télécharge une fois puis le garde en cache.

Convertir PDF en TXT est-il gratuit ?

Oui. Pas de compte, pas de filigrane et pas de quota journalier à dépenser : cela tourne sur votre propre machine, vous pouvez donc revenir autant de fois que vous voulez. Le navigateur traite des fichiers jusqu’à 100 Mo, 100 à la fois. PDF.js est téléchargé sur votre machine et s’y exécute, et c’est pourquoi rien n’est compté.

Y a-t-il une perte de qualité en convertissant PDF en TXT ?

PDF et TXT décrivent le contenu de façons radicalement différentes. La conversion est donc une reconstitution et non une copie : fidèle, mais pas identique octet pour octet. Ne fonctionne que sur les PDF munis d’une couche de texte. Les scans ressortent vides et réclament de la reconnaissance optique.

Le fichier TXT est-il modifiable ensuite ?

TXT est un format de travail, PDF un format fini. Ce qui revient est du texte modifiable plutôt qu’une image de la page — c’est en général la raison de la conversion, et aussi sa limite.

En savoir plus sur ces formats

D’où viennent ces chiffres

Ce que cette page affirme sur PDF et TXT se vérifie : voici les documents qui le fixent.

  • PDF (Portable Document Format) Family

    Library of Congress, Sustainability of Digital Formats — Ce qu’est une page de PDF et pourquoi le texte qu’elle contient n’est pas une image