Extraire le texte d’un PDF sans l’envoyer nulle part
Déposez votre PDF ici
ou cliquez pour parcourir
Zéro limite de taille · un document à la fois
Les cinquante-deux autres outils
Trois formats, trois usages
Texte brut (.txt). Le contenu, sans mise en forme. C’est ce qu’il faut pour coller dans un courriel, un formulaire, ou pour donner à lire à un autre logiciel.
Markdown (.md). Le texte avec ses niveaux de titre marqués par des dièses. Utile si vous reprenez le document dans un éditeur de notes ou une base de connaissances.
Page web (.html). Le texte structuré en titres et paragraphes, avec les séparations de page visibles. C’est le format le plus lisible des trois si vous voulez simplement relire.
Ce qu’un PDF ne contient pas
Un PDF ne range pas des paragraphes. Il range des morceaux de texte avec leur position sur la page, dans l’ordre où le logiciel les a écrits, qui n’est pas toujours l’ordre de lecture. Les lignes, les paragraphes et les titres n’existent pas dans le fichier : ils sont déduits des positions et des tailles de caractères.
Cette reconstruction est bonne sur un document bureautique ordinaire. Elle se dégrade sur les mises en page complexes : deux colonnes de journal, un tableau serré, un formulaire administratif.
La structure
Les titres sont identifiés à partir de leur taille de caractères. Lorsque les tailles varient entre les lignes, plusieurs lignes peuvent être interprétées comme des titres. Le système évalue alors la proportion de blocs candidats identifiés comme des titres. Si cette proportion dépasse un quart des blocs, la structure hiérarchique est abandonnée et le document est restitué sous forme de texte plat.
Les PDF scannés n’ont pas de texte
Une page scannée est une photographie. Il n’y a aucun texte dedans, seulement des pixels qui en dessinent la forme.
Pour ces documents, il faut de la reconnaissance de caractères. Elle n’est pas proposée ici.
Questions fréquentes
Mes fichiers sont-ils envoyés quelque part ? Non. Vous pouvez le vérifier vous-même, en trente secondes : voici la marche à suivre.
La mise en page est-elle conservée ? Non : cet outil récupère le texte, pas la présentation. Les colonnes et les tableaux ressortent à plat.
Pourquoi mon PDF scanné ne rend-il rien ? Parce qu’il ne contient pas de texte, seulement des images de texte. Il faudrait de la reconnaissance de caractères, que cet outil ne fait pas.
Les numéros de page sont-ils conservés ? Oui si vous laissez l’option cochée : chaque page est séparée par une marque qui porte son numéro.
Et les PDF protégés par mot de passe ? Ils ne peuvent pas être traités tant qu’ils sont verrouillés. Passez d’abord par déverrouiller un PDF, si vous en connaissez le mot de passe.
Wize