Structure reconstruite
Les niveaux de titres, les listes, les citations et le code reviennent en syntaxe Markdown, et une mise en page sur deux colonnes est lue colonne par colonne, plutôt qu'en continu de gauche à droite.
Les convertisseurs se disputent sur ce qu'ils conservent. Ce qui ruine le Markdown, c'est l'en-tête qui se répète sur les quatre cents pages.
Un PDF stocke des glyphes à des positions ; la structure que vous voyez n'y est inscrite nulle part. Reconstruire cette structure, supprimer ce qui se répète et gérer les tableaux, c'est ce que font les trois fonctions ci-dessous.
Les niveaux de titres, les listes, les citations et le code reviennent en syntaxe Markdown, et une mise en page sur deux colonnes est lue colonne par colonne, plutôt qu'en continu de gauche à droite.
Les en-têtes, pieds de page, numéros de page, filigranes et la mention de confidentialité de chaque page sont supprimés — ainsi que les mots coupés entre deux pages. Vous obtenez la liste de ce qui a été retiré.
Les tableaux réapparaissent en tableaux Markdown, et un tableau qui franchit une coupure de page est recousu plutôt que redémarré. Si une cellule fusionnée ne peut pas être retranscrite proprement, c'est signalé plutôt que supposé.
Trois étapes pour passer d'un PDF à un Markdown pouvant être intégré directement dans un pipeline.
Un fichier ou un dossier de fichiers. Que le résultat soit lu par une personne ou par un modèle change ce qu'il vaut la peine de conserver : mieux vaut donc le préciser.
Il détermine les niveaux de titres d'après la typographie du document, ordonne les colonnes, reconstitue les tableaux et supprime tout ce qui se répète sur chaque page.
Vérifiez la liste de ce qui a été retiré avant que le Markdown ne soit utilisé. Enregistrez l'opération en tant que Playbook pour que le prochain lot de la même source soit traité à l'identique.
Tout conserver est facile. Décider de ce qui ne doit pas survivre au voyage est le vrai travail.
Il n'y a aucun niveau de titre stocké dans un PDF, ni aucun paragraphe — seulement des caractères placés à des coordonnées dans une taille donnée. Chaque convertisseur déduit la structure de la taille et de l'espacement typographiques, ce qui explique que deux convertisseurs donnent un Markdown différent à partir du même fichier.
.jpeg&w=1920&q=75)
Dans cette catégorie, la compétition tourne autour de la conservation : garder les tableaux, garder les en-têtes. Mais un numéro de page et un bandeau de confidentialité qui apparaissent toutes les cinq cents mots sont fidèlement conservés et activement nuisibles, car tout lecteur devra les franchir dans chaque extrait. La suppression mérite d'être une fonctionnalité à part entière.
.jpeg&w=1920&q=75)
Dans un pipeline, le Markdown est un produit intermédiaire — généré, intégré, et jamais ouvert par un humain. Alors quand les réponses sont fausses, on blâme le modèle et jamais la conversion. C'est pourquoi cette étape doit indiquer ce qu'elle a fait, plutôt que de livrer un résultat à l'apparence nette.
.jpeg&w=1920&q=75)
Les documents d'une même source partagent leur habillage — le même bandeau, le même pied de page. Une fois celui-ci identifié dans le premier fichier, les trois cents restants sont traités de la même manière. Votre AllyHub ne repart jamais de zéro ; l'ingestion en masse devient ainsi plus rapide à chaque fois.
.jpeg&w=1920&q=75)
Les équipes qui construisent des pipelines de recherche, les personnes qui déplacent des documents vers des notes, les équipes de documentation qui mettent les PDF sous contrôle de version, et les archives à long terme.
Le module de découpage ne sait pas que la ligne sur laquelle il vient de couper est un pied de page ; le pied de page se retrouve donc dans un extrait qui parle d'autre chose. Multipliez cela par chaque page du corpus, et la recherche se dégrade imperceptiblement pour une raison que personne n'attribue à l'ingestion.
Un PDF qui traîne dans un dossier ne fait pas vraiment partie de vos notes : impossible de créer un lien vers lui, de le citer au fil du texte, ou de le retrouver avec la recherche que vous utilisez. C'est la conversion qui en fait un document parmi vos documents, plutôt qu'une pièce jointe.
Une spécification qui arrive en PDF reste en dehors du système documentaire : recherche séparée, historique séparé, site séparé. L'intégrer lui permet d'être maintenue avec tout le reste, au lieu de devenir le fichier dont on oublie l'existence.
Un PDF est lisible aujourd'hui et pénible pour toujours — difficile à rechercher, difficile à reformater, lié à l'outil qui l'a produit. Le texte brut, avec sa structure intacte, reste utile même lorsque l'outillage d'origine a disparu.
Découvrez d'autres outils propulsés par l'IA pour la recherche, le contenu et les données.

Scraper de best-sellers Amazon — extrayez n’importe quelle liste de classement avec position, ASIN, prix et note. Sans code, sans API Amazon, toutes places de marché. Essayez AllyHub gratuitement.

Amazon Product Scraper — extrayez des données produit structurées depuis n'importe quel domaine Amazon, sans code ni l'API Amazon. Exportez en JSON ou CSV. Essayez AllyHub gratuitement.

Amazon Niche Finder — commencez par vos centres d'intérêt, une catégorie ou un concurrent, et obtenez des niches sous-exploitées évaluées en fonction de la demande par rapport à la concurrence. Essayez AllyHub gratuitement.
Tableaux, scans, coût, et ce qu'il advient des éléments répétés.
Il transforme un PDF en texte brut qui porte sa structure — titres avec dièses, listes avec puces, tableaux en lignes séparées par des barres verticales. C'est plus important qu'avant, car les modèles de langage et les moteurs de recherche lisent bien le Markdown et mal les PDF : la conversion est désormais la première étape de nombreux pipelines, et non plus un confort occasionnel.
Oui, pour un fichier à la fois. Les formules payantes couvrent les cas qui se répètent : des dossiers entiers en une seule passe, des documents dont le modèle comporte ses propres éléments répétés à identifier, et la cohérence du traitement afin que le quatre-centième fichier ressemble au premier.
Les tableaux simples se convertissent proprement en Markdown. Les cellules fusionnées et les en-têtes imbriqués n'ont aucun équivalent direct en Markdown ; il faut donc en sacrifier un aspect. Plutôt que de les aplatir silencieusement, ces cas sont signalés, afin que vous puissiez décider si le tableau doit rester sous forme d'image ou être restructuré à la main.
Pas actuellement. Une page scannée est une image de texte et non du texte, et la lecture d'images n'est pas une fonction actuelle de l'outil. Test rapide : ouvrez le PDF et essayez de sélectionner une phrase avec le curseur. Si la sélection fonctionne, la conversion fonctionnera aussi ; si rien ne se surligne, elle échouera.
La plupart convertissent puis s'arrêtent, ce qui convient quand on a un fichier unique. Cet outil est conçu pour quatre cents fichiers d'une même source : les éléments récurrents de ce modèle sont identifiés une fois, puis appliqués aux suivants, et vous êtes informé de ce qui a été retiré au lieu d'avoir à supposer que le résultat net est complet.