Convertir un PDF scanné en Markdown pour l'IA : coût et méthode
Cyrill Semah

Un PDF scanné ou une photo de document n'est pas du texte : c'est une image. Quand vous le donnez tel quel à une IA, le modèle doit le lire en vision, et cette lecture se paie cher en tokens. Convertir un PDF scanné en Markdown propre avant de le passer à un modèle change à la fois le coût et la qualité de la réponse. Voici pourquoi, de combien, et comment le faire proprement, en local.
Pourquoi un PDF scanné coûte cher à une IA
Un fichier scanné ne contient pas de texte sélectionnable : chaque page est une image de pixels. Pour en extraire le sens, un modèle multimodal doit encoder cette image en tokens de vision, dont le nombre dépend surtout de la résolution. Une page dense en haute résolution peut consommer plusieurs fois le nombre de tokens que coûterait le même contenu en texte brut.
À cela s'ajoute le bruit : marges, en-têtes, filigranes, artefacts de numérisation. Le modèle paie pour tout lire, y compris ce qui n'apporte rien à votre question. Le résultat est double : une facture plus élevée, et une réponse parfois moins précise parce que le signal utile est noyé.
Combien de tokens économise-t-on en convertissant un scan en texte ?
Une fois le scan passé en texte propre, la même page est généralement 2 à 7x plus légère en tokens. La fourchette est large parce que le gain dépend de la résolution de départ, de la densité de la page et du fournisseur d'OCR. Une facture scannée en haute définition gagne beaucoup ; un scan déjà léger, un peu moins.
Ce chiffre est honnête à une condition : il ne vaut que pour les cas visuels ou bruités, c'est-à-dire les images, les scans, les PDF lourds et les pages web. Un document déjà structuré, comme un Word ou un Excel sans image, ne profite pas de ce gain : son texte utile pèse à peu près pareil une fois extrait. Sur ces formats, l'intérêt est ailleurs, dans la normalisation et une sortie stable, un sujet que nous traitons dans un guide dédié aux pipelines RAG.
Convertir un PDF scanné en Markdown, étape par étape
La méthode est la même quel que soit l'outil, mais l'objectif est de sortir du texte propre et réutilisable, pas juste une transcription brute.
- Déposez le fichier. Un PDF scanné, une photo, une capture d'écran. Le format est détecté automatiquement.
- Lancez l'OCR sur l'image. C'est l'étape qui transforme les pixels en texte. Elle passe par un fournisseur d'IA.
- Relisez le résultat. Une prévisualisation de l'original à côté du Markdown permet de corriger une ligne mal reconnue avant l'export.
- Exportez en Markdown ou en JSON. Le Markdown pour un prompt ou une note, le JSON structuré pour un pipeline.
Avec Sygal, ce parcours est local pour tout ce qui n'est pas l'OCR, et le compteur de tokens intégré affiche le poids du document converti, pour que vous voyiez concrètement ce qu'un modèle va lire.
Quel fournisseur OCR choisir pour un scan ?
Sygal fonctionne en "bring your own key" : vous branchez votre propre compte chez le fournisseur de votre choix, avec votre clé API, sans marge ajoutée. Le bon choix dépend surtout du volume.
- Mistral facture un prix fixe par page, avec un mode batch encore moins cher. C'est souvent le plus économique sur de gros volumes de scans.
- OpenAI (le choix par défaut) se facture au token selon la résolution. Efficace pour des documents variés au quotidien.
- Claude se facture aussi au token et devient le plus cher à volume.
- NVIDIA NIM propose une option gratuite pour démarrer sans budget d'API, et Gemini est également disponible.
Comme la clé est la vôtre, vous payez l'API au prix réel et vous pouvez changer de moteur d'une conversion à l'autre. La qualité de l'OCR dépend du modèle choisi, pas de Sygal, qui se contente de relayer votre image et de vous rendre le résultat.
Combien coûte l'OCR d'un PDF de 100 pages ?
Un ordre de grandeur aide à décider. Prenons un PDF scanné de 100 pages en résolution standard. Avec un fournisseur au prix fixe par page comme Mistral, le coût est prévisible : vous multipliez le tarif par page par le nombre de pages, et le mode batch le réduit encore sur les gros volumes. Avec un fournisseur facturé au token comme OpenAI ou Claude, le coût dépend de la résolution : plus l'image est grande, plus elle consomme.
Le point important n'est pas le montant exact, qui varie avec les tarifs publics et le type de page, mais le rapport. Une fois le scan converti en texte propre, chaque question posée ensuite au modèle se paie au tarif du texte, pas à celui de l'image. Vous payez l'OCR une fois, puis vous réutilisez le résultat au tarif le plus bas, autant de fois que nécessaire. C'est là que la conversion en amont devient rentable : sur un document que vous allez interroger plusieurs fois, l'écart se creuse à chaque prompt. Pour un chiffrage précis, appuyez-vous sur la grille tarifaire publique du fournisseur que vous avez choisi : la clé étant la vôtre, le prix affiché est celui que vous payez, sans intermédiaire.
Les documents déjà en texte : un cas différent
Il faut être clair pour ne pas vendre du vent : tout ce raisonnement sur les tokens vaut pour les images et les scans. Un PDF déjà en texte, un Word, un Excel bien structuré ne coûtent pas beaucoup plus cher que leur contenu utile. Les convertir apporte quand même quelque chose, mais pas une économie de tokens : une sortie propre et cohérente, la même pour tout un corpus, exploitable directement dans un pipeline. La conversion locale de ces formats s'appuie sur MarkItDown, le moteur open source de Microsoft, qui tourne sur votre machine sans appel réseau.
Passer à la pratique
Si vous préparez régulièrement des scans, des factures ou des rapports pour une IA, convertir en amont vous fait gagner sur les deux tableaux : moins de tokens sur les cas visuels, et un texte plus propre donc des réponses plus nettes. Vous pouvez tester la méthode sur vos propres fichiers avec l'essai gratuit de 14 jours, sans carte, ou automatiser le traitement en ligne de commande avec Sygal CLI si vous travaillez par lots.
Questions fréquentes
Un PDF scanné est une image. Pour le lire, un modèle doit le traiter en vision, ce qui se facture en tokens d'image proportionnels à la résolution, souvent plusieurs fois le coût du texte équivalent. Un PDF déjà en texte, lui, se lit directement comme du texte, beaucoup moins cher.
Essayez Sygal gratuitement pendant 14 jours
Convertissez PDF, images et documents Word en Markdown propre, en local sur votre Mac ou PC. Sans cloud, sans abonnement.
Télécharger SygalArticles liés

Convertir des documents confidentiels sans cloud : la méthode 100% locale
Juridique, compta, santé : vos documents ne doivent pas partir dans le cloud. Voici comment les convertir en Markdown et JSON, 100% en local, et où sont les vraies limites.
Lire l'article
Préparer ses documents pour un pipeline RAG : Markdown et JSON propres
Un pipeline RAG ne vaut que ce que valent ses documents d'entrée. Voici comment normaliser n'importe quel format en Markdown et JSON exploitables, en local.
Lire l'article
Pourquoi on lance un blog pour Sygal
Sygal vient d'être mis en ligne, sans blog jusqu'ici. Voici pourquoi on en ouvre un maintenant, et ce que vous y trouverez : des données réelles, pas des astuces génériques.
Lire l'article