PDF texte ou PDF scanné : la différence qui change tout
Deux relevés peuvent sembler identiques à l'écran et être, pour un ordinateur, deux objets radicalement différents. L'un contient du texte lisible par une machine ; l'autre n'est qu'une photographie. Cette distinction explique la quasi-totalité des mauvaises extractions vers Excel.
Le test des cinq secondes
Ouvrez votre relevé et essayez de sélectionner un montant avec la souris, comme vous le feriez dans un traitement de texte.
- Le texte se surligne ? Vous avez un PDF texte. Parfait.
- Rien ne se passe, ou vous sélectionnez un bloc rectangulaire ? C'est une image. Le document est un scan.
Autre indice : la recherche (Ctrl+F). Tapez le nom d'un commerçant présent sur le relevé. Si la recherche ne trouve rien alors que le mot est visible à l'écran, il n'existe aucune couche de texte.
Ce que contient réellement un PDF texte
Un PDF généré par votre banque ne stocke pas une image de page. Il stocke une liste d'éléments : « la chaîne CARTE X8882 ZARA commence aux coordonnées X=118, Y=642, dans telle police, à telle taille ». Chaque fragment de texte porte sa position exacte sur la page.
C'est cette information de position qui rend l'extraction fiable. Un convertisseur n'a pas besoin de « comprendre » le tableau : il lui suffit de repérer où se trouve l'en-tête « Débit » et de rattacher à cette colonne tout montant aligné dessous. Les caractères sont connus avec certitude ; seule leur organisation demande du travail.
Un PDF scanné, c'est une photo
Un scan ne contient qu'une grande image par page. Aucune position, aucun caractère, aucune notion de colonne. Pour en tirer des données, il faut passer par la reconnaissance optique de caractères (OCR) : un programme analyse les pixels et tente de deviner quelles lettres et quels chiffres ils représentent.
Le mot important est deviner. L'OCR produit une hypothèse, pas une certitude. Sur un texte courant, une erreur passe souvent inaperçue. Sur un relevé bancaire, une erreur d'un seul caractère change un montant.
Les erreurs typiques de l'OCR sur un relevé
Ces confusions reviennent systématiquement, parce qu'elles opposent des formes proches :
| Confusion | Conséquence sur un montant |
|---|---|
8 lu 3 (ou l'inverse) | 38,00 devient 88,00 |
0 lu O, 1 lu l ou I | Le montant n'est plus reconnu comme un nombre |
5 lu 6, 6 lu 8 | Erreur silencieuse, difficile à repérer |
| Virgule lue comme un point | 1,50 peut devenir 150 selon l'interprétation |
| Séparateur de milliers perdu | 2 429,41 devient 242 941 |
À cela s'ajoute un problème d'alignement : sur une page photographiée légèrement de travers, un montant de la colonne Crédit peut se retrouver interprété comme appartenant à la colonne Débit. Le total est alors faux dans les deux sens à la fois.
D'où viennent les relevés scannés ?
- La photo au smartphone d'un relevé papier — le cas le plus fréquent, et le plus difficile pour l'OCR à cause des ombres et de la perspective.
- Le scanner de l'imprimante, meilleur, mais qui produit tout de même une image.
- Un relevé ancien numérisé par la banque avant la généralisation des documents électroniques.
- Un PDF « réimprimé » : un document imprimé puis renumérisé perd sa couche de texte, même si l'original en avait une.
Comment obtenir un vrai PDF texte
La solution est presque toujours la même : retourner à la source. Connectez-vous à l'espace client ou à l'application de votre banque et téléchargez le relevé officiel depuis la rubrique « Documents » ou « Relevés ». Ce fichier est généré directement par la banque et contient une couche de texte complète.
Nos guides par banque détaillent le chemin exact pour chaque établissement français. Quelques minutes suffisent, et la différence de qualité d'extraction est spectaculaire — on passe d'un résultat à vérifier ligne par ligne à un tableau qui tombe juste du premier coup.
Si le relevé n'existe qu'en papier (compte clôturé, période ancienne), demandez un duplicata à votre banque avant de vous rabattre sur un scan.
Si vous n'avez vraiment que le scan
L'OCR reste utile ; il faut simplement l'aider et vérifier son travail :
- Scannez à plat, à 300 dpi minimum, plutôt que de photographier.
- Redressez la page et évitez les ombres portées : l'inclinaison est l'ennemi n°1 de la détection des colonnes.
- Préférez le noir et blanc contrasté à une photo couleur sous-exposée.
- Contrôlez systématiquement les totaux. Additionnez la colonne Débit obtenue et comparez-la au total imprimé par la banque. C'est la vérification la plus rapide et la plus efficace : si les deux coïncident, l'extraction est presque certainement juste.
Tester la conversion de mon relevé →
Questions fréquentes
Pourquoi la conversion d'un scan est-elle si lente ?
Parce que l'OCR analyse chaque pixel de chaque page, une tâche bien plus lourde que la lecture d'une couche de texte. Sur un relevé scanné de plusieurs pages, comptez plusieurs dizaines de secondes.
Un PDF protégé par mot de passe pose-t-il problème ?
Il doit être déverrouillé pour être lu. Ouvrez-le avec le mot de passe, puis enregistrez-en une copie sans protection avant de le convertir.
Comment savoir si l'outil a utilisé l'OCR ?
La conversion est nettement plus longue et l'interface signale l'étape de reconnaissance. Dans ce cas, la vérification des totaux est indispensable.