L'OCR IA ne se contente pas de lire le texte d'un document. Il comprend sa structure, repère ce qu'est un total, une date d'échéance ou une clause de reconduction, et rend des données prêtes à entrer dans votre ERP, avec un niveau de confiance par champ.
L'OCR classique, lui, produit du texte brut. C'est suffisant quand tous vos documents ont la même mise en page. Dès qu'ils varient (fournisseurs, formats, scans de mauvaise qualité), c'est la couche IA qui fait la différence.
Cet article s'adresse à celui qui doit décider. Ce que l'IA ajoute, ce qu'on en tire par type de document, où elle se trompe, et quand passer d'un outil du marché à une chaîne sur mesure.
OCR définition, et ce que l'IA change
L'OCR (reconnaissance optique de caractères) convertit l'image d'un document, scan ou photo, en texte. Il répond à la question « quels caractères y a-t-il sur la page ? ». Il ne sait pas dire si « 1 250,00 » est un total, une quantité ou un numéro de rue.
L'OCR intelligent, aussi appelé document AI ou intelligent document processing (IDP), ajoute trois couches par-dessus la lecture.
- La mise en page. Tableaux, colonnes, en-têtes, cases cochées, tampons.
- La compréhension. Un modèle identifie les champs utiles (émetteur, montant HT, date de livraison, durée du contrat) même quand leur place change d'un document à l'autre.
- La confiance. Chaque valeur extraite vient avec un score, ce qui permet d'envoyer à une personne uniquement les cas douteux.
Les grands acteurs proposent ce socle sous forme d'API. Google décrit son Enterprise Document OCR comme un modèle spécialisé qui extrait texte et structure de PDF, scans et documents Word, avec un score de qualité d'image et une correction de rotation. Mistral documente de son côté son offre Document AI, qui combine OCR et extraction structurée. Notre fiche sur Mistral OCR détaille cet outil.
| Critère | OCR classique | OCR IA |
|---|---|---|
| Sortie | Texte brut | Champs structurés (JSON, tableau) |
| Mise en page variable | Gabarit à configurer par modèle de document | Gérée par le modèle |
| Compréhension du contenu | Aucune | Oui, avec score de confiance |
| Cas idéal | Formulaire identique à chaque fois | Documents de fournisseurs et formats multiples |
OCR IA par type de document
Le même moteur ne rend pas le même service selon le document. Ce qui compte, c'est la liste des champs que vous voulez récupérer et ce que vous faites ensuite de la donnée.
Factures
C'est le cas le plus mûr, parce que les champs sont connus et vérifiables. Numéro, date, émetteur, lignes, montants HT, TVA et TTC se recoupent par le calcul, ce qui permet de détecter une erreur d'extraction sans relire. Pour l'OCR facture IA, les contrôles (arithmétique, IBAN, doublons) comptent autant que le moteur. Le détail est dans notre article sur l'OCR de factures avec l'IA.
Bons de commande et bons de livraison
Un OCR de bon de commande doit rapprocher les lignes d'un document de votre référentiel articles. Les références client, les désignations abrégées et les quantités en unités différentes sont le vrai travail. Le moteur lit, la chaîne rapproche et signale les écarts avec la commande d'origine.
Contrats
Pour un OCR de contrat, on extrait les parties, les dates, la durée, les clauses de reconduction et de préavis, les montants. L'IA est efficace pour retrouver ces éléments dans un texte long. Chaque valeur doit renvoyer à la page et à la phrase d'origine, pour qu'un juriste vérifie en quelques secondes. L'interprétation reste humaine.
Documents manuscrits
L'OCR manuscrit IA a progressé, mais il reste le maillon le moins fiable. Fiche d'intervention, bon signé sur chantier, formulaire rempli à la main. Selon l'écriture et la qualité de la photo, le taux d'erreur varie beaucoup, il faut donc le mesurer sur vos propres documents. Tout champ manuscrit qui engage un paiement ou une responsabilité passe par une relecture.
Les limites, et comment les encadrer
Un OCR IA se trompe, comme une personne qui saisit à la main. La différence est qu'il se trompe avec aplomb, d'où l'importance d'encadrer les erreurs plutôt que d'espérer qu'elles n'arrivent pas.
- Seuil de confiance. Sous un certain score, le document part en revue humaine. Ce seuil se règle sur un échantillon de vos documents, pas sur une valeur par défaut.
- Contrôles métier indépendants du modèle. Totaux qui se recoupent, IBAN valide, fournisseur connu, quantité cohérente avec la commande.
- Qualité du document. Scan penché, photo prise de biais, tampon sur un montant, fax. La qualité d'entrée limite la qualité de sortie, et certains services publient un score de qualité d'image pour le détecter.
- Mesure sur vos documents. Les chiffres de précision publiés par les éditeurs portent sur leurs jeux de test. Seul un essai sur 100 à 200 de vos vrais documents dit ce que vous obtiendrez.
Un point de conformité s'ajoute. Une facture ou un contrat contient des données personnelles, ce qui fait entrer le traitement dans le champ du RGPD. La CNIL détaille ses recommandations sur l'IA et le RGPD. Vérifiez où le fichier est traité et combien de temps il est conservé chez le fournisseur.
Outil du marché ou chaîne sur mesure
Un outil du marché convient quand le type de document est standard, le volume modéré et que la donnée extraite part dans un seul logiciel. Une chaîne sur mesure se justifie dans les autres cas.
| Situation | Option plus adaptée |
|---|---|
| Un seul type de document, format courant | Outil du marché ou API directe |
| Formats nombreux, documents propres à votre métier | Chaîne sur mesure |
| Validation contre ERP, référentiel ou commande | Chaîne sur mesure |
| Documents sensibles, hébergement imposé | Chaîne sur mesure, modèles hébergés en Europe ou chez vous |
| Besoin ponctuel, quelques documents | Un modèle généraliste suffit |
Le moteur de lecture n'est qu'une pièce. Le reste de la chaîne (réception des fichiers, rapprochement, contrôles, file de revue, écriture dans l'ERP) fait la différence en production. Nous construisons ce type de pipeline dans notre offre d'extraction de documents par IA, avec un essai chiffré sur vos documents avant tout engagement.
Pour comparer les outils eux-mêmes, voir notre comparatif d'outils d'extraction de données.
Par où commencer
Commencez petit et mesurez. Un projet qui démarre par « tous nos documents » s'enlise. Un projet qui démarre par un type de document, avec un échantillon réel, aboutit.
- Choisissez un document qui revient souvent et dont la saisie vous coûte du temps (factures fournisseurs, bons de livraison).
- Listez les champs à récupérer et ce que vous en faites ensuite.
- Rassemblez 100 à 200 exemples réels, y compris les plus mauvais scans.
- Testez un ou deux moteurs et comptez les erreurs, champ par champ.
- Définissez la revue humaine, c'est-à-dire qui relit quoi, sous quel seuil.
Si vous voulez savoir si votre flux est un bon candidat, notre diagnostic en ligne pose les bonnes questions en quelques écrans. Le cadre général de ce type de projet est dans le guide automatisation n8n et IA.