Factures et bons de commande
Numéro, date, fournisseur, lignes de produits, quantités, prix unitaires, montants et TVA, pour la comptabilité ou le rapprochement commande, livraison et facture.
PDF, scans, factures, bons de commande, contrats, CV, cahiers des charges, rapports : nous construisons le pipeline qui lit vos documents et alimente votre ERP, votre CRM ou votre logiciel avec des données vérifiées, champ par champ. Tensoria est une agence IA basée à Toulouse qui conçoit des pipelines d'extraction de documents sur mesure pour les PME et ETI.
Cas d'usage
Chaque type de document a son propre schéma de champs, ses cas limites et son niveau de tolérance à l'erreur.
Numéro, date, fournisseur, lignes de produits, quantités, prix unitaires, montants et TVA, pour la comptabilité ou le rapprochement commande, livraison et facture.
Parties, dates d'effet et d'échéance, clauses de renouvellement ou de résiliation, montants engagés et obligations principales, pour un suivi sans relecture intégrale.
Expériences, formations, compétences et coordonnées, harmonisées dans un format commun exploitable par un outil de recrutement ou un référentiel de compétences.
Exigences fonctionnelles et techniques, contraintes normatives et critères d'acceptation, extraits et classés pour préparer un appel d'offres ou un cadrage projet.
Constats, mesures, conclusions et annexes, structurés en champs exploitables pour un suivi statistique ou une réinjection dans un système métier.
Documents reçus sous forme d'image plutôt que de texte natif, traités par OCR puis par le même pipeline de structuration et de validation.
Du prototype à la production
Coller un PDF dans un assistant conversationnel et obtenir une réponse correcte prouve que le contenu est compréhensible par un modèle de langage. Ce n'est pas encore un système sur lequel votre équipe ADV, votre comptabilité ou votre CRM peuvent s'appuyer tous les jours, sans supervision. Un pipeline de production ajoute cinq éléments qu'un essai ponctuel n'a pas besoin de traiter.
Un schéma de sortie stable
Un schéma défini à l'avance (types de champs, formats de date, unités) garantit que le premier document et le dix millième produisent une sortie exploitable de la même façon.
Des règles de validation métier
Un total qui ne correspond pas à la somme des lignes, une échéance antérieure à l'émission, un numéro de commande absent du référentiel : ces incohérences sont détectées avant l'enregistrement.
Un score de confiance par champ
Chaque champ extrait reçoit un niveau de confiance. En dessous d'un seuil défini avec vous, il part en revue humaine au lieu d'être validé silencieusement.
Une mesure sur les cas limites
Un document net d'une page se traite bien presque toujours. La vraie question porte sur le scan flou, le tableau à colonnes fusionnées ou le contrat de trente pages : c'est sur ces cas que le pipeline doit être testé en priorité.
Une mesure avant la mise en production
Avant tout déploiement, la précision est mesurée champ par champ sur un échantillon de vos documents réels. C'est cette mesure, et non une conviction générale sur les capacités de l'IA, qui décide si le pipeline est prêt.
Méthode
Chaque étape est validée avant de passer à la suivante, avec vos documents réels comme matière première.
Définition précise des champs avec vos équipes métier, puis détection du type de document : texte natif dans le PDF, ou scan nécessitant une étape d'OCR.
Le document est découpé en sections exploitables, puis un modèle de langage produit une sortie structurée conforme au schéma défini, plutôt qu'un texte libre à réinterpréter.
Des règles de cohérence propres à votre activité contrôlent chaque champ extrait et attribuent un score de confiance, avant tout enregistrement.
Les documents sous le seuil de confiance sont présentés dans une interface de revue, pour correction en quelques clics plutôt qu'en ressaisie complète.
Sur un échantillon de vos documents, chaque champ extrait est comparé à une valeur de référence validée par une personne du métier. Le pipeline ne passe en production que sur la base de ce résultat mesuré, champ par champ.
Intégration
L'extraction n'a de valeur que si les données arrivent là où votre équipe les utilise déjà.
Lignes de commande, factures ou données achats injectées dans votre système de gestion, sans ressaisie.
Coordonnées, historique contractuel ou données prospects rattachées à la bonne fiche client, automatiquement.
Documents classés, indexés et enrichis de métadonnées, pour une recherche plus fine que le texte intégral.
Pour un éditeur, les données extraites peuvent être exposées par une API dédiée et intégrées dans votre propre produit.
Un export simple en JSON, CSV ou base de données reste possible quand aucune intégration directe n'est nécessaire.
Conditions de réussite
À réunir avant de démarrer
Livrables
La liste des champs extraits, leur format et leurs règles de validation, documentés et réutilisables.
L'architecture complète, de la lecture du document jusqu'à l'écriture dans le système cible.
Le résultat mesuré sur votre échantillon, champ par champ, pas un chiffre global qui masque les points faibles.
Un écran ou un export dédié pour corriger rapidement les cas sous le seuil de confiance, sans ressaisie complète.
Transfert
Le pipeline et sa documentation vous appartiennent. Vous pouvez internaliser son exploitation ou la confier à un autre prestataire : l'objectif est que la solution vous soit utile durablement, pas qu'elle vous enferme.
Preuves
Trois projets où l'extraction de documents alimente un flux métier réel, sous contrôle humain.
Cas client
Extraction de compétences depuis des CV, offres d'emploi et fiches métier, avec rapprochement sémantique et revue humaine sur les correspondances peu confiantes.
Voir le cas client →Cas client
Extraction structurée d'une quinzaine de champs depuis le PDF d'expertise, avec relecture et validation de l'expert avant tout envoi à l'assureur.
Voir le cas client →Cas client
Extraction des prix, quantités et références depuis les emails fournisseurs, avec validation humaine avant enregistrement dans la base de données.
Voir le cas client →Nous avons aussi construit des pipelines d'extraction d'exigences dans des cahiers des charges techniques industriels et de données de CV, sur des projets non publiés, avec la même approche.
Pour aller plus loin
Architecture
Factures
Outils
ADV et achats
Contrats
Architecture hybride
Flux entrant
Quand les documents arrivent par email plutôt que déposés manuellement, l'extraction se branche directement sur ce flux.
Pour un éditeur
Intégrer une brique d'extraction directement dans votre propre produit, exposée via une API.
Système existant
Un premier pipeline existe déjà mais manque de fiabilité : l'audit établit une baseline et priorise les corrections.
Le premier échange sert à regarder ensemble un échantillon de vos documents et à évaluer ce qu'un pipeline d'extraction peut fiabiliser chez vous.

Un projet IA en tête ?
Je suis Anas, fondateur de Tensoria. Je peux vous aider à cadrer votre projet et mieux comprendre l'IA.
Prendre rendez-vous 07 82 80 51 40Ajustez les paramètres selon votre entreprise et découvrez votre potentiel d'économies.
Dites-nous où vous en êtes : on revient vers vous avec des pistes concrètes adaptées à votre métier. Pas de blabla, pas de spam.
On revient vers vous très vite avec des pistes concrètes.