RAG & Connaissances Par

Chatbot interne : vos procédures sont-elles prêtes ?

Un chatbot interne sur vos procédures fonctionne bien quand les documents sont organisés, à jour et lisibles par une machine. Dans mes missions RAG, les procédures internes sont le corpus le plus fréquent : c'est ce qu'un chatbot grand public ne connaît pas. Ce qui décide du résultat, c'est l'état des documents et la façon dont la réponse est présentée, avant le choix du modèle.

Cet article dit ce qui s'exploite bien, ce qui pose problème (tableaux, schémas, doublons, PDF), pourquoi chaque réponse doit citer sa source, et comment vérifier seul, si vos documents sont prêts.

En bref

  • Les procédures internes sont le corpus le plus fréquent des RAG que j'ai construits, améliorés ou audités
  • Un corpus bien organisé, en docx, s'exploite bien
  • Tableaux, graphiques, schémas, doublons et certains PDF sont les principales sources de problèmes
  • Chaque réponse doit être sourcée, pour qu'on puisse la vérifier
  • L'interface et la présentation de l'information comptent autant que le moteur

Pourquoi les procédures internes sont le premier corpus d'un chatbot d'entreprise

Un chatbot interne a de la valeur sur ce qu'un chatbot grand public ne peut pas savoir : vos procédures, vos règles, votre documentation. Sur une vingtaine de RAG construits, améliorés ou audités, dont une dizaine en production aujourd'hui, ce sont les procédures internes que je retrouve le plus souvent.

Les autres corpus rencontrés sont plus variés :

  • La documentation technique interne : chez Continental, la documentation sur les erreurs machine, avec plus de 2 000 utilisateurs et environ 15 000 documents.
  • La documentation produit, publique ou interne, pour répondre aux utilisateurs d'un logiciel.
  • Les FAQ et problèmes récurrents, pour traiter le support client de niveau 1.
  • Un référentiel réglementaire : une entreprise RH avait besoin de toutes les conventions collectives.

Le principe est le même dans tous les cas : l'assistant cherche dans vos documents, puis rédige une réponse à partir de ce qu'il a trouvé. C'est ce qu'on appelle un RAG, expliqué en détail dans notre guide du RAG en entreprise. Pour l'architecture et les coûts, voir notre article sur le RAG sur documents internes en PME : celui-ci se concentre sur l'état de vos documents.

Ce qui s'exploite bien : un corpus organisé

Un corpus bien organisé, en docx, s'exploite bien par un assistant IA. Le texte est structuré en titres et en paragraphes, la lecture est fiable, et le découpage en passages cohérents se fait sans perte.

« Bien organisé » veut dire des choses précises :

  • une arborescence où l'on sait à quel service et à quel sujet appartient chaque document ;
  • une seule version en vigueur par procédure ;
  • des titres qui disent ce que contient la section ;
  • des règles écrites en phrases complètes plutôt que suggérées par une mise en page.

Ce sont les mêmes qualités qui aident un nouveau collaborateur à s'y retrouver. Un corpus que vos équipes comprennent sans aide est un bon point de départ pour un assistant.

Ce qui pose problème : tableaux, schémas, doublons et PDF

Les tableaux, graphiques et schémas sont difficiles à exploiter par une IA et sont une source de problèmes récurrente en mission. S'y ajoutent les doublons, les documents faits uniquement de schémas, et des PDF parfois délicats à lire.

Type de documentCe que ça donneCe qu'on fait
Docx bien organisé, texte courantS'exploite bienRien de particulier, garder une version de référence
PDF avec du vrai texteGénéralement correct, avec des cas délicats (colonnes, en-têtes, pieds de page)Vérifier la lecture sur quelques documents types
TableauxSource de problèmesConvertir proprement ou reformuler en texte les tableaux qui portent une règle
Graphiques et schémasDifficiles à exploiterAjouter une description écrite de ce que montre la figure
Document fait uniquement de schémasPresque inexploitable tel quelLe compléter par un texte, ou le sortir du périmètre
Doublons et versions successivesRéponses contradictoiresGarder une seule version en vigueur dans le corpus

Le cas le plus traître est celui du tableau qui porte la règle : un barème, une matrice de responsabilités, un tableau de seuils. Un humain le lit d'un coup d'œil, la machine peut en perdre la structure et associer la mauvaise valeur à la mauvaise ligne. La réponse est alors fluide, bien rédigée, et fausse.

Les doublons posent un autre problème : si deux versions d'une procédure sont dans le corpus, l'assistant peut citer l'ancienne. La lecture des PDF et des tableaux est un sujet technique à part entière, traité côté praticien dans l'article sur le parsing de PDF pour le RAG et sur le découpage des documents.

Sourcer chaque réponse pour pouvoir la vérifier

Un chatbot sur des procédures doit afficher, avec chaque réponse, le ou les passages de documents qui l'ont produite. Je propose souvent de sourcer les réponses, pour que l'utilisateur puisse vérifier.

Trois raisons à cela :

  • Une procédure engage. Une réponse fausse sur un délai, une habilitation ou une règle de sécurité a des conséquences.
  • La vérification construit la confiance. Quand l'utilisateur ouvre la source et constate que la réponse est juste, il utilise l'outil. Quand il découvre une erreur sans source, il n'y revient pas.
  • La source permet de corriger. Si un passage obsolète est cité, on sait quel document mettre à jour.

C'est le même réflexe qu'à Continental, où les réponses renvoient aux extraits des documents d'origine, sur un sujet où l'on ne peut pas se permettre d'inventer.

L'interface compte autant que le moteur

« Une chose importante dans le RAG, c'est l'interface et la façon dont l'information est présentée à l'utilisateur. » C'est ma conviction après plusieurs projets : un bon moteur de recherche derrière une interface confuse donne un outil que personne n'utilise.

Concrètement, voici ce qui compte pour un chatbot de procédures :

  • la réponse courte en haut, avec les sources cliquables juste dessous ;
  • un accès direct au document complet, pas seulement à un extrait ;
  • la possibilité de signaler une réponse fausse en un clic, qui alimente la collecte de retours ;
  • un message clair quand l'assistant ne trouve pas, plutôt qu'une réponse approximative.

Ce dernier point rejoint la mesure de la qualité : on ne peut pas corriger ce qu'on ne mesure pas, c'est l'objet de notre article sur la mesure de la performance d'un RAG.

Checklist : vos documents sont-ils prêts ?

Vous pouvez faire seul un premier état des lieux de vos procédures sans outil, en sept étapes.

  1. Lister vos documents de procédure et leur emplacement (SharePoint, serveur de fichiers, GED, mails). Si vous ne savez pas où est la version à jour, l'assistant ne le saura pas non plus.
  2. Repérer les doublons et les anciennes versions. Pour chaque sujet, une version en vigueur, les autres archivées hors du périmètre.
  3. Identifier les formats : docx, PDF avec texte, PDF scannés, présentations, fichiers Excel. Les scans sont à traiter à part.
  4. Compter les documents où l'information utile est dans un tableau ou un schéma. C'est la liste des documents à préparer avant tout le reste.
  5. Désigner un responsable par ensemble de documents, qui sait quand un document change et qui peut dire si une réponse est juste.
  6. Écrire 20 à 50 vraies questions posées par vos équipes, avec la réponse attendue et le document où elle se trouve. Prenez-les dans les mails, le support interne, les questions que les anciens reçoivent le plus.
  7. Choisir 5 questions pièges, dont la réponse est dans un tableau, un schéma ou un document ancien. Ce sont elles qui révèlent le plus vite l'état réel du corpus.

Comment lire le résultat

Si les étapes 2 et 4 révèlent peu de doublons et peu de documents à préparer, vous pouvez lancer un premier assistant. Si elles en révèlent beaucoup, commencez par ce nettoyage : il améliore déjà la recherche documentaire de vos équipes, avec ou sans IA. Les 20 à 50 questions de l'étape 6 serviront ensuite de jeu de test, dès les premiers jours du projet.

L'usage dans le temps

L'usage d'un assistant dépend du projet, mais pour la plupart des chatbots de service client que j'ai suivis, il est en hausse avec le temps. C'est un signe que les utilisateurs reviennent quand les premières réponses sont justes.

Pour un assistant de procédures internes, c'est le même mécanisme : l'adoption se joue dans les premières semaines. Il faut donc soigner les premières réponses, partir d'un périmètre restreint de documents propres, puis élargir. Je n'ai pas d'analyse chiffrée des historiques de questions à partager : je m'en tiens à ce constat de terrain.

Dans la durée, le corpus évolue : une procédure modifiée doit mettre à jour l'index, sinon l'assistant cite l'ancienne. Ce suivi est détaillé dans notre article sur la maintenance d'un RAG en production.

Si vous voulez un assistant sur vos procédures, c'est le travail de notre offre d'assistant IA interne : état des lieux des documents, mise en place d'un jeu de questions de test, puis déploiement par étapes, sur devis.

Questions fréquentes sur le chatbot interne et les procédures

Un chatbot interne répond aux questions des collaborateurs à partir des documents de l'entreprise : procédures, notes, documentation technique, FAQ. Contrairement à un chatbot grand public, il ne répond pas de mémoire : il retrouve d'abord les passages pertinents dans vos documents (c'est le principe du RAG), puis rédige la réponse en citant ses sources.
Les procédures à jour, dans un format exploitable (de préférence docx ou PDF avec du vrai texte), rangées dans une arborescence cohérente, avec une version de référence par sujet. Plus le corpus est organisé et sans doublons, plus les réponses sont fiables. Les tableaux, graphiques et schémas demandent un traitement particulier.
Pas toujours, et c'est l'une des principales sources de problèmes. Un tableau simple peut être converti correctement, un tableau complexe ou un schéma beaucoup moins. Un document fait uniquement de schémas est difficile à exploiter tel quel : il faut le compléter par un texte décrivant ce que le schéma montre.
Parce que l'utilisateur doit pouvoir vérifier la réponse dans le document d'origine. Sur une procédure, une réponse fausse présentée sans source est plus dangereuse qu'une absence de réponse. Avec la source affichée, l'utilisateur ouvre le passage, confirme ou corrige, et la confiance dans l'outil se construit.
En faisant un état des lieux : repérer les doublons et les versions obsolètes, identifier les PDF scannés, les tableaux et les schémas porteurs d'information, désigner un responsable par ensemble de documents, puis préparer 20 à 50 vraies questions de vos équipes avec la réponse attendue. Ce jeu de questions sert ensuite à mesurer l'assistant.
Dans les projets que j'ai suivis, l'usage est en hausse pour la plupart des assistants de service client. Pour les assistants internes, cela dépend du projet : l'adoption tient à la qualité des premières réponses et à la facilité d'accès, d'où l'importance de l'interface.

Assistants IA sur vos données

Un assistant qui répond juste, à partir de vos documents ?

On construit l'assistant sur vos documents et vos outils : réponses sourcées, droits d'accès respectés, qualité mesurée sur vos vraies questions avant la mise en service.

Anas Rabhi, ingénieur IA et data scientist, fondateur de Tensoria
Anas R. Ingénieur IA, fondateur de Tensoria ianas.fr

Je suis ingénieur IA et data scientist, fondateur de Tensoria. Depuis plus de 6 ans, j'accompagne les entreprises dans l'exploitation concrète de l'IA pour leur métier : assistants internes basés sur RAG, agents IA en production, automatisations sur mesure, traitement intelligent de documents. J'interviens du cadrage initial à la mise en production, sur stacks LLM modernes (Mistral, Claude, GPT) et infrastructures souveraines quand la confidentialité l'exige.