Vous voulez déployer un agent IA pour accélérer vos réponses aux appels d'offres. Vous avez lu que Claude peut désormais ingérer jusqu'à 1 million de tokens en une seule requête, au tarif standard. Vous avez aussi lu que le RAG est le pattern de référence pour les bases documentaires d'entreprise. Lequel choisir ? La réponse honnête : ça dépend de votre situation, et l'arbitrage ne se joue plus sur le prix du contexte long mais sur la qualité des drafts, la fraîcheur et la traçabilité de vos références, la latence et la confidentialité de vos données.
Cet article n'est pas sur l'orchestration du workflow AO (nous l'avons couvert en détail dans notre guide n8n) ni sur le ROI global de l'IA sur les appels d'offres. C'est un article d'architecture, destiné à ceux qui ont déjà décidé de construire et qui veulent éviter de se retrouver avec un système qui hallucine des références ou qui coûte dix fois trop cher en tokens.
Nous allons passer en revue les trois approches disponibles, leurs limites respectives, la grille de décision que nous utilisons chez Tensoria pour nos clients BTP, bureaux d'études et ESN, et les pièges qui coûtent le plus cher à corriger en cours de projet.
En bref
- Long context : charger le CDC complet en prompt. Depuis mars 2026, la fenêtre de 1 million de tokens de Claude est en disponibilité générale au tarif standard : zéro perte d'information jusqu'à plusieurs centaines de pages, coût marginal. Les vrais points de vigilance sont désormais la latence et la fraîcheur d'une base de références qui évolue en continu.
- RAG : recherche sémantique dans la base de références gagnantes. Indispensable quand l'historique dépasse 50 documents, pour la traçabilité des sources et la mise à jour continue. Nécessite une base structurée de qualité.
- Architecture hybride : long context sur le CDC + RAG sur la base interne. Pattern recommandé en production pour bureaux d'études, ESN et PME BTP.
- Prérequis non négociable : la base de références internes (fiches projets, mémoires gagnés, CVs équipe) doit exister avant de déployer quoi que ce soit.
- Confidentialité : Mistral (Large ou Medium 3.5, ce dernier en poids ouverts depuis avril 2026) on-premise pour les secteurs sensibles (défense, OIV, données client NDA strict), Claude ou GPT-4o en cloud souverain pour les autres.
Pourquoi ce choix d'architecture n'est pas trivial
Un agent de réponse aux appels d'offres travaille en réalité avec deux types de corpus très différents, et c'est là que la plupart des projets se trompent d'approche.
Le premier corpus, c'est le CDC de l'appel d'offres en cours : le CCTP, le règlement de consultation, la DPGF, le CCAP, parfois les plans. Ce document est nouveau à chaque AO, il n'est pas indexable à l'avance, et la moindre exigence manquée dans l'analyse peut éliminer votre dossier avant même la lecture technique. La précision est critique.
Le second corpus, c'est votre base de références internes : les réponses gagnantes des années précédentes, les fiches projets livrés, les CVs de l'équipe, les certifications, les méthodologies maison. Ce corpus grossit dans le temps, il peut atteindre plusieurs centaines de documents, et il est le matériau brut dont l'agent va extraire le contenu réutilisable pour construire le draft.
Ces deux corpus n'ont pas les mêmes caractéristiques. Ils n'appellent pas la même architecture. Et les confondre dans une seule approche "on met tout dans le contexte" ou "on passe tout en RAG" est la source principale des déceptions en phase pilote.
Approche 1 : le long context, ses atouts et ses vraies limites
Comment ça fonctionne sur un CDC
Avec Claude Sonnet 5 ou Claude Opus 5 (fenêtre de contexte de 1 million de tokens, en disponibilité générale au tarif standard depuis mars 2026) ou GPT-4o (128 000 tokens), vous pouvez charger le DCE complet en une seule requête. L'agent reçoit l'intégralité du dossier de consultation, et vous lui demandez d'en extraire les exigences clés, les critères de notation et leur pondération, les contraintes de format et les points différenciants à adresser.
L'avantage est réel : aucune information n'est perdue par découpage en chunks. Avec le RAG, un chunk mal délimité peut couper une exigence en deux, perdre la pondération d'un critère ou ignorer un renvoi entre documents. Sur un CDC où chaque exigence compte, la lecture complète par le modèle est plus fiable que la récupération fragmentée.
Les limites que les benchmarks ne montrent pas
La première limite est ce que les chercheurs appellent le "lost in the middle" : les modèles LLM sont moins précis sur les informations situées au milieu d'un très long contexte que sur celles placées au début ou à la fin. Sur un CDC de 150 pages où les exigences techniques sont réparties du début à la fin du document, cette dégradation devient perceptible.
La deuxième limite était historiquement le coût, mais elle s'est largement estompée depuis mars 2026. Un CDC de 80 pages représente environ 90 000 tokens en entrée. Depuis le 13 mars 2026, la fenêtre de 1 million de tokens de Claude est passée en disponibilité générale au tarif standard, sans la surfacturation "long contexte" qui s'appliquait auparavant au-delà de 200 000 tokens. Avec Claude Sonnet 5 (3 dollars en entrée et 15 dollars en sortie par million de tokens, ou 2 et 10 dollars au tarif de lancement jusqu'au 31 août 2026), une analyse complète coûte de l'ordre de 0,20 à 0,35 dollar, quelle que soit la taille du CDC dans la limite du million de tokens. Sur 40 AOs par an, même avec plusieurs relances pour affiner les sections, le coût LLM annuel de l'analyse du CDC reste marginal face au coût d'une heure d'ingénieur senior. Ce que le long context ne résout toujours pas, en revanche, c'est le corpus de références internes : aucune tarification ne change le fait que vous ne pouvez pas faire tenir 300 mémoires techniques passés, avec leur diversité de formats et leur besoin de mise à jour continue, dans une fenêtre de contexte figée au moment de l'appel.
La troisième limite, et désormais la plus structurante depuis que l'argument du prix a disparu, est la latence et la fraîcheur. Générer une réponse à partir d'un prompt de plusieurs centaines de milliers de tokens prend encore plusieurs dizaines de secondes, parfois plus d'une minute. Ce n'est pas bloquant pour un usage asynchrone, l'expert relance l'analyse et travaille sur autre chose en attendant, mais cela devient un problème si vous voulez des retours quasi temps réel dans votre interface, ou si votre base de références évolue en continu et qu'il faut la refaire tenir intégralement dans le contexte à chaque appel.
Quand le long context seul est suffisant
Il fonctionne bien dans deux cas précis : quand votre entreprise répond à des AOs très standardisés (même type de marché, même structure de dossier) et que la majeure partie du contenu est produite par l'expert plutôt que récupérée dans un historique. Et quand vous êtes en phase de POC avec peu de réponses historiques disponibles, le long context vous permet de démarrer rapidement sans avoir à construire une base vectorielle.
Le verrou de capacité qui limitait cette approche aux CDC de moins de 80 pages a largement sauté avec le passage à 1 million de tokens au tarif standard : la vraie limite aujourd'hui n'est plus la taille du CDC, mais le nombre de fois où vous devez refaire tenir l'intégralité de votre historique de références dans le contexte à chaque nouvel AO, ce que seul le RAG résout durablement.
Approche 2 : le RAG sur la base de références internes
Le RAG résout le problème du corpus historique
Quand votre base de références dépasse une cinquantaine de documents, le RAG devient indispensable. Le principe : chaque réponse gagnante passée, chaque fiche projet, chaque CV et chaque certif est découpée en chunks sémantiques, encodée en vecteurs et indexée dans un vector store (Qdrant, Weaviate ou Chroma selon votre stack).
Quand l'agent travaille sur un nouvel AO, il extrait les mots-clés des exigences du CDC, interroge la base vectorielle et récupère les passages les plus pertinents de votre historique. Il construit ensuite le draft de chaque section à partir de ce contenu, adapté au contexte du nouveau marché.
C'est ce que nous déployons chez les bureaux d'études et les ESN qui répondent à des volumes importants d'AOs avec une base de références riche. Le taux de réutilisation des sections remontées par le RAG se situe entre 70 et 85 % quand la base est homogène et bien structurée.
Les limites du RAG qu'il faut anticiper
La première limite est la plus critique en contexte AO : le risque d'hallucination de références. Si le chunk récupéré mentionne un chiffre de projet (budget, nombre d'utilisateurs, durée de mission) et que le modèle le réutilise en le déformant légèrement pour qu'il colle mieux au nouveau contexte, vous vous retrouvez avec une référence erronée dans votre mémoire technique. Dans un AO public où les références peuvent être vérifiées par le pouvoir adjudicateur, c'est un risque d'élimination. Le RAG doit être configuré en mode strictement sourcé : l'agent cite les extraits exacts, il ne les paraphrase pas librement sur les données factuelles.
La deuxième limite est la qualité du chunking. Un CCTP de 80 pages découpé en chunks de 512 tokens sans tenir compte de la structure logique du document va produire des chunks qui coupent des tableaux en deux, séparent une exigence de sa pondération, ou mélangent deux corps de métier dans le même fragment. La phase de préparation des données, parsing PDF, découpage sémantique, enrichissement par métadonnées, représente souvent 40 % de l'effort total du projet.
La troisième limite : le RAG ne résout pas l'analyse du CDC courant. Vous ne pouvez pas indexer à l'avance un CDC que vous n'avez pas encore reçu. Pour l'analyse des exigences du nouveau marché, vous avez besoin d'une autre stratégie, c'est là que le long context entre en jeu.
Ce que doit contenir la base de références pour que ça marche
Une base RAG efficace pour les AOs est structurée autour de trois types de documents :
- Fiches projets livrés (une fiche d'une à deux pages par projet) : contexte client, mission réalisée, résultats mesurables, technologies ou méthodes utilisées, durée, budget. C'est le contenu que le modèle va adapter pour rédiger les sections "Références similaires" de vos réponses.
- Sections méthodologiques validées : approche projet, organisation de la mission, livrables types, planning type, par type de marché. Ces sections sont les plus stables et les plus récupérables d'un AO à l'autre.
- Profils et CVs équipe structurés : compétences, expériences passées par secteur, certifications. Indispensables pour les sections "Équipe proposée" des mémoires techniques ESN et bureaux d'études.
La règle d'or : si votre équipe n'a pas formalisé cette base avant de démarrer le projet IA, la constitution de la base documentaire sera le vrai projet, le développement technique en sera le prolongement.
Approche 3 : l'architecture hybride recommandée en production
Le principe : deux corpus, deux stratégies
L'architecture que nous recommandons pour les structures répondant à plus de 20 AOs par an combine les deux approches en les appliquant à leur corpus naturel :
- Long context sur le CDC entrant : le dossier de consultation du nouvel AO est chargé en intégralité dans la fenêtre de contexte de Claude, désormais 1 million de tokens au tarif standard, ce qui couvre la quasi-totalité des DCE y compris les dossiers multi-lots volumineux. L'agent extrait les exigences, les critères de notation et leur pondération, les contraintes de format et les points différenciants à adresser. Zéro perte d'information sur le CDC qui décide de votre qualification ou de votre élimination.
- RAG sur la base de références internes : pour chaque section de la réponse à construire, l'agent interroge la base vectorielle et remonte les passages les plus pertinents de l'historique. Il adapte ce contenu au contexte du nouveau marché sans repartir de zéro.
Les deux résultats sont combinés dans le prompt de génération de chaque section : l'agent dispose à la fois des exigences précises du CDC courant et du contenu de référence pertinent de votre historique. C'est le pattern "context engineering" : donner au modèle exactement l'information dont il a besoin au bon moment, ni plus ni moins.
Le flux de traitement complet
Voici comment ce flux se matérialise en pratique, dans une stack LangGraph ou n8n :
- Ingestion du DCE : parsing des fichiers PDF et DOCX via PyMuPDF ou Azure Document Intelligence, extraction du texte structuré.
- Analyse CDC en long context : envoi du DCE complet à Claude avec un prompt d'extraction structuré (exigences obligatoires, critères de notation, pondérations, format attendu, délai de remise). Sortie : un JSON structuré des exigences.
- Décomposition en sections : l'agent planifie les sections de la réponse à partir de la structure du CDC et des exigences extraites.
- RAG par section : pour chaque section, requête sémantique sur la base vectorielle interne. Filtrage par métadonnées (type de marché, secteur, taille similaire). Récupération des 3 à 5 chunks les plus pertinents avec leur score de pertinence.
- Génération de chaque section : prompt combinant les exigences de la section (du CDC), les passages de l'historique (du RAG) et les contraintes de format. Le modèle produit un draft sourcé.
- Checklist de conformité : vérification automatique que chaque exigence obligatoire du CDC est adressée dans le draft.
- Export et soumission à l'expert : génération du DOCX via python-docx ou Google Docs API, notification avec le draft et la checklist.
La grille de décision par volumétrie
Voici la grille que nous utilisons en première session client pour orienter l'architecture :
| Situation | Architecture recommandée | Stack de référence |
|---|---|---|
| CDC de taille courante (jusqu'à plusieurs centaines de pages), base de références < 30 docs | Long context seul | Claude Sonnet 5 + Make / n8n |
| Base de références 30 à 300 docs, quelle que soit la taille du CDC | Hybride (recommandé) | Claude + Qdrant + LangGraph ou n8n |
| DCE multi-lots avec traçabilité par lot exigée, ou CDC très structuré (tableaux complexes, renvois croisés nombreux) | RAG sur CDC + RAG sur base | LangGraph + Qdrant + chunking sémantique |
| Confidentialité maximale (OIV, défense, NDA strict) | Hybride on-premise | Mistral Large ou Medium 3.5 (Ollama/vLLM) + Qdrant on-premise |
| Base > 300 docs, multi-secteurs | RAG avec filtrage métadonnées | Qdrant ou Weaviate + filtres secteur/taille |
Le choix du LLM selon votre contexte
Claude Sonnet 5 (ou Opus 5) pour le long context et la qualité rédactionnelle
Pour les sections qui nécessitent une qualité rédactionnelle élevée, méthodologie, présentation de l'approche projet, argumentation sur les critères qualitatifs, Claude Sonnet 5 reste le modèle de référence pour la majorité des dossiers, Claude Opus 5 étant réservé aux CDC les plus complexes ou aux marchés à enjeu stratégique. Sa fenêtre de contexte d'un million de tokens, en disponibilité générale au tarif standard depuis mars 2026, couvre la quasi-totalité des CDCs rencontrés en marchés publics français, y compris les DCE multi-lots les plus volumineux. Il gère bien les instructions longues et les contraintes de format complexes.
La limite : c'est un modèle cloud. Tout document que vous lui envoyez transite par les serveurs Anthropic. Pour la plupart des bureaux d'études et des PME BTP répondant à des marchés publics classiques, ce n'est pas un problème. Pour les ESN ayant des NDA stricts avec leurs clients grands comptes, ou les structures travaillant sur des marchés de défense ou d'OIV, c'est rédhibitoire.
Mistral on-premise pour la confidentialité
Mistral Large, ou depuis le 29 avril 2026 Mistral Medium 3.5, déployés en local via Ollama (pour les petits volumes) ou vLLM sur GPU (pour la production), offrent une qualité rédactionnelle suffisante pour les sections standard des mémoires techniques. Mistral Medium 3.5 est un modèle dense de 128 milliards de paramètres, diffusé en poids ouverts sous licence MIT modifiée et annoncé exécutable sur seulement 4 GPU, avec une fenêtre de contexte portée à 256 000 tokens. Aucun document ne sort de votre infrastructure.
Le coût d'infrastructure est à intégrer au TCO : un GPU A100 ou H100 en location cloud coûte entre 2 et 4 € de l'heure. Pour un usage intermittent (pas de traitement en temps réel), une instance à la demande peut rester économique. Pour un usage intensif, le calcul doit être fait au cas par cas.
GPT-4o est une troisième option viable, avec une fenêtre de 128 000 tokens et une qualité comparable à Claude sur les sections courtes. Il s'impose naturellement si votre stack est déjà intégrée dans l'écosystème Microsoft Azure (Azure OpenAI Service, SharePoint, Teams).
Intégrations : Batigest, Onaya, HubSpot, n8n
L'agent ne vit pas en isolation. Les structures qui en tirent le plus de valeur sont celles qui l'intègrent dans leurs outils métiers existants plutôt que de le faire fonctionner comme un outil parallèle que personne n'utilise.
Pour les PME BTP et artisans sur Batigest ou Onaya : l'agent peut lire les éléments de chiffrage existants (BPU, prix unitaires) pour pré-remplir la DPGF et générer le mémoire technique en cohérence avec l'offre financière. L'intégration passe par l'export CSV ou Excel de ces ERPs, il n'existe pas d'API native dans ces outils.
Pour les ESN et cabinets de conseil sur HubSpot ou Salesforce : l'agent peut alimenter les opportunités CRM (création automatique de la fiche AO, attachement du draft généré, suivi du statut) et récupérer dans le CRM les informations sur les contacts existants dans l'organisation acheteuse, un contexte précieux pour personnaliser l'introduction du mémoire technique.
Pour l'orchestration : n8n reste la stack de référence pour les structures qui veulent un système de workflow visuel, auto-hébergeable et intégrable à leurs outils sans développement backend lourd. LangGraph s'impose quand vous avez besoin d'un état persistant complexe (plusieurs passes d'analyse, boucle d'affinement des sections, gestion d'erreurs granulaire). Make est une alternative à n8n si votre équipe est à l'aise avec les outils no-code et que le volume d'AOs traités reste sous 10 par mois.
La base de références internes : le vrai projet, pas l'IA
C'est le point sur lequel tous nos projets AO butent à un moment ou à un autre, et sur lequel nous insistons systématiquement en phase de cadrage.
L'agent est aussi bon que la base dans laquelle il puise. Si vos références projets ne sont pas formalisées, si les mémoires techniques gagnés sont des DOCX éparpillés dans des dossiers réseau sans structure, si les fiches projets font 20 pages de rapport au lieu d'une fiche d'une page par projet, si les CVs équipe n'ont pas été mis à jour depuis 18 mois, alors le RAG va remonter des contenus inutilisables.
La conséquence la plus fréquente : le modèle comble les lacunes par de la génération libre. Il invente des chiffres plausibles pour les références manquantes, déforme les résultats pour les adapter au contexte du nouveau marché, ou amalgame deux projets distincts pour en construire un qui n'a jamais existé. En AO public, ces références peuvent être vérifiées. C'est un risque d'élimination, voire de sanction.
La bonne approche : avant de démarrer le développement de l'agent, commencer par un atelier de structuration de la base de références. Définir le format de fiche projet standard (contexte, mission, livrables, résultats, équipe, budget, durée, technologies). Demander à chaque chef de projet de remplir rétrospectivement les 10 à 15 derniers projets livrés. Ce travail prend 2 à 4 semaines mais c'est lui qui déterminera la qualité de l'agent, pas le choix entre Claude et Mistral.
Coûts et délais : POC, MVP, TCO annuel
Les repères ci-dessous sont basés sur les projets que nous avons livrés ou cadrés en 2025-2026 pour des bureaux d'études, des ESN et des PME BTP entre 20 et 200 salariés, sur devis selon le périmètre :
POC
6 à 8 semaines
Analyse CDC en long context, RAG sur base de 30 à 80 références, génération de 3 à 4 sections clés, checklist de conformité basique. Pas de veille AO automatisée.
MVP production
3 mois
Base de références complète avec pipeline d'ingestion, génération réponse toutes sections, architecture hybride long context + RAG, intégration CRM ou ERP, dashboard de suivi.
TCO annuel
Sur devis
Dont LLM API 3 000-8 000 €, hébergement vector store 1 000-3 000 €, veille AO agrégateur 2 000-6 000 €, maintenance et évolutions selon le forfait, monitoring.
Ce qui rallonge le planning de façon systématique : la constitution de la base de références (fiches projets non formalisées, réponses gagnantes éparpillées), la calibration de la qualité rédactionnelle (plusieurs itérations sur des AOs de référence pour affiner les prompts), et l'intégration avec les APIs de veille AO qui sont parfois mal documentées ou instables.
Les quatre pièges qui coûtent le plus cher
Piège 1 : lancer le développement avant d'avoir la base de références
Sans base structurée, le POC va "fonctionner" sur les 5 ou 10 AOs de test que vous lui fournissez manuellement, et s'effondrer le jour où vous essayez de le passer à l'échelle sur votre vrai historique. Construisez la base en parallèle du développement, pas après.
Piège 2 : ne pas configurer le RAG en mode strictement sourcé
La configuration par défaut de la plupart des frameworks RAG autorise le modèle à "compléter" l'information manquante par de la génération libre. En contexte AO, c'est inacceptable sur les données factuelles (chiffres de références, durées, budgets, effectifs). Configurez explicitement le système prompt pour que le modèle cite les extraits exacts et indique "information non disponible dans la base" quand il ne trouve pas, plutôt que d'inventer.
Piège 3 : sous-estimer le temps de validation humaine
Les équipes qui espèrent diviser le temps de réponse AO par 5 sont souvent déçues. Le gain réaliste est de 40 à 60 % du temps de rédaction. Le draft réduit l'effort mais ne l'élimine pas : l'expert doit valider, affiner et signer intellectuellement chaque réponse. Un draft de mauvaise qualité crée plus de travail de correction qu'il n'en économise. Communiquez ce cadre dès la phase de cadrage pour éviter les désillusions.
Piège 4 : choisir le modèle le moins cher pour les sections techniques
Les sections de méthodologie, d'organisation de la mission et de différenciation technique sont celles qui font la différence entre un AO gagné et un AO perdu. Ce n'est pas le bon endroit pour économiser sur le modèle. Un draft de section méthodologique produit par un modèle de faible qualité nécessite autant de temps de correction qu'une rédaction manuelle. Réservez les modèles légers aux tâches d'extraction et de classification ; utilisez Claude Sonnet ou GPT-4o pour la génération des sections à valeur ajoutée.
Garde-fous indispensables avant toute mise en production
Trois règles non négociables avant de passer ce type d'agent en production chez un client :
- Relecture humaine obligatoire sur toutes les données factuelles : références projets, chiffres, dates, noms de clients, résultats. Aucune donnée factuelle ne doit sortir sans validation de l'expert. Le draft est un point de départ, pas une sortie finale.
- Citation systématique des sources dans le draft : chaque section du draft doit mentionner les références internes dont elle est issue. Cela permet à l'expert de vérifier la pertinence du matching et de corriger rapidement si le RAG a remonté une référence hors sujet.
- Feedback loop sur les résultats AO : tracker systematiquement si les AOs où le draft agent a été utilisé ont été gagnés ou perdus, et pourquoi. C'est le seul moyen de mesurer l'impact réel et d'identifier les sections où le prompt ou le RAG nécessitent des ajustements.
Si vous avez des exigences de confidentialité fortes, marchés de défense, clients OIV, clauses NDA strictes sur vos références projets, lisez notre article sur les architectures IA compatibles avec les contraintes de confidentialité en entreprise avant de choisir votre stack.
Ce qui a changé récemment
Le marché évolue vite. Voici les évolutions qui modifient concrètement l'arbitrage entre contexte long et RAG depuis la première version de cet article.
Anthropic, mars 2026
La fenêtre de 1 million de tokens passe en disponibilité générale, au tarif standard
Depuis le 13 mars 2026, la fenêtre de contexte de 1 million de tokens de Claude Opus 4.6 et Sonnet 4.6 est en disponibilité générale au tarif standard. La surfacturation "long contexte" qui s'appliquait auparavant au-delà de 200 000 tokens a été supprimée, et la limite par requête est passée de 100 à 600 images ou pages de PDF.
Ce que ça change pour vous : un CCTP, un CCAP et une DPGF de plusieurs centaines de pages tiennent désormais dans une seule requête sans surcoût lié à la taille. Le choix entre contexte long et RAG ne se joue plus sur le prix, mais sur le volume et le rythme d'évolution de votre base de références internes, la latence acceptable et la traçabilité des sources citées.
Mistral AI, avril 2026
Mistral Medium 3.5, un modèle ouvert pensé pour l'auto-hébergement
Mistral a annoncé Mistral Medium 3.5 le 29 avril 2026 : un modèle dense de 128 milliards de paramètres, avec une fenêtre de contexte allant jusqu'à 256 000 tokens, diffusé en poids ouverts sous licence MIT modifiée et annoncé exécutable sur seulement 4 GPU.
Ce que ça change pour vous : pour les bureaux d'études et ESN sous NDA stricts, ou sur des marchés OIV et défense, c'est une alternative crédible à un déploiement cloud quand la confidentialité impose l'auto-hébergement, avec un TCO GPU à raisonner sur le volume d'AOs traités plutôt qu'à l'unité.
Voyage AI et Cohere, janvier 2026
Une nouvelle génération de modèles d'embedding
Voyage AI a lancé la famille Voyage 4 en janvier 2026, dont Voyage 4 Large introduit une architecture de mélange d'experts inédite pour un modèle d'embedding en production, et Cohere a lancé Embed v4, premier modèle d'embedding multimodal capable de vectoriser texte, images et documents mixtes.
Ce que ça change pour vous : la qualité de la recherche sémantique sur votre base de mémoires techniques progresse indépendamment du choix du LLM générateur. Si votre RAG déçoit, vérifiez d'abord la génération du modèle d'embedding utilisé avant de remettre en cause l'approche elle même.
Écosystème RAGAS et outils dérivés, 2026
Les frameworks d'évaluation RAG ont mûri
L'évaluation des systèmes RAG s'est structurée autour de RAGAS (faithfulness, context precision, context recall, answer relevance) comme référence open source, complétée par des outils comme DeepEval pour l'intégration en CI/CD et Patronus ou Langfuse pour la détection d'hallucinations et le traçage en production.
Ce que ça change pour vous : vous pouvez désormais mesurer objectivement si votre RAG omet ou déforme des références avant la mise en production, plutôt que de le découvrir sur un AO réel où l'erreur peut coûter la qualification du dossier.
Journal officiel, décembre 2025
Relèvement des seuils de dématérialisation des marchés publics
Les décrets n° 2025-1386 et n° 2025-1383, publiés au Journal officiel le 30 décembre 2025, relèvent le seuil de dispense de publicité et de mise en concurrence à 100 000 euros HT pour les travaux depuis le 1er janvier 2026, et à 60 000 euros HT pour les fournitures et services depuis le 1er avril 2026, contre 40 000 euros HT auparavant.
Ce que ça change pour vous : une partie des petits marchés sort du formalisme de la dématérialisation obligatoire, ce qui réduit le volume de DCE structurés à traiter pour les plus petites structures, mais concentre l'enjeu sur des dossiers plus gros et plus complexes, exactement ceux où l'architecture hybride long contexte et RAG apporte le plus de valeur.
Pour aller plus loin
- Agent IA n8n pour répondre aux appels d'offres : workflow complet, l'orchestration pas à pas depuis l'ingestion du DCE jusqu'à l'export DOCX
- ROI et heures gagnées : ce que l'IA apporte vraiment sur les AOs en 2026, chiffres et retours terrain sur les gains mesurés
- Analyse IA d'un DCE pour bureau d'études : méthode et outils, extraction d'exigences, CCTP et DPGF
- Extraire automatiquement les données d'un CCTP et d'une DPGF avec l'IA, parsing PDF et structuration des données
- Guide technique sur les embeddings et la recherche sémantique, les fondations du RAG expliquées pour les non-spécialistes
- RAG pour la documentation technique en industrie, le même pattern appliqué à la maintenance et à la formation opérateurs
- Agence IA Toulouse, la page hub pour les bureaux d'études et industriels d'Occitanie qui veulent confier le build et la mise en prod à un partenaire local