Outils & Modèles Par

IA locale en entreprise : options, modèles et limites

L'IA locale consiste à faire tourner un modèle de langage sur une infrastructure que l'entreprise contrôle : serveur dans ses murs, serveur chez un hébergeur français ou simple poste de travail. Les documents et les questions ne partent chez aucun éditeur étranger.

C'est la réponse naturelle quand un secret industriel, un plan client ou une donnée réglementée ne doit pas sortir. Le coût de ce choix : un modèle ouvert un peu moins capable que les meilleurs modèles propriétaires, du matériel à dimensionner et une exploitation à assurer. Voici les trois options, les modèles utilisables, ce qu'on gagne et ce qu'on perd, et les cas d'usage qui valent l'effort.

En résumé

  • ✓ Trois façons de faire de l'IA locale : serveur sur site (on premise), cloud souverain français, poste de travail isolé.
  • ✓ Les modèles ouverts (Mistral, Llama, Qwen, Gemma) couvrent résumé, extraction, questions sur documents. Le raisonnement très complexe reste l'atout des modèles propriétaires.
  • ✓ Le matériel se dimensionne par la mémoire graphique : environ 6 à 8 Go pour un modèle de 7 milliards de paramètres, 40 Go et plus pour 70 milliards.
  • ✓ L'exploitation est le vrai coût caché : mises à jour, supervision, sécurité, évaluation.
  • ✓ On commence par un cas d'usage borné et un test sur vos documents, pas par un achat de serveur.

IA locale en entreprise : de quoi parle-t-on ?

Une IA locale est un modèle dont les poids sont téléchargés et exécutés sur une machine que vous choisissez. Le prompt, le document analysé et la réponse restent dans ce périmètre. Il n'y a pas d'appel vers l'API d'un éditeur américain, donc pas de donnée exposée à un sous-traitant ultérieur ni au droit d'un pays tiers.

Cela repose sur les modèles open weights, que nous comparons en détail dans notre comparatif des LLM open source pour l'entreprise. Ce ne sont pas des logiciels libres au sens strict : les licences varient, et c'est un point à vérifier avant un usage commercial.

Le terme recouvre en réalité trois niveaux de maîtrise très différents, qu'il faut distinguer avant de parler de matériel ou de modèle.

IA on premise, cloud souverain ou poste local : quelle option choisir ?

Le bon choix dépend de la sensibilité de la donnée, du nombre d'utilisateurs et de la compétence d'exploitation disponible en interne. Voici la grille que nous utilisons pour cadrer un projet.

OptionOù tourne le modèlePour quiLimite principale
Serveur sur site (on premise)Dans vos locaux ou votre datacenterSecret industriel, clause client, réseau isoléInvestissement matériel et exploitation à votre charge
Cloud souverain françaisChez un hébergeur français, idéalement qualifié SecNumCloudDonnées sensibles, équipe sans salle serveurDépendance à l'hébergeur, contrat à lire de près
Poste localSur l'ordinateur d'un utilisateurUsage individuel, prototype, mode hors ligneModèles limités, pas de partage, parc à gérer

IA on premise : quand la donnée ne doit pas quitter le site

L'IA on premise place le serveur d'inférence dans vos locaux ou dans un datacenter que vous gérez. C'est la seule option qui garantit que rien ne sort, y compris pour un réseau coupé d'Internet. Elle s'impose quand une clause contractuelle ou une réglementation l'exige, comme chez les sous-traitants aéronautiques dont nous détaillons le cadre dans notre retour sur le déploiement d'une IA on premise sécurisée.

Contrepartie : vous achetez le matériel, vous le sécurisez, vous le maintenez. À réserver aux cas où l'enjeu le justifie.

IA hébergée en France : le cloud souverain

Une IA hébergée en France tourne sur les serveurs d'un prestataire français. La qualification SecNumCloud de l'ANSSI atteste d'un niveau de sécurité et d'une protection contre les lois extraterritoriales (ANSSI, cyber.gouv.fr). Pour beaucoup de PME et d'ETI industrielles, c'est le meilleur compromis : pas de salle serveur à gérer, des données qui restent sous droit français.

Lisez le contrat avec méthode : lieu de traitement des prompts, absence de réutilisation pour l'entraînement, journalisation, qui peut accéder aux machines. Le sujet est le même que pour Microsoft Copilot face à une IA souveraine française : la localisation du centre de données ne règle pas tout, la nationalité du fournisseur et le contrat comptent autant.

IA sans cloud : le poste local

Une IA sans cloud sur un poste est possible avec des outils comme Ollama ou llama.cpp, qui exécutent un modèle quantifié sur un ordinateur portable ou un Mac à mémoire unifiée. C'est pratique pour un ingénieur qui traite des documents confidentiels hors ligne, ou pour tester un modèle avant un projet.

Ce n'est pas une solution d'équipe : pas de partage des documents, pas de gestion centralisée des droits, des modèles plus petits. Pour un usage collectif, un serveur reste préférable.

LLM local en entreprise : quels modèles ouverts utiliser ?

Pour un LLM local en entreprise, quatre familles dominent en 2026. Le choix se fait sur la langue, la licence et la taille compatible avec votre matériel. Pour la définition d'un modèle de langage et ses limites, voir notre page sur le LLM.

  • Mistral (Mistral Small, Ministral) : le plus à l'aise en français, plusieurs modèles sous licence permissive. Notre guide des petits modèles Mistral détaille les tailles.
  • Llama (Meta) : très répandu, bon niveau multilingue, licence communautaire avec conditions à lire.
  • Qwen (Alibaba) : bons résultats en code et en extraction, plusieurs tailles. À valider selon votre politique sur l'origine des modèles.
  • Gemma (Google) : modèles compacts adaptés aux petites machines, licence propre à Google.

Nous reprenons licences, tailles et limites de chaque famille dans le comparatif des LLM open source. Notre conseil pour démarrer : un modèle de 7 à 24 milliards de paramètres, testé sur 30 à 50 vrais documents, avant de monter en taille.

Ce choix de modèle s'accompagne presque toujours d'un système de recherche sur vos documents : c'est le principe du RAG, qui évite de réentraîner quoi que ce soit. Nous décrivons une architecture complète dans notre article sur le RAG souverain avec Mistral.

IA locale : ce que l'on gagne et ce que l'on perd en qualité

Un modèle local n'est pas une version dégradée de ChatGPT, mais ce n'est pas non plus son équivalent sur tout. L'écart dépend de la tâche, et c'est sur vos documents qu'il se mesure.

CritèreIA locale (modèle ouvert)IA cloud propriétaire
ConfidentialitéMaîtrise complète du périmètreDépend du contrat et de l'éditeur
Résumé, extraction, classificationTrès bon avec un modèle de taille moyenneTrès bon
Raisonnement complexe, longs contextesÉcart réel, croissant avec la difficultéAvance des meilleurs modèles
Multimodal (images, voix)Plus limité, selon les modèlesPlus complet
Mises à jour du modèleÀ planifier vous-mêmeAutomatiques, parfois sans préavis
CoûtMatériel et exploitation, puis usage sans facturation au volumeAbonnement ou paiement au volume
DisponibilitéIndépendante d'un service externeDépend du service et de l'accès réseau

Le gain décisif est la maîtrise : vous décidez où va la donnée, quand le modèle change et qui y accède. La perte est une marge de qualité sur les tâches les plus exigeantes. Pour décider, comparez un modèle local et un service cloud sur les mêmes 30 documents, notés par ceux qui utiliseront l'outil. Le résultat tranche mieux qu'un classement public.

À retenir

Pour un secret industriel, un écart de qualité modeste sur certaines tâches est souvent préférable à un transfert de données non maîtrisé. Mais l'inverse existe : si la donnée n'est pas sensible, un modèle cloud sera plus simple et plus performant. L'IA locale se justifie par la donnée, pas par la mode.

Notre analyse comparée pour les sous-traitants du secteur est dans IA souveraine ou ChatGPT chez les sous-traitants aéronautiques.

Quel matériel pour faire tourner un LLM en local en entreprise ?

Pour faire tourner un LLM en local en entreprise, la contrainte n°1 est la mémoire du GPU (VRAM). Le modèle doit y tenir, avec de la marge pour le contexte et les utilisateurs simultanés. La quantification, qui réduit la précision des poids (par exemple en 4 bits), divise l'encombrement pour une perte de qualité souvent modeste.

Ordres de grandeur pour un modèle quantifié en 4 bits, hors contexte long (valeurs approximatives, à confirmer par un test sur votre machine) :

Taille du modèleMémoire nécessaireType de machineUsage typique
7 à 8 milliards6 à 8 GoPoste avec GPU grand public, Mac récentRésumé, classification, tests
Environ 24 milliards16 à 24 GoServeur avec un GPU de 24 GoAssistant sur documents, extraction
Environ 70 milliards40 à 48 Go et plusServeur avec un ou plusieurs GPU professionnelsTâches plus exigeantes, plusieurs équipes

Nous ne donnons pas de prix : ils bougent vite selon la disponibilité des GPU. Demandez un devis fournisseur sur la configuration cible, ou louez d'abord des GPU chez un hébergeur français pour valider le dimensionnement avant d'acheter. Les serveurs d'inférence (vLLM, llama.cpp, Ollama) et leurs compromis sont décrits dans notre comparatif des serveurs d'inférence open source.

Exploitation, mises à jour et cas d'usage adaptés

Le matériel n'est que le début. Une IA locale devient un service que quelqu'un doit faire vivre.

Ce que l'exploitation implique vraiment

  • Mises à jour des modèles : un nouveau modèle sort tous les quelques mois. Décidez quand migrer, et re-testez sur vos documents avant de basculer.
  • Supervision : disponibilité, charge GPU, temps de réponse, journaux d'usage.
  • Sécurité : authentification, cloisonnement des droits d'accès aux documents, sauvegardes, correctifs du serveur et des bibliothèques.
  • Évaluation continue : un jeu de questions de référence rejoué après chaque changement pour détecter une régression.

Si l'entreprise n'a pas d'équipe pour cela, un cloud souverain ou une exploitation déléguée est souvent plus réaliste qu'un serveur sur site. Notre checklist sécurité des données IA pour PME aide à cadrer ces points. Pour le détail technique de l'installation, voir l'article sur l'IA locale et les petits modèles du blog technique d'Anas.

Les cas d'usage qui justifient une IA locale

  • Interrogation de la documentation technique (cahiers des charges, procédures, retours d'expérience) sans exposer de propriété intellectuelle.
  • Analyse de contrats et de pièces clients soumis à clause de confidentialité.
  • Extraction et classement de documents (bons de livraison, certificats, rapports de contrôle).
  • Aide à la rédaction de réponses techniques à partir de l'historique de l'entreprise.

À l'inverse, un besoin de raisonnement très complexe, de veille web ou de multimodal avancé se traite mal en local : mieux vaut un service cloud pour les données non sensibles et du local pour le reste. Les gains de temps dépendent du volume de documents et de la qualité de votre base, ils se mesurent sur un pilote, pas sur une promesse.

Quelle option pour vos données sensibles ?

Nous cadrons le périmètre (site, cloud souverain ou poste), le modèle ouvert adapté et un test sur vos propres documents avant tout achat de matériel.

Questions fréquentes sur l'IA locale en entreprise

L'IA locale désigne un modèle de langage qui tourne sur une infrastructure que l'entreprise maîtrise : serveur dans ses locaux, serveur chez un hébergeur français ou poste de travail. Les prompts et les documents ne partent chez aucun éditeur américain. On utilise pour cela des modèles ouverts (Mistral, Llama, Qwen, Gemma) dont on télécharge les poids.
Il faut trois briques : un modèle ouvert adapté à la tâche, un serveur d'inférence (vLLM en production, Ollama ou llama.cpp pour tester) et une machine avec assez de mémoire graphique. Ensuite viennent l'authentification, la journalisation et la connexion aux documents de l'entreprise. Le plus long n'est pas l'installation, c'est le cadrage des usages et l'évaluation sur vos propres documents.
Non, pas toujours. Un cloud souverain français, avec un hébergeur qualifié SecNumCloud et un contrat qui exclut tout accès de droit étranger, répond à beaucoup de cas. L'on premise devient nécessaire quand la donnée ne doit pas quitter le site, par exemple un plan soumis à une clause client ou à une réglementation de défense.
Oui. Un modèle ouvert peut tourner sur un serveur ou un poste sans aucune connexion à Internet, une fois les poids téléchargés. C'est la configuration d'un réseau isolé. Le prix à payer : les mises à jour de modèle se font à la main, par transfert contrôlé, et la recherche web est exclue.
Deux voies : un hébergeur cloud français (idéalement qualifié SecNumCloud par l'ANSSI) sur lequel on déploie un modèle ouvert, ou une API d'un éditeur européen dont l'hébergement est localisé en France. Dans les deux cas, vérifiez par contrat où sont traités les prompts, si les données servent à l'entraînement et qui peut y accéder.
Sur les tâches ciblées (résumé, extraction, classification, questions sur vos documents), un bon modèle ouvert de taille moyenne s'en approche souvent. Sur le raisonnement très complexe, les longs contextes et le multimodal, les modèles propriétaires gardent de l'avance. Le bon test consiste à comparer les deux sur vos propres documents, pas sur un classement public.
Cela dépend de la taille du modèle et du nombre d'utilisateurs simultanés. Un modèle de 7 à 8 milliards de paramètres quantifié tient sur un GPU de 8 à 12 Go de mémoire. Un modèle d'environ 24 milliards demande 16 à 24 Go. Un modèle de 70 milliards demande souvent 40 à 48 Go, donc un ou plusieurs GPU professionnels. Chiffrez le matériel avec un devis fournisseur, les prix varient vite.

Pour aller plus loin

Sources

IA souveraine

Des données qui ne doivent pas quitter votre périmètre ?

Nous cadrons avec vous l'architecture (site, cloud souverain ou poste), le modèle ouvert adapté et l'évaluation sur vos propres documents, avant tout achat de matériel.

Anas Rabhi, ingénieur IA et data scientist, fondateur de Tensoria
Anas R. Ingénieur IA, fondateur de Tensoria ianas.fr

Je suis ingénieur IA et data scientist, fondateur de Tensoria. Depuis plus de 6 ans, j'accompagne les entreprises dans l'exploitation concrète de l'IA pour leur métier : assistants internes basés sur RAG, agents IA en production, automatisations sur mesure, traitement intelligent de documents. J'interviens du cadrage initial à la mise en production, sur stacks LLM modernes (Mistral, Claude, GPT) et infrastructures souveraines quand la confidentialité l'exige.