L'IA locale consiste à faire tourner un modèle de langage sur une infrastructure que l'entreprise contrôle : serveur dans ses murs, serveur chez un hébergeur français ou simple poste de travail. Les documents et les questions ne partent chez aucun éditeur étranger.
C'est la réponse naturelle quand un secret industriel, un plan client ou une donnée réglementée ne doit pas sortir. Le coût de ce choix : un modèle ouvert un peu moins capable que les meilleurs modèles propriétaires, du matériel à dimensionner et une exploitation à assurer. Voici les trois options, les modèles utilisables, ce qu'on gagne et ce qu'on perd, et les cas d'usage qui valent l'effort.
En résumé
- ✓ Trois façons de faire de l'IA locale : serveur sur site (on premise), cloud souverain français, poste de travail isolé.
- ✓ Les modèles ouverts (Mistral, Llama, Qwen, Gemma) couvrent résumé, extraction, questions sur documents. Le raisonnement très complexe reste l'atout des modèles propriétaires.
- ✓ Le matériel se dimensionne par la mémoire graphique : environ 6 à 8 Go pour un modèle de 7 milliards de paramètres, 40 Go et plus pour 70 milliards.
- ✓ L'exploitation est le vrai coût caché : mises à jour, supervision, sécurité, évaluation.
- ✓ On commence par un cas d'usage borné et un test sur vos documents, pas par un achat de serveur.
IA locale en entreprise : de quoi parle-t-on ?
Une IA locale est un modèle dont les poids sont téléchargés et exécutés sur une machine que vous choisissez. Le prompt, le document analysé et la réponse restent dans ce périmètre. Il n'y a pas d'appel vers l'API d'un éditeur américain, donc pas de donnée exposée à un sous-traitant ultérieur ni au droit d'un pays tiers.
Cela repose sur les modèles open weights, que nous comparons en détail dans notre comparatif des LLM open source pour l'entreprise. Ce ne sont pas des logiciels libres au sens strict : les licences varient, et c'est un point à vérifier avant un usage commercial.
Le terme recouvre en réalité trois niveaux de maîtrise très différents, qu'il faut distinguer avant de parler de matériel ou de modèle.
IA on premise, cloud souverain ou poste local : quelle option choisir ?
Le bon choix dépend de la sensibilité de la donnée, du nombre d'utilisateurs et de la compétence d'exploitation disponible en interne. Voici la grille que nous utilisons pour cadrer un projet.
| Option | Où tourne le modèle | Pour qui | Limite principale |
|---|---|---|---|
| Serveur sur site (on premise) | Dans vos locaux ou votre datacenter | Secret industriel, clause client, réseau isolé | Investissement matériel et exploitation à votre charge |
| Cloud souverain français | Chez un hébergeur français, idéalement qualifié SecNumCloud | Données sensibles, équipe sans salle serveur | Dépendance à l'hébergeur, contrat à lire de près |
| Poste local | Sur l'ordinateur d'un utilisateur | Usage individuel, prototype, mode hors ligne | Modèles limités, pas de partage, parc à gérer |
IA on premise : quand la donnée ne doit pas quitter le site
L'IA on premise place le serveur d'inférence dans vos locaux ou dans un datacenter que vous gérez. C'est la seule option qui garantit que rien ne sort, y compris pour un réseau coupé d'Internet. Elle s'impose quand une clause contractuelle ou une réglementation l'exige, comme chez les sous-traitants aéronautiques dont nous détaillons le cadre dans notre retour sur le déploiement d'une IA on premise sécurisée.
Contrepartie : vous achetez le matériel, vous le sécurisez, vous le maintenez. À réserver aux cas où l'enjeu le justifie.
IA hébergée en France : le cloud souverain
Une IA hébergée en France tourne sur les serveurs d'un prestataire français. La qualification SecNumCloud de l'ANSSI atteste d'un niveau de sécurité et d'une protection contre les lois extraterritoriales (ANSSI, cyber.gouv.fr). Pour beaucoup de PME et d'ETI industrielles, c'est le meilleur compromis : pas de salle serveur à gérer, des données qui restent sous droit français.
Lisez le contrat avec méthode : lieu de traitement des prompts, absence de réutilisation pour l'entraînement, journalisation, qui peut accéder aux machines. Le sujet est le même que pour Microsoft Copilot face à une IA souveraine française : la localisation du centre de données ne règle pas tout, la nationalité du fournisseur et le contrat comptent autant.
IA sans cloud : le poste local
Une IA sans cloud sur un poste est possible avec des outils comme Ollama ou llama.cpp, qui exécutent un modèle quantifié sur un ordinateur portable ou un Mac à mémoire unifiée. C'est pratique pour un ingénieur qui traite des documents confidentiels hors ligne, ou pour tester un modèle avant un projet.
Ce n'est pas une solution d'équipe : pas de partage des documents, pas de gestion centralisée des droits, des modèles plus petits. Pour un usage collectif, un serveur reste préférable.
LLM local en entreprise : quels modèles ouverts utiliser ?
Pour un LLM local en entreprise, quatre familles dominent en 2026. Le choix se fait sur la langue, la licence et la taille compatible avec votre matériel. Pour la définition d'un modèle de langage et ses limites, voir notre page sur le LLM.
- Mistral (Mistral Small, Ministral) : le plus à l'aise en français, plusieurs modèles sous licence permissive. Notre guide des petits modèles Mistral détaille les tailles.
- Llama (Meta) : très répandu, bon niveau multilingue, licence communautaire avec conditions à lire.
- Qwen (Alibaba) : bons résultats en code et en extraction, plusieurs tailles. À valider selon votre politique sur l'origine des modèles.
- Gemma (Google) : modèles compacts adaptés aux petites machines, licence propre à Google.
Nous reprenons licences, tailles et limites de chaque famille dans le comparatif des LLM open source. Notre conseil pour démarrer : un modèle de 7 à 24 milliards de paramètres, testé sur 30 à 50 vrais documents, avant de monter en taille.
Ce choix de modèle s'accompagne presque toujours d'un système de recherche sur vos documents : c'est le principe du RAG, qui évite de réentraîner quoi que ce soit. Nous décrivons une architecture complète dans notre article sur le RAG souverain avec Mistral.
IA locale : ce que l'on gagne et ce que l'on perd en qualité
Un modèle local n'est pas une version dégradée de ChatGPT, mais ce n'est pas non plus son équivalent sur tout. L'écart dépend de la tâche, et c'est sur vos documents qu'il se mesure.
| Critère | IA locale (modèle ouvert) | IA cloud propriétaire |
|---|---|---|
| Confidentialité | Maîtrise complète du périmètre | Dépend du contrat et de l'éditeur |
| Résumé, extraction, classification | Très bon avec un modèle de taille moyenne | Très bon |
| Raisonnement complexe, longs contextes | Écart réel, croissant avec la difficulté | Avance des meilleurs modèles |
| Multimodal (images, voix) | Plus limité, selon les modèles | Plus complet |
| Mises à jour du modèle | À planifier vous-même | Automatiques, parfois sans préavis |
| Coût | Matériel et exploitation, puis usage sans facturation au volume | Abonnement ou paiement au volume |
| Disponibilité | Indépendante d'un service externe | Dépend du service et de l'accès réseau |
Le gain décisif est la maîtrise : vous décidez où va la donnée, quand le modèle change et qui y accède. La perte est une marge de qualité sur les tâches les plus exigeantes. Pour décider, comparez un modèle local et un service cloud sur les mêmes 30 documents, notés par ceux qui utiliseront l'outil. Le résultat tranche mieux qu'un classement public.
À retenir
Pour un secret industriel, un écart de qualité modeste sur certaines tâches est souvent préférable à un transfert de données non maîtrisé. Mais l'inverse existe : si la donnée n'est pas sensible, un modèle cloud sera plus simple et plus performant. L'IA locale se justifie par la donnée, pas par la mode.
Notre analyse comparée pour les sous-traitants du secteur est dans IA souveraine ou ChatGPT chez les sous-traitants aéronautiques.
Quel matériel pour faire tourner un LLM en local en entreprise ?
Pour faire tourner un LLM en local en entreprise, la contrainte n°1 est la mémoire du GPU (VRAM). Le modèle doit y tenir, avec de la marge pour le contexte et les utilisateurs simultanés. La quantification, qui réduit la précision des poids (par exemple en 4 bits), divise l'encombrement pour une perte de qualité souvent modeste.
Ordres de grandeur pour un modèle quantifié en 4 bits, hors contexte long (valeurs approximatives, à confirmer par un test sur votre machine) :
| Taille du modèle | Mémoire nécessaire | Type de machine | Usage typique |
|---|---|---|---|
| 7 à 8 milliards | 6 à 8 Go | Poste avec GPU grand public, Mac récent | Résumé, classification, tests |
| Environ 24 milliards | 16 à 24 Go | Serveur avec un GPU de 24 Go | Assistant sur documents, extraction |
| Environ 70 milliards | 40 à 48 Go et plus | Serveur avec un ou plusieurs GPU professionnels | Tâches plus exigeantes, plusieurs équipes |
Nous ne donnons pas de prix : ils bougent vite selon la disponibilité des GPU. Demandez un devis fournisseur sur la configuration cible, ou louez d'abord des GPU chez un hébergeur français pour valider le dimensionnement avant d'acheter. Les serveurs d'inférence (vLLM, llama.cpp, Ollama) et leurs compromis sont décrits dans notre comparatif des serveurs d'inférence open source.
Exploitation, mises à jour et cas d'usage adaptés
Le matériel n'est que le début. Une IA locale devient un service que quelqu'un doit faire vivre.
Ce que l'exploitation implique vraiment
- Mises à jour des modèles : un nouveau modèle sort tous les quelques mois. Décidez quand migrer, et re-testez sur vos documents avant de basculer.
- Supervision : disponibilité, charge GPU, temps de réponse, journaux d'usage.
- Sécurité : authentification, cloisonnement des droits d'accès aux documents, sauvegardes, correctifs du serveur et des bibliothèques.
- Évaluation continue : un jeu de questions de référence rejoué après chaque changement pour détecter une régression.
Si l'entreprise n'a pas d'équipe pour cela, un cloud souverain ou une exploitation déléguée est souvent plus réaliste qu'un serveur sur site. Notre checklist sécurité des données IA pour PME aide à cadrer ces points. Pour le détail technique de l'installation, voir l'article sur l'IA locale et les petits modèles du blog technique d'Anas.
Les cas d'usage qui justifient une IA locale
- Interrogation de la documentation technique (cahiers des charges, procédures, retours d'expérience) sans exposer de propriété intellectuelle.
- Analyse de contrats et de pièces clients soumis à clause de confidentialité.
- Extraction et classement de documents (bons de livraison, certificats, rapports de contrôle).
- Aide à la rédaction de réponses techniques à partir de l'historique de l'entreprise.
À l'inverse, un besoin de raisonnement très complexe, de veille web ou de multimodal avancé se traite mal en local : mieux vaut un service cloud pour les données non sensibles et du local pour le reste. Les gains de temps dépendent du volume de documents et de la qualité de votre base, ils se mesurent sur un pilote, pas sur une promesse.
Quelle option pour vos données sensibles ?
Nous cadrons le périmètre (site, cloud souverain ou poste), le modèle ouvert adapté et un test sur vos propres documents avant tout achat de matériel.
Questions fréquentes sur l'IA locale en entreprise
Pour aller plus loin
- IA souveraine, notre offre pour déployer une IA sans exposer vos données.
- RAG souverain avec Mistral, l'architecture pour interroger vos documents en local.
- Comparatif des LLM open source, pour choisir le modèle.
Sources