Outils & Modèles Par

Ollama en entreprise : installer, modèles et limites

Ollama est un outil open source qui télécharge et exécute des modèles de langage sur votre propre machine (Windows, macOS ou Linux), avec une API locale. Idéal pour prototyper, il demande des garde-fous en entreprise : concurrence, supervision et sécurité. Voici comment l'installer, quels modèles choisir et quand passer à un serveur d'inférence.

Ollama, c'est quoi ?

Ollama est un outil qui télécharge des modèles de langage ouverts et les fait tourner sur votre propre machine, avec une simple commande. Il sert à la fois de gestionnaire de modèles, de moteur d'exécution et de serveur d'API locale.

Concrètement, vous tapez ollama run suivi du nom d'un modèle. Ollama le télécharge, le charge en mémoire et ouvre une conversation dans le terminal. En parallèle, il démarre une API sur http://localhost:11434 que vos scripts et vos applications peuvent appeler, sans clé d'API externe.

C'est ce qui explique son succès : un développeur passe de zéro à un modèle qui répond en quelques minutes, sans configurer de GPU à la main. Pour un dirigeant, la question utile n'est pas « comment l'installer » mais « jusqu'où peut-on s'en servir dans l'entreprise ». Ce guide répond aux deux.

Ce qu'Ollama apporte

  • Un téléchargement de modèle en une commande, avec gestion des versions et de la quantification.
  • Des données qui restent sur la machine quand le modèle est exécuté en local.
  • Une API locale sur le port 11434, utilisable par les outils qui savent parler à un modèle.
  • Un fonctionnement sur Windows, macOS et Linux, avec ou sans GPU.

Ce qu'Ollama n'est pas

Ollama n'est pas un modèle : c'est le moteur qui exécute des modèles (Gemma, Qwen, Llama, Mistral et d'autres). Ce n'est pas non plus une plateforme d'entreprise avec comptes utilisateurs, quotas et tableaux de bord. Pour cadrer le besoin global avant de choisir un outil, notre guide de l'IA locale en entreprise compare serveur sur site, cloud souverain et poste local.

Ollama installation : Windows, Linux, macOS

L'installation d'Ollama prend quelques minutes : un installeur sur Windows et macOS, une ligne de commande sur Linux. Les commandes ci-dessous viennent de la documentation officielle, consultée le 4 octobre 2026 (docs.ollama.com).

Ollama sur Windows

Téléchargez l'installeur depuis ollama.com/download et lancez-le. Par défaut, il s'installe dans le dossier utilisateur : aucun droit administrateur n'est nécessaire. Les prérequis indiqués dans la documentation Windows d'Ollama :

  • Windows 10 22H2 ou plus récent (Famille ou Pro)
  • Pour un GPU NVIDIA, des pilotes en version 551.61 ou supérieure
  • Pour un GPU AMD Radeon, des pilotes compatibles ROCm v7 ou Vulkan
  • Au moins 4 Go pour l'application, puis de quelques dizaines à plusieurs centaines de Go pour les modèles

Après l'installation, Ollama tourne en arrière-plan et l'API répond sur http://localhost:11434. Pour déplacer le stockage des modèles vers un autre disque, définissez la variable d'environnement OLLAMA_MODELS. Pour l'exécuter comme service système, la documentation propose une version autonome en ligne de commande à lancer avec ollama serve via un outil comme NSSM.

Ollama sur Linux et macOS

Sur Linux, la commande officielle est :

curl -fsSL https://ollama.com/install.sh | sh

La documentation Linux décrit aussi un service systemd (ExecStart=/usr/bin/ollama serve, redémarrage automatique, utilisateur dédié) à activer avec systemctl enable ollama. C'est la base d'un déploiement serveur. Sur macOS, passez par la page de téléchargement officielle.

Lancer un premier modèle

Une fois Ollama installé, une seule commande suffit :

ollama run gemma4:e2b

Selon la documentation, Ollama télécharge le modèle puis ouvre une conversation sur votre ordinateur. Ce modèle pèse environ 7,2 Go et demande 8 Go de VRAM, ou de mémoire unifiée sur un Mac. Avec moins de VRAM, Ollama peut s'appuyer sur la mémoire vive, mais les réponses sont plus lentes.

Quels modèles Ollama choisir ?

Le bon modèle Ollama dépend de trois choses : la tâche, la mémoire disponible et la langue de travail. Plus le modèle est gros, plus il comprend finement, mais plus il demande de VRAM et plus il répond lentement.

La bibliothèque d'Ollama rassemble des familles ouvertes (Gemma, Qwen, Llama, Mistral, DeepSeek et d'autres), proposées en plusieurs tailles et en versions quantifiées. La quantification réduit la précision des poids pour que le modèle tienne en mémoire, avec une perte de qualité variable selon la tâche. Notre guide de la quantification (GGUF, int4) détaille ce compromis.

Quel modèle Ollama pour quel besoin

BesoinTaille de modèle à viserMatériel typiquePoint de vigilance
Tester Ollama, démo internePetit modèle (quelques milliards de paramètres)Portable récent, 8 Go de VRAM ou de mémoire unifiéeQualité limitée en français soutenu
Résumer, reformuler, répondre sur des documentsModèle moyen quantifiéGPU grand public ou Mac avec 16 à 32 GoTester sur vos propres documents, pas sur un benchmark
Assistant de code localModèle spécialisé code, contexte longGPU dédié, fenêtre de contexte de 64 000 tokens ou plusLa mémoire grimpe avec le contexte
Service partagé par une équipeModèle moyen à grandServeur GPU dédiéPasser par un serveur d'inférence plutôt que par Ollama seul

Comment trancher entre deux modèles

Ne vous fiez pas à un classement public pour décider. Prenez 20 à 30 documents réels (contrats, comptes rendus, emails), posez les mêmes questions à deux ou trois modèles, et faites relire les réponses par la personne du métier. C'est la seule méthode qui mesure ce qui compte chez vous. Le panorama des familles et leurs licences est dans notre comparatif des modèles LLM open source pour l'entreprise.

Attention aux modèles « cloud »

Certains noms de la bibliothèque d'Ollama se terminent par :cloud. La documentation les présente comme des modèles plus grands, utilisables sans téléchargement local : ils tournent donc sur l'infrastructure d'Ollama, pas sur votre machine. Pour des données sensibles, vérifiez toujours où s'exécute le modèle avant de l'adopter.

Ollama en entreprise : prototype ou production ?

Ollama est excellent pour prototyper et pour un usage individuel ou de petite équipe ; pour un service partagé en production, il demande des garde-fous que l'outil ne fournit pas seul. La limite n'est pas la qualité du modèle, c'est l'exploitation autour.

Ollama : prototype ou production ?

CritèrePrototype et usage individuelProduction partagée
InstallationUne commande ou un installeur, quelques minutesService systemd ou service Windows, mises à jour à planifier
Utilisateurs simultanésUn à quelques utilisateursÀ valider par un test de charge avant d'ouvrir à l'équipe
SupervisionLogs locaux, suivi à la mainMétriques, alertes et journalisation à ajouter autour
SécuritéAPI sur localhost, usage d'un seul posteProxy inverse avec authentification, réseau cloisonné
ReproductibilitéLe modèle téléchargé le jour JVersion de modèle et d'Ollama figées et documentées
VerdictExcellent choixAcceptable pour un petit périmètre, sinon changer de serveur

Concurrence et performance

Ollama est pensé pour la simplicité, pas pour servir des dizaines de requêtes en parallèle. Quand plusieurs personnes l'interrogent en même temps, les réponses se mettent en file d'attente et le temps d'attente grimpe. Mesurez-le avec un test de charge réaliste avant d'ouvrir l'outil à toute une équipe, plutôt que de vous fier à un chiffre générique.

Supervision et exploitation

Qui est prévenu quand le service tombe ? Quelle version du modèle répond ce matin ? Qui met à jour Ollama et le pilote GPU ? Ces questions sont banales pour une équipe infra, mais elles restent sans réponse dans beaucoup de déploiements « Ollama sur un serveur » montés en une après-midi. Notez la version de l'outil, celle du modèle et la date de dernière mise à jour dans un registre simple.

Sécurité et gouvernance

Par défaut, l'API écoute sur localhost : c'est sûr tant qu'elle reste sur le poste. Dès qu'on l'ouvre au réseau pour qu'une équipe s'en serve, il faut placer devant elle un proxy inverse avec authentification, cloisonner le réseau et journaliser les accès. N'imaginez pas que l'outil gère les comptes à votre place. Notre checklist sécurité des données IA pour PME détaille les points de contrôle RGPD et souveraineté.

Règle pratique

Prototype et poste individuel : Ollama seul. Petit service interne avec proxy authentifié et supervision : possible. Service d'équipe à charge réelle ou exposé à des clients : un serveur d'inférence dédié, avec exploitation assurée.

Ollama avec Open WebUI et avec Claude Code

Ollama devient plus utile quand on lui branche une interface ou un outil de développement. Deux associations reviennent souvent : Open WebUI pour le chat d'équipe, Claude Code pour le développement.

Ollama et Open WebUI

Open WebUI est une interface de chat qui se connecte à l'API d'Ollama (http://localhost:11434). Elle donne aux collaborateurs une interface proche de ChatGPT, alors qu'Ollama seul n'offre que le terminal et l'API. L'association est le montage le plus courant pour un assistant interne léger ; ses réglages, ses comptes et ses limites sont détaillés dans notre article Open WebUI en entreprise.

Ollama et Claude Code

La documentation d'Ollama sur Claude Code prévoit deux voies. La plus rapide :

ollama launch claude

La configuration manuelle passe par trois variables d'environnement, puis le choix du modèle :

export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3.5

La documentation recommande un modèle avec assez de contexte pour votre dépôt, et une fenêtre de 64 000 tokens ou plus pour les bases de code volumineuses. Gardez en tête que la qualité d'un modèle local de petite taille reste en dessous de celle d'un modèle de pointe pour les tâches de code complexes : testez sur une vraie tâche avant de généraliser.

Alternatives à Ollama côté serveur

Quand Ollama atteint ses limites, on passe à un serveur d'inférence conçu pour la charge. Le choix dépend du matériel et du nombre d'utilisateurs, pas d'une préférence de marque.

  • vLLM : référence pour la production sur GPU NVIDIA, avec API compatible OpenAI et traitement efficace de nombreuses requêtes simultanées.
  • Text Generation Inference : choix naturel pour les équipes déjà dans l'écosystème Hugging Face.
  • llama.cpp : le moteur sous-jacent des modèles quantifiés, adapté au CPU et aux petites configurations.
  • SGLang et TensorRT-LLM : pour les charges élevées et les prompts longs et répétitifs.

Notre comparatif des serveurs d'inférence LLM open source détaille débit, quantification et profil d'équipe pour chacun. Pour passer d'un prototype Ollama à un service fiable, c'est le bon point de départ.

Et si personne ne veut exploiter un serveur

Beaucoup de PME n'ont ni équipe infra ni envie d'en recruter une. Dans ce cas, le sujet n'est plus Ollama ou vLLM, mais qui héberge, supervise et fait évoluer l'ensemble. Une IA souveraine déployée sur un hébergement maîtrisé, avec exploitation déléguée, répond à cette contrainte sans transformer l'entreprise en opérateur de GPU.

Questions fréquentes sur Ollama

Ollama est un logiciel open source qui télécharge, gère et exécute des modèles de langage sur votre propre machine (Windows, macOS ou Linux). Il expose une API locale sur http://localhost:11434, que des applications, des scripts ou une interface comme Open WebUI peuvent appeler. Les données ne quittent pas la machine tant que le modèle tourne en local.
Téléchargez l'installeur depuis ollama.com/download et lancez-le : aucun droit administrateur n'est requis, car l'installation se fait dans le dossier utilisateur. Il faut Windows 10 22H2 ou plus récent, et des pilotes NVIDIA 551.61 ou supérieurs pour l'accélération GPU. Ensuite, ouvrez PowerShell et tapez ollama run suivi du nom d'un modèle : Ollama le télécharge puis ouvre une conversation.
Commencez par un modèle de taille modeste que votre matériel supporte, comme gemma4:e2b (environ 7,2 Go, 8 Go de VRAM ou de mémoire unifiée recommandés selon la documentation d'Ollama), puis montez en taille si la qualité est insuffisante. Pour la rédaction et le résumé en français, comparez au moins deux familles ouvertes sur vos propres documents. Le classement évolue vite : notre comparatif des modèles open source en entreprise est tenu à jour.
Oui pour un usage interne limité : un service de quelques utilisateurs, un outil de recette, un traitement en lot nocturne. Non pour un service à forte concurrence sans précautions : Ollama est conçu pour la simplicité, avec peu de supervision native, pas de gestion de comptes et une API qu'il faut protéger par un proxy authentifié. Au-delà, un serveur d'inférence comme vLLM est plus adapté.
Un modèle exécuté localement ne fait sortir aucune donnée de la machine. Attention toutefois aux modèles dont le nom se termine par :cloud : ils sont exécutés sur l'infrastructure d'Ollama, pas sur votre poste. Pour un usage avec des données sensibles, vérifiez où tourne chaque modèle et restez sur des modèles locaux téléchargés.
Oui. La documentation d'Ollama indique deux voies : la commande ollama launch claude, ou la configuration manuelle des variables ANTHROPIC_AUTH_TOKEN (valeur ollama), ANTHROPIC_API_KEY (vide) et ANTHROPIC_BASE_URL (http://localhost:11434), puis claude --model suivi du nom du modèle. Pour une base de code volumineuse, la documentation recommande une fenêtre de contexte de 64 000 tokens ou plus.

En résumé

Ollama est le moyen le plus simple de faire tourner un modèle ouvert sur un poste ou un petit serveur : idéal pour tester, prototyper et démontrer. Pour un service d'entreprise, ajoutez authentification, supervision, versions figées et test de charge, ou changez de serveur d'inférence. Si vous voulez cadrer ce choix avec votre contexte (données, matériel, utilisateurs), notre page IA souveraine présente comment nous déployons ces projets.

Mise en production

Un RAG ou un agent déjà en place, qui ne tient pas ses promesses ?

On mesure la qualité sur vos vrais cas, on corrige ce qui fait échouer le système (recherche, modèle, coûts, latence) et on le déploie pour qu'il tienne dans la durée.

Anas Rabhi, ingénieur IA et data scientist, fondateur de Tensoria
Anas R. Ingénieur IA, fondateur de Tensoria ianas.fr

Je suis ingénieur IA et data scientist, fondateur de Tensoria. Depuis plus de 6 ans, j'accompagne les entreprises dans l'exploitation concrète de l'IA pour leur métier : assistants internes basés sur RAG, agents IA en production, automatisations sur mesure, traitement intelligent de documents. J'interviens du cadrage initial à la mise en production, sur stacks LLM modernes (Mistral, Claude, GPT) et infrastructures souveraines quand la confidentialité l'exige.