Ollama est un outil open source qui télécharge et exécute des modèles de langage sur votre propre machine (Windows, macOS ou Linux), avec une API locale. Idéal pour prototyper, il demande des garde-fous en entreprise : concurrence, supervision et sécurité. Voici comment l'installer, quels modèles choisir et quand passer à un serveur d'inférence.
Ollama, c'est quoi ?
Ollama est un outil qui télécharge des modèles de langage ouverts et les fait tourner sur votre propre machine, avec une simple commande. Il sert à la fois de gestionnaire de modèles, de moteur d'exécution et de serveur d'API locale.
Concrètement, vous tapez ollama run suivi du nom d'un modèle. Ollama le télécharge, le charge en mémoire et ouvre une conversation dans le terminal. En parallèle, il démarre une API sur http://localhost:11434 que vos scripts et vos applications peuvent appeler, sans clé d'API externe.
C'est ce qui explique son succès : un développeur passe de zéro à un modèle qui répond en quelques minutes, sans configurer de GPU à la main. Pour un dirigeant, la question utile n'est pas « comment l'installer » mais « jusqu'où peut-on s'en servir dans l'entreprise ». Ce guide répond aux deux.
Ce qu'Ollama apporte
- Un téléchargement de modèle en une commande, avec gestion des versions et de la quantification.
- Des données qui restent sur la machine quand le modèle est exécuté en local.
- Une API locale sur le port 11434, utilisable par les outils qui savent parler à un modèle.
- Un fonctionnement sur Windows, macOS et Linux, avec ou sans GPU.
Ce qu'Ollama n'est pas
Ollama n'est pas un modèle : c'est le moteur qui exécute des modèles (Gemma, Qwen, Llama, Mistral et d'autres). Ce n'est pas non plus une plateforme d'entreprise avec comptes utilisateurs, quotas et tableaux de bord. Pour cadrer le besoin global avant de choisir un outil, notre guide de l'IA locale en entreprise compare serveur sur site, cloud souverain et poste local.
Ollama installation : Windows, Linux, macOS
L'installation d'Ollama prend quelques minutes : un installeur sur Windows et macOS, une ligne de commande sur Linux. Les commandes ci-dessous viennent de la documentation officielle, consultée le 4 octobre 2026 (docs.ollama.com).
Ollama sur Windows
Téléchargez l'installeur depuis ollama.com/download et lancez-le. Par défaut, il s'installe dans le dossier utilisateur : aucun droit administrateur n'est nécessaire. Les prérequis indiqués dans la documentation Windows d'Ollama :
- Windows 10 22H2 ou plus récent (Famille ou Pro)
- Pour un GPU NVIDIA, des pilotes en version 551.61 ou supérieure
- Pour un GPU AMD Radeon, des pilotes compatibles ROCm v7 ou Vulkan
- Au moins 4 Go pour l'application, puis de quelques dizaines à plusieurs centaines de Go pour les modèles
Après l'installation, Ollama tourne en arrière-plan et l'API répond sur http://localhost:11434. Pour déplacer le stockage des modèles vers un autre disque, définissez la variable d'environnement OLLAMA_MODELS. Pour l'exécuter comme service système, la documentation propose une version autonome en ligne de commande à lancer avec ollama serve via un outil comme NSSM.
Ollama sur Linux et macOS
Sur Linux, la commande officielle est :
curl -fsSL https://ollama.com/install.sh | sh
La documentation Linux décrit aussi un service systemd (ExecStart=/usr/bin/ollama serve, redémarrage automatique, utilisateur dédié) à activer avec systemctl enable ollama. C'est la base d'un déploiement serveur. Sur macOS, passez par la page de téléchargement officielle.
Lancer un premier modèle
Une fois Ollama installé, une seule commande suffit :
ollama run gemma4:e2b
Selon la documentation, Ollama télécharge le modèle puis ouvre une conversation sur votre ordinateur. Ce modèle pèse environ 7,2 Go et demande 8 Go de VRAM, ou de mémoire unifiée sur un Mac. Avec moins de VRAM, Ollama peut s'appuyer sur la mémoire vive, mais les réponses sont plus lentes.
Quels modèles Ollama choisir ?
Le bon modèle Ollama dépend de trois choses : la tâche, la mémoire disponible et la langue de travail. Plus le modèle est gros, plus il comprend finement, mais plus il demande de VRAM et plus il répond lentement.
La bibliothèque d'Ollama rassemble des familles ouvertes (Gemma, Qwen, Llama, Mistral, DeepSeek et d'autres), proposées en plusieurs tailles et en versions quantifiées. La quantification réduit la précision des poids pour que le modèle tienne en mémoire, avec une perte de qualité variable selon la tâche. Notre guide de la quantification (GGUF, int4) détaille ce compromis.
Quel modèle Ollama pour quel besoin
| Besoin | Taille de modèle à viser | Matériel typique | Point de vigilance |
|---|---|---|---|
| Tester Ollama, démo interne | Petit modèle (quelques milliards de paramètres) | Portable récent, 8 Go de VRAM ou de mémoire unifiée | Qualité limitée en français soutenu |
| Résumer, reformuler, répondre sur des documents | Modèle moyen quantifié | GPU grand public ou Mac avec 16 à 32 Go | Tester sur vos propres documents, pas sur un benchmark |
| Assistant de code local | Modèle spécialisé code, contexte long | GPU dédié, fenêtre de contexte de 64 000 tokens ou plus | La mémoire grimpe avec le contexte |
| Service partagé par une équipe | Modèle moyen à grand | Serveur GPU dédié | Passer par un serveur d'inférence plutôt que par Ollama seul |
Comment trancher entre deux modèles
Ne vous fiez pas à un classement public pour décider. Prenez 20 à 30 documents réels (contrats, comptes rendus, emails), posez les mêmes questions à deux ou trois modèles, et faites relire les réponses par la personne du métier. C'est la seule méthode qui mesure ce qui compte chez vous. Le panorama des familles et leurs licences est dans notre comparatif des modèles LLM open source pour l'entreprise.
Attention aux modèles « cloud »
Certains noms de la bibliothèque d'Ollama se terminent par :cloud. La documentation les présente comme des modèles plus grands, utilisables sans téléchargement local : ils tournent donc sur l'infrastructure d'Ollama, pas sur votre machine. Pour des données sensibles, vérifiez toujours où s'exécute le modèle avant de l'adopter.
Ollama en entreprise : prototype ou production ?
Ollama est excellent pour prototyper et pour un usage individuel ou de petite équipe ; pour un service partagé en production, il demande des garde-fous que l'outil ne fournit pas seul. La limite n'est pas la qualité du modèle, c'est l'exploitation autour.
Ollama : prototype ou production ?
| Critère | Prototype et usage individuel | Production partagée |
|---|---|---|
| Installation | Une commande ou un installeur, quelques minutes | Service systemd ou service Windows, mises à jour à planifier |
| Utilisateurs simultanés | Un à quelques utilisateurs | À valider par un test de charge avant d'ouvrir à l'équipe |
| Supervision | Logs locaux, suivi à la main | Métriques, alertes et journalisation à ajouter autour |
| Sécurité | API sur localhost, usage d'un seul poste | Proxy inverse avec authentification, réseau cloisonné |
| Reproductibilité | Le modèle téléchargé le jour J | Version de modèle et d'Ollama figées et documentées |
| Verdict | Excellent choix | Acceptable pour un petit périmètre, sinon changer de serveur |
Concurrence et performance
Ollama est pensé pour la simplicité, pas pour servir des dizaines de requêtes en parallèle. Quand plusieurs personnes l'interrogent en même temps, les réponses se mettent en file d'attente et le temps d'attente grimpe. Mesurez-le avec un test de charge réaliste avant d'ouvrir l'outil à toute une équipe, plutôt que de vous fier à un chiffre générique.
Supervision et exploitation
Qui est prévenu quand le service tombe ? Quelle version du modèle répond ce matin ? Qui met à jour Ollama et le pilote GPU ? Ces questions sont banales pour une équipe infra, mais elles restent sans réponse dans beaucoup de déploiements « Ollama sur un serveur » montés en une après-midi. Notez la version de l'outil, celle du modèle et la date de dernière mise à jour dans un registre simple.
Sécurité et gouvernance
Par défaut, l'API écoute sur localhost : c'est sûr tant qu'elle reste sur le poste. Dès qu'on l'ouvre au réseau pour qu'une équipe s'en serve, il faut placer devant elle un proxy inverse avec authentification, cloisonner le réseau et journaliser les accès. N'imaginez pas que l'outil gère les comptes à votre place. Notre checklist sécurité des données IA pour PME détaille les points de contrôle RGPD et souveraineté.
Règle pratique
Prototype et poste individuel : Ollama seul. Petit service interne avec proxy authentifié et supervision : possible. Service d'équipe à charge réelle ou exposé à des clients : un serveur d'inférence dédié, avec exploitation assurée.
Ollama avec Open WebUI et avec Claude Code
Ollama devient plus utile quand on lui branche une interface ou un outil de développement. Deux associations reviennent souvent : Open WebUI pour le chat d'équipe, Claude Code pour le développement.
Ollama et Open WebUI
Open WebUI est une interface de chat qui se connecte à l'API d'Ollama (http://localhost:11434). Elle donne aux collaborateurs une interface proche de ChatGPT, alors qu'Ollama seul n'offre que le terminal et l'API. L'association est le montage le plus courant pour un assistant interne léger ; ses réglages, ses comptes et ses limites sont détaillés dans notre article Open WebUI en entreprise.
Ollama et Claude Code
La documentation d'Ollama sur Claude Code prévoit deux voies. La plus rapide :
ollama launch claude
La configuration manuelle passe par trois variables d'environnement, puis le choix du modèle :
export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3.5
La documentation recommande un modèle avec assez de contexte pour votre dépôt, et une fenêtre de 64 000 tokens ou plus pour les bases de code volumineuses. Gardez en tête que la qualité d'un modèle local de petite taille reste en dessous de celle d'un modèle de pointe pour les tâches de code complexes : testez sur une vraie tâche avant de généraliser.
Alternatives à Ollama côté serveur
Quand Ollama atteint ses limites, on passe à un serveur d'inférence conçu pour la charge. Le choix dépend du matériel et du nombre d'utilisateurs, pas d'une préférence de marque.
- vLLM : référence pour la production sur GPU NVIDIA, avec API compatible OpenAI et traitement efficace de nombreuses requêtes simultanées.
- Text Generation Inference : choix naturel pour les équipes déjà dans l'écosystème Hugging Face.
- llama.cpp : le moteur sous-jacent des modèles quantifiés, adapté au CPU et aux petites configurations.
- SGLang et TensorRT-LLM : pour les charges élevées et les prompts longs et répétitifs.
Notre comparatif des serveurs d'inférence LLM open source détaille débit, quantification et profil d'équipe pour chacun. Pour passer d'un prototype Ollama à un service fiable, c'est le bon point de départ.
Et si personne ne veut exploiter un serveur
Beaucoup de PME n'ont ni équipe infra ni envie d'en recruter une. Dans ce cas, le sujet n'est plus Ollama ou vLLM, mais qui héberge, supervise et fait évoluer l'ensemble. Une IA souveraine déployée sur un hébergement maîtrisé, avec exploitation déléguée, répond à cette contrainte sans transformer l'entreprise en opérateur de GPU.
Questions fréquentes sur Ollama
En résumé
Ollama est le moyen le plus simple de faire tourner un modèle ouvert sur un poste ou un petit serveur : idéal pour tester, prototyper et démontrer. Pour un service d'entreprise, ajoutez authentification, supervision, versions figées et test de charge, ou changez de serveur d'inférence. Si vous voulez cadrer ce choix avec votre contexte (données, matériel, utilisateurs), notre page IA souveraine présente comment nous déployons ces projets.