Un LLM (large language model, ou grand modèle de langage) est un programme d'IA entraîné sur d'énormes volumes de texte pour prédire la suite d'une phrase, ce qui lui permet de rédiger, résumer, traduire, extraire des informations et répondre en langage naturel. C'est le moteur de ChatGPT, Claude, Gemini ou Mistral Le Chat. Cet article donne la définition, explique le fonctionnement sans jargon, cite les grands exemples, puis aide un décideur à choisir : API, LLM open source ou LLM local.
LLM : définition simple
Un LLM, pour large language model (grand modèle de langage en français), est un modèle d'intelligence artificielle entraîné sur de très grands volumes de texte pour prédire la suite d'une phrase. De cette seule tâche découlent toutes ses capacités : rédiger, résumer, traduire, classer, extraire des données d'un document, écrire du code.
LLM, c'est quoi concrètement ? C'est le moteur qui se trouve derrière ChatGPT, Claude, Gemini ou Mistral Le Chat. L'assistant que vous voyez à l'écran est un produit ; le LLM est le composant qui produit les réponses. Une entreprise peut utiliser ce composant dans l'application d'un éditeur, ou l'appeler directement par API pour l'intégrer à ses propres outils.
Le mot « large » renvoie à deux choses : le nombre de paramètres (les valeurs internes réglées pendant l'entraînement, de quelques milliards à plusieurs centaines de milliards) et la quantité de texte absorbée. Le LLM relève de l'IA générative : il produit du contenu nouveau plutôt que de simplement classer des données existantes.
À retenir
Un LLM ne « sait » pas les choses comme une base de données. Il produit le texte le plus probable compte tenu de ce qu'il a appris et de ce qu'on lui donne. C'est ce qui le rend très souple, et c'est aussi ce qui explique ses erreurs.
Comment fonctionne un LLM, sans jargon
Un LLM travaille en trois temps : il découpe le texte en unités, il calcule des probabilités, puis il choisit la suite. Rien de magique, mais une échelle considérable.
Les tokens : l'unité de lecture
Le modèle ne lit pas des mots mais des tokens, des fragments de mots (une syllabe, un mot court, un signe de ponctuation). Un texte français consomme en général plus de tokens qu'un texte anglais de même sens. Les éditeurs facturent à la consommation de tokens, et la fenêtre de contexte (la quantité de texte que le modèle peut garder en vue d'un coup) se mesure aussi en tokens.
L'architecture transformer et l'entraînement
Les LLM actuels reposent sur l'architecture transformer, présentée en 2017 par des chercheurs de Google dans l'article « Attention Is All You Need ». Son mécanisme d'attention permet au modèle de peser l'importance de chaque mot par rapport aux autres dans une phrase.
L'entraînement se déroule en deux grandes étapes. Le pré-entraînement apprend la langue et une grande quantité de connaissances générales sur un corpus massif. L'alignement (réglage fin avec des retours humains ou des consignes) apprend ensuite au modèle à suivre des instructions, à rester poli et à refuser certaines demandes.
Deux limites qui en découlent
La date de coupure. Le modèle ne connaît que ce qui figurait dans son corpus avant une certaine date. Pour une information récente, il faut une recherche web ou une base documentaire branchée.
L'hallucination. Comme il produit le texte probable et non le texte vérifié, un LLM peut affirmer un fait faux avec aplomb. Plus la question est pointue ou spécifique à votre entreprise, plus le risque monte. Notre article sur l'évaluation d'un LLM en entreprise explique comment mesurer ce risque avant la mise en production.
Exemples de LLM et grandes familles
On peut ranger les LLM en quatre familles selon la façon dont on y accède. Le tableau résume les différences ; les versions précises changent plusieurs fois par an, c'est donc la famille qui compte pour décider.
Les grandes familles de LLM
| Famille | Exemples | Accès | Atout principal | Limite à connaître |
|---|---|---|---|---|
| Propriétaires généralistes | GPT (OpenAI), Claude (Anthropic), Gemini (Google) | API ou application, hébergé chez l'éditeur | Meilleur niveau général, rien à installer | Données transmises à un tiers, dépendance à l'éditeur |
| Propriétaire européen | Mistral (modèles proposés par API) | API ou application, hébergement européen possible | Très bon français, éditeur soumis au droit européen | Catalogue plus étroit que les trois géants |
| Poids ouverts | Mistral, Llama, Qwen, DeepSeek, Gemma, Phi | Téléchargement, hébergement par vos soins ou un prestataire | Contrôle des données, personnalisation, coût maîtrisé à volume élevé | Infrastructure GPU, licence à lire, qualité variable en français |
| Petits modèles (SLM) | Variantes de quelques milliards de paramètres de Gemma, Phi, Qwen, Ministral | Local, poste ou serveur modeste | Rapides, économes, possibles hors ligne | Moins de raisonnement sur les tâches complexes |
Les exemples de LLM propriétaires : GPT chez OpenAI, Claude chez Anthropic, Gemini chez Google. Ils dominent les classements généralistes et se consomment par API ou application. Pour comparer les dernières versions, notre comparatif des modèles de pointe est tenu à jour, et l'article Mistral, OpenAI ou Anthropic traite l'arbitrage côté entreprise française.
Les exemples de LLM ouverts : Mistral (éditeur français, qui propose à la fois des modèles à poids ouverts et des modèles par API), Llama de Meta, Qwen d'Alibaba, DeepSeek, Gemma de Google, Phi de Microsoft. Nous les avons comparés un par un, avec licences et tailles, dans notre comparatif des LLM open source pour l'entreprise.
Ce qu'un LLM sait faire, ou pas, en entreprise
Un LLM est bon quand la tâche porte sur du texte, tolère une relecture et ne demande pas de calcul exact. Il est mauvais quand on lui demande une vérité vérifiable sans lui donner la source.
Ce qu'il fait bien :
- Résumer un compte rendu, une réunion, un dossier de plusieurs dizaines de pages.
- Rédiger un premier jet : email, réponse client, fiche produit, cahier des charges.
- Extraire des champs d'un document (facture, contrat, bon de commande) vers un format structuré.
- Classer et router des demandes entrantes (support, achats, tickets).
- Traduire, reformuler, changer de ton, expliquer un texte technique.
- Aider à écrire et à corriger du code.
Ce qu'il fait mal sans accompagnement :
- Répondre juste sur vos données internes sans qu'on les lui fournisse.
- Faire des calculs ou des métrés exacts : il vaut mieux l'associer à un outil de calcul ou à un logiciel métier.
- Garantir une conformité réglementaire sans relecture d'un spécialiste.
- Agir seul dans vos logiciels, sans cadre ni validation humaine.
En pratique, le gain vient presque toujours de la même démarche : choisir un processus précis, fixer un format de sortie, mesurer la qualité sur de vrais exemples, garder un humain sur les décisions qui engagent. Le modèle seul est rarement le sujet ; l'intégration l'est.
Un cas d'usage LLM en tête dans votre produit ou vos outils ?
On cadre le cas, on teste plusieurs modèles sur vos documents et on intègre le résultat dans votre logiciel ou votre SaaS.
LLM, RAG et agents : la différence
Le LLM est le modèle de langage. Le RAG (retrieval-augmented generation) relie ce modèle à vos documents pour qu'il réponde à partir de sources. L'agent IA ajoute la capacité de planifier et d'appeler des outils. Trois couches, qui s'empilent plutôt qu'elles ne s'excluent.
LLM, RAG et agent : trois choses différentes
| Brique | Ce que c'est | Ce qu'elle apporte | Exemple en entreprise |
|---|---|---|---|
| LLM | Le modèle de langage seul | Comprendre et produire du texte | Reformuler un email, résumer un compte rendu collé dans la fenêtre |
| RAG | Un LLM relié à une base de documents | Réponses fondées sur vos sources, avec citations | Assistant interne qui répond sur les procédures qualité |
| Agent IA | Un LLM qui planifie et appelle des outils | Enchaîner des actions dans vos logiciels | Lire une demande de devis, interroger l'ERP, préparer la réponse |
RAG : donner au LLM accès à vos documents
Sans RAG, un LLM répond depuis sa mémoire d'entraînement. Avec RAG, le système retrouve d'abord les passages pertinents dans votre base (contrats, procédures, tickets), puis les fournit au modèle avec la question. Les réponses peuvent citer leurs sources et se mettent à jour dès que la base change. Pour le mécanisme en détail (découpage, embeddings, reranking), voir notre article RAG : définition, fonctionnement et exemples en entreprise. Côté décideur, notre guide du RAG en entreprise traite les cas d'usage et les conditions de réussite.
Agents : laisser le LLM agir dans vos outils
Un agent est un LLM placé dans une boucle : il reçoit un objectif, décide d'une action (chercher dans le CRM, lire un fichier, envoyer un email), observe le résultat et recommence. La valeur est forte, le risque aussi : il faut des permissions limitées, des journaux et des validations. Le guide des agents IA en entreprise détaille les cas où un agent se justifie, et ceux où une simple automatisation suffit. Pour choisir un framework d'agents, voir le comparatif LangChain, LangGraph et CrewAI.
Choisir un LLM : open source, local ou API ?
Il n'existe pas de meilleur LLM dans l'absolu, seulement un meilleur choix pour une contrainte dominante : confidentialité, qualité maximale, coût à grand volume ou maîtrise de l'hébergement.
Choisir un LLM : cinq questions
| Question | Si la réponse est oui | Orientation |
|---|---|---|
| Les données sont-elles confidentielles ou réglementées ? | Elles ne doivent pas partir chez un tiers non maîtrisé | Poids ouverts hébergés chez vous ou en France |
| La tâche demande-t-elle du raisonnement complexe ? | Les meilleurs modèles propriétaires gardent l'avantage | API d'un grand éditeur, avec garde-fous |
| Le volume est-il élevé et la tâche répétitive ? | Le coût par requête devient décisif | Petit modèle ou modèle ouvert, parfois un routeur entre deux modèles |
| Le français est-il critique (juridique, contrats) ? | Tester sur vos propres documents | Comparer Mistral, Claude, GPT et un modèle ouvert sur un échantillon |
| Faut-il brancher le modèle sur vos logiciels ? | Le modèle seul ne suffit pas | LLM + RAG ou agent, intégrés à votre produit |
LLM open source : ce que le terme recouvre
Un LLM open source est le plus souvent un modèle à poids ouverts : les poids sont téléchargeables, mais le code d'entraînement et les données ne sont pas toujours publiés, et la licence peut encadrer l'usage commercial. Apache 2.0 et MIT sont les plus libres. Le gain réel pour une entreprise : héberger le modèle sur son infrastructure, l'adapter par fine-tuning, et ne plus dépendre du tarif ou des conditions d'un éditeur. Le comparatif détaillé par modèle est dans notre sélection des LLM open source.
LLM local : faire tourner le modèle chez soi
Un LLM local s'exécute sur votre machine ou votre serveur, sans connexion à l'API d'un éditeur. C'est possible avec des modèles de quelques milliards de paramètres, compressés par quantification (par exemple en 4 bits), avec des outils comme Ollama, LM Studio ou vLLM pour la production. Les prompts et les documents ne sortent pas de votre périmètre, ce qui compte pour la santé, le juridique ou la défense. En contrepartie, la qualité est inférieure à celle des modèles de pointe hébergés, et le matériel GPU a un coût. Notre article IA locale en entreprise : options, modèles et limites compare les architectures possibles (poste, serveur, cloud souverain) et les modèles adaptés.
Pour les tâches simples et répétitives, un petit modèle suffit souvent ; ianas.fr explique quand choisir un SLM plutôt qu'un LLM. Dans tous les cas, la décision se prend sur un test : vos documents, votre langue, vos critères de qualité, plusieurs modèles comparés.