Outils & Modèles Par

LLM : définition, fonctionnement et exemples en entreprise

Un LLM (large language model, ou grand modèle de langage) est un programme d'IA entraîné sur d'énormes volumes de texte pour prédire la suite d'une phrase, ce qui lui permet de rédiger, résumer, traduire, extraire des informations et répondre en langage naturel. C'est le moteur de ChatGPT, Claude, Gemini ou Mistral Le Chat. Cet article donne la définition, explique le fonctionnement sans jargon, cite les grands exemples, puis aide un décideur à choisir : API, LLM open source ou LLM local.

LLM : définition simple

Un LLM, pour large language model (grand modèle de langage en français), est un modèle d'intelligence artificielle entraîné sur de très grands volumes de texte pour prédire la suite d'une phrase. De cette seule tâche découlent toutes ses capacités : rédiger, résumer, traduire, classer, extraire des données d'un document, écrire du code.

LLM, c'est quoi concrètement ? C'est le moteur qui se trouve derrière ChatGPT, Claude, Gemini ou Mistral Le Chat. L'assistant que vous voyez à l'écran est un produit ; le LLM est le composant qui produit les réponses. Une entreprise peut utiliser ce composant dans l'application d'un éditeur, ou l'appeler directement par API pour l'intégrer à ses propres outils.

Le mot « large » renvoie à deux choses : le nombre de paramètres (les valeurs internes réglées pendant l'entraînement, de quelques milliards à plusieurs centaines de milliards) et la quantité de texte absorbée. Le LLM relève de l'IA générative : il produit du contenu nouveau plutôt que de simplement classer des données existantes.

À retenir

Un LLM ne « sait » pas les choses comme une base de données. Il produit le texte le plus probable compte tenu de ce qu'il a appris et de ce qu'on lui donne. C'est ce qui le rend très souple, et c'est aussi ce qui explique ses erreurs.

Comment fonctionne un LLM, sans jargon

Un LLM travaille en trois temps : il découpe le texte en unités, il calcule des probabilités, puis il choisit la suite. Rien de magique, mais une échelle considérable.

Les tokens : l'unité de lecture

Le modèle ne lit pas des mots mais des tokens, des fragments de mots (une syllabe, un mot court, un signe de ponctuation). Un texte français consomme en général plus de tokens qu'un texte anglais de même sens. Les éditeurs facturent à la consommation de tokens, et la fenêtre de contexte (la quantité de texte que le modèle peut garder en vue d'un coup) se mesure aussi en tokens.

L'architecture transformer et l'entraînement

Les LLM actuels reposent sur l'architecture transformer, présentée en 2017 par des chercheurs de Google dans l'article « Attention Is All You Need ». Son mécanisme d'attention permet au modèle de peser l'importance de chaque mot par rapport aux autres dans une phrase.

L'entraînement se déroule en deux grandes étapes. Le pré-entraînement apprend la langue et une grande quantité de connaissances générales sur un corpus massif. L'alignement (réglage fin avec des retours humains ou des consignes) apprend ensuite au modèle à suivre des instructions, à rester poli et à refuser certaines demandes.

Deux limites qui en découlent

La date de coupure. Le modèle ne connaît que ce qui figurait dans son corpus avant une certaine date. Pour une information récente, il faut une recherche web ou une base documentaire branchée.

L'hallucination. Comme il produit le texte probable et non le texte vérifié, un LLM peut affirmer un fait faux avec aplomb. Plus la question est pointue ou spécifique à votre entreprise, plus le risque monte. Notre article sur l'évaluation d'un LLM en entreprise explique comment mesurer ce risque avant la mise en production.

Exemples de LLM et grandes familles

On peut ranger les LLM en quatre familles selon la façon dont on y accède. Le tableau résume les différences ; les versions précises changent plusieurs fois par an, c'est donc la famille qui compte pour décider.

Les grandes familles de LLM

FamilleExemplesAccèsAtout principalLimite à connaître
Propriétaires généralistesGPT (OpenAI), Claude (Anthropic), Gemini (Google)API ou application, hébergé chez l'éditeurMeilleur niveau général, rien à installerDonnées transmises à un tiers, dépendance à l'éditeur
Propriétaire européenMistral (modèles proposés par API)API ou application, hébergement européen possibleTrès bon français, éditeur soumis au droit européenCatalogue plus étroit que les trois géants
Poids ouvertsMistral, Llama, Qwen, DeepSeek, Gemma, PhiTéléchargement, hébergement par vos soins ou un prestataireContrôle des données, personnalisation, coût maîtrisé à volume élevéInfrastructure GPU, licence à lire, qualité variable en français
Petits modèles (SLM)Variantes de quelques milliards de paramètres de Gemma, Phi, Qwen, MinistralLocal, poste ou serveur modesteRapides, économes, possibles hors ligneMoins de raisonnement sur les tâches complexes

Les exemples de LLM propriétaires : GPT chez OpenAI, Claude chez Anthropic, Gemini chez Google. Ils dominent les classements généralistes et se consomment par API ou application. Pour comparer les dernières versions, notre comparatif des modèles de pointe est tenu à jour, et l'article Mistral, OpenAI ou Anthropic traite l'arbitrage côté entreprise française.

Les exemples de LLM ouverts : Mistral (éditeur français, qui propose à la fois des modèles à poids ouverts et des modèles par API), Llama de Meta, Qwen d'Alibaba, DeepSeek, Gemma de Google, Phi de Microsoft. Nous les avons comparés un par un, avec licences et tailles, dans notre comparatif des LLM open source pour l'entreprise.

Ce qu'un LLM sait faire, ou pas, en entreprise

Un LLM est bon quand la tâche porte sur du texte, tolère une relecture et ne demande pas de calcul exact. Il est mauvais quand on lui demande une vérité vérifiable sans lui donner la source.

Ce qu'il fait bien :

  • Résumer un compte rendu, une réunion, un dossier de plusieurs dizaines de pages.
  • Rédiger un premier jet : email, réponse client, fiche produit, cahier des charges.
  • Extraire des champs d'un document (facture, contrat, bon de commande) vers un format structuré.
  • Classer et router des demandes entrantes (support, achats, tickets).
  • Traduire, reformuler, changer de ton, expliquer un texte technique.
  • Aider à écrire et à corriger du code.

Ce qu'il fait mal sans accompagnement :

  • Répondre juste sur vos données internes sans qu'on les lui fournisse.
  • Faire des calculs ou des métrés exacts : il vaut mieux l'associer à un outil de calcul ou à un logiciel métier.
  • Garantir une conformité réglementaire sans relecture d'un spécialiste.
  • Agir seul dans vos logiciels, sans cadre ni validation humaine.

En pratique, le gain vient presque toujours de la même démarche : choisir un processus précis, fixer un format de sortie, mesurer la qualité sur de vrais exemples, garder un humain sur les décisions qui engagent. Le modèle seul est rarement le sujet ; l'intégration l'est.

Un cas d'usage LLM en tête dans votre produit ou vos outils ?

On cadre le cas, on teste plusieurs modèles sur vos documents et on intègre le résultat dans votre logiciel ou votre SaaS.

LLM, RAG et agents : la différence

Le LLM est le modèle de langage. Le RAG (retrieval-augmented generation) relie ce modèle à vos documents pour qu'il réponde à partir de sources. L'agent IA ajoute la capacité de planifier et d'appeler des outils. Trois couches, qui s'empilent plutôt qu'elles ne s'excluent.

LLM, RAG et agent : trois choses différentes

BriqueCe que c'estCe qu'elle apporteExemple en entreprise
LLMLe modèle de langage seulComprendre et produire du texteReformuler un email, résumer un compte rendu collé dans la fenêtre
RAGUn LLM relié à une base de documentsRéponses fondées sur vos sources, avec citationsAssistant interne qui répond sur les procédures qualité
Agent IAUn LLM qui planifie et appelle des outilsEnchaîner des actions dans vos logicielsLire une demande de devis, interroger l'ERP, préparer la réponse

RAG : donner au LLM accès à vos documents

Sans RAG, un LLM répond depuis sa mémoire d'entraînement. Avec RAG, le système retrouve d'abord les passages pertinents dans votre base (contrats, procédures, tickets), puis les fournit au modèle avec la question. Les réponses peuvent citer leurs sources et se mettent à jour dès que la base change. Pour le mécanisme en détail (découpage, embeddings, reranking), voir notre article RAG : définition, fonctionnement et exemples en entreprise. Côté décideur, notre guide du RAG en entreprise traite les cas d'usage et les conditions de réussite.

Agents : laisser le LLM agir dans vos outils

Un agent est un LLM placé dans une boucle : il reçoit un objectif, décide d'une action (chercher dans le CRM, lire un fichier, envoyer un email), observe le résultat et recommence. La valeur est forte, le risque aussi : il faut des permissions limitées, des journaux et des validations. Le guide des agents IA en entreprise détaille les cas où un agent se justifie, et ceux où une simple automatisation suffit. Pour choisir un framework d'agents, voir le comparatif LangChain, LangGraph et CrewAI.

Choisir un LLM : open source, local ou API ?

Il n'existe pas de meilleur LLM dans l'absolu, seulement un meilleur choix pour une contrainte dominante : confidentialité, qualité maximale, coût à grand volume ou maîtrise de l'hébergement.

Choisir un LLM : cinq questions

QuestionSi la réponse est ouiOrientation
Les données sont-elles confidentielles ou réglementées ?Elles ne doivent pas partir chez un tiers non maîtriséPoids ouverts hébergés chez vous ou en France
La tâche demande-t-elle du raisonnement complexe ?Les meilleurs modèles propriétaires gardent l'avantageAPI d'un grand éditeur, avec garde-fous
Le volume est-il élevé et la tâche répétitive ?Le coût par requête devient décisifPetit modèle ou modèle ouvert, parfois un routeur entre deux modèles
Le français est-il critique (juridique, contrats) ?Tester sur vos propres documentsComparer Mistral, Claude, GPT et un modèle ouvert sur un échantillon
Faut-il brancher le modèle sur vos logiciels ?Le modèle seul ne suffit pasLLM + RAG ou agent, intégrés à votre produit

LLM open source : ce que le terme recouvre

Un LLM open source est le plus souvent un modèle à poids ouverts : les poids sont téléchargeables, mais le code d'entraînement et les données ne sont pas toujours publiés, et la licence peut encadrer l'usage commercial. Apache 2.0 et MIT sont les plus libres. Le gain réel pour une entreprise : héberger le modèle sur son infrastructure, l'adapter par fine-tuning, et ne plus dépendre du tarif ou des conditions d'un éditeur. Le comparatif détaillé par modèle est dans notre sélection des LLM open source.

LLM local : faire tourner le modèle chez soi

Un LLM local s'exécute sur votre machine ou votre serveur, sans connexion à l'API d'un éditeur. C'est possible avec des modèles de quelques milliards de paramètres, compressés par quantification (par exemple en 4 bits), avec des outils comme Ollama, LM Studio ou vLLM pour la production. Les prompts et les documents ne sortent pas de votre périmètre, ce qui compte pour la santé, le juridique ou la défense. En contrepartie, la qualité est inférieure à celle des modèles de pointe hébergés, et le matériel GPU a un coût. Notre article IA locale en entreprise : options, modèles et limites compare les architectures possibles (poste, serveur, cloud souverain) et les modèles adaptés.

Pour les tâches simples et répétitives, un petit modèle suffit souvent ; ianas.fr explique quand choisir un SLM plutôt qu'un LLM. Dans tous les cas, la décision se prend sur un test : vos documents, votre langue, vos critères de qualité, plusieurs modèles comparés.

Questions fréquentes : LLM, définition et exemples

Un LLM (large language model, ou grand modèle de langage) est un programme d'intelligence artificielle entraîné sur d'énormes volumes de texte pour prédire la suite d'un texte. Cette capacité simple lui permet de rédiger, résumer, traduire, classer, extraire des informations et répondre à des questions en langage naturel. ChatGPT, Claude, Gemini et Mistral Le Chat sont des assistants construits sur des LLM.
Large language model se traduit par grand modèle de langage. « Large » renvoie à la taille du modèle, qui se compte en milliards de paramètres (les valeurs numériques ajustées pendant l'entraînement) et au volume de texte utilisé pour l'entraîner. « Language model » désigne un modèle statistique du langage : il calcule la probabilité du mot suivant d'après ce qui précède.
Parmi les modèles propriétaires, on trouve la famille GPT d'OpenAI, Claude d'Anthropic et Gemini de Google, accessibles par API ou par une application. Parmi les modèles à poids ouverts, on trouve Mistral, Llama de Meta, Qwen d'Alibaba, DeepSeek, Gemma de Google ou Phi de Microsoft, que l'on peut télécharger et héberger soi-même. Les versions changent plusieurs fois par an : vérifiez toujours le catalogue en vigueur chez l'éditeur.
Un LLM est le moteur, ChatGPT est un produit construit autour d'un moteur. ChatGPT combine des modèles d'OpenAI avec une interface de discussion, un historique, des outils (recherche web, code, fichiers) et des réglages de sécurité. Le même raisonnement vaut pour Claude, Gemini ou Mistral Le Chat. Une entreprise peut utiliser directement le LLM par API pour l'intégrer dans ses propres logiciels.
On parle plutôt de LLM à poids ouverts (open weights) : l'éditeur publie les poids du modèle, ce qui permet de le télécharger, de l'héberger et souvent de l'adapter. Le code et les données d'entraînement ne sont pas toujours publiés, et la licence peut limiter l'usage commercial. Avant tout déploiement, il faut lire la licence du modèle choisi : Apache 2.0 et MIT sont les plus permissives.
Oui. Des modèles compacts de quelques milliards de paramètres, compressés par quantification, tournent sur un ordinateur portable récent ou un poste avec une carte graphique grand public, avec des outils comme Ollama ou LM Studio. Les gros modèles demandent un serveur avec plusieurs GPU. Le local garantit que les données restent chez vous, mais la qualité est inférieure à celle des meilleurs modèles hébergés sur les plateformes des grands éditeurs.
Oui, mais pas en les « apprenant » automatiquement. Un LLM ne connaît que ses données d'entraînement et ce que vous lui fournissez dans la conversation. Pour exploiter vos contrats, procédures ou fiches produits, on le relie à une base documentaire par une architecture RAG : le système retrouve les bons passages au moment de la question et les donne au modèle, qui rédige la réponse en citant ses sources.

Développement SaaS avec IA

Un LLM à intégrer dans votre produit ou vos outils ?

On choisit le modèle sur vos propres documents, on relie RAG ou agents à vos données, et on livre une fonctionnalité en production, pas une démonstration.

Anas Rabhi, ingénieur IA et data scientist, fondateur de Tensoria
Anas R. Ingénieur IA, fondateur de Tensoria ianas.fr

Je suis ingénieur IA et data scientist, fondateur de Tensoria. Depuis plus de 6 ans, j'accompagne les entreprises dans l'exploitation concrète de l'IA pour leur métier : assistants internes basés sur RAG, agents IA en production, automatisations sur mesure, traitement intelligent de documents. J'interviens du cadrage initial à la mise en production, sur stacks LLM modernes (Mistral, Claude, GPT) et infrastructures souveraines quand la confidentialité l'exige.