Outils & Modèles Par

Langfuse : observabilité LLM open source, guide pour PME

Langfuse est une plateforme open source d'observabilité LLM : elle enregistre chaque appel de modèle, chaque recherche documentaire et chaque appel d'outil de votre application IA, avec le coût, la latence et le texte exact échangé. On peut l'utiliser en cloud ou l'auto-héberger sur sa propre infrastructure.

Pour une PME ou un éditeur SaaS qui met un assistant RAG ou un agent en production, c'est souvent la première brique à poser. Sans elle, une réponse fausse reste un mystère et une facture API qui monte reste une surprise. Avec elle, on ouvre la trace, on voit ce que le modèle a reçu, et on corrige.

Cet article répond à « Langfuse, c'est quoi », détaille ce que l'outil trace, compare cloud et self-hosted, montre la mise en place sur un RAG ou un agent, et cite les alternatives. Les faits sur l'outil sont issus de la documentation de langfuse.com, relue le 4 octobre 2026.

Ce qu'il faut retenir

  • Langfuse regroupe trois fonctions : traces (observabilité), gestion de prompts versionnés, évaluation des réponses
  • Il repose sur OpenTelemetry et s'intègre au SDK OpenAI, à LangChain, à LlamaIndex et à des dizaines d'autres frameworks
  • Cloud pour démarrer en une heure, self-hosted quand les données ne doivent pas sortir de chez vous
  • Le self-hosted demande PostgreSQL, ClickHouse, Redis ou Valkey et un stockage S3 : ce n'est pas un simple conteneur
  • Ce que ça change en production : on répond à « pourquoi cette réponse ? » et « combien coûte une exécution ? » avec des données, pas des impressions

Langfuse, c'est quoi ?

Langfuse est une plateforme open source qui sert à déboguer, analyser et améliorer une application construite sur un LLM. Son éditeur la présente comme une plateforme d'ingénierie IA qui réunit observabilité, gestion de prompts et évaluation. Elle fonctionne en cloud ou en auto-hébergement.

Le principe est simple. Votre application envoie à Langfuse un compte rendu de chaque exécution : la question, les étapes intermédiaires, la réponse finale. Langfuse stocke tout cela, le rend consultable dans une interface web et en tire des tableaux de bord de coût, de latence et de qualité.

Observabilité LLM et monitoring LLM : la différence

Les deux mots sont souvent confondus. Le monitoring LLM suit des indicateurs agrégés : nombre de requêtes, coût du jour, latence moyenne, taux d'erreur. L'observabilité LLM conserve le détail de chaque exécution, pour comprendre pourquoi une réponse précise est mauvaise.

Un système non déterministe ne se débogue pas avec une stack trace. Le même prompt peut donner deux réponses différentes, et la cause d'une erreur se trouve rarement dans le code : elle se trouve dans le contexte envoyé au modèle. Voir ce contexte est la raison d'être de l'observabilité.

Ce qui est open source, ce qui ne l'est pas

Le code de la plateforme est public et peut être déployé chez vous. Certaines fonctions d'entreprise de l'instance auto-hébergée (personnalisation de l'interface, API de gestion d'instance) passent par une licence commerciale, selon la documentation de l'éditeur. Pour un usage courant, traces, prompts et évaluations sont disponibles sans licence payante.

Ce que Langfuse trace : prompts, coûts, latence, évaluations

Langfuse trace quatre familles de données : le contenu des échanges (prompts et réponses), le coût en jetons, la latence de chaque étape et les scores de qualité attachés aux réponses. Chaque exécution forme une trace composée d'étapes imbriquées, appelées observations.

Donnée Ce que vous voyez Question à laquelle ça répond
Traces et sessions Arbre des appels de modèle, de recherche et d'outils ; conversations multi-tours regroupées Pourquoi l'assistant a-t-il répondu cela ?
Coûts Jetons en entrée et en sortie, coût par exécution, par utilisateur, par modèle Combien coûte une réponse normale, et qui consomme ?
Latence Durée de chaque étape, de la recherche à la génération Où perd-on du temps : retrieval, reranking ou modèle ?
Prompts Versions, historique, déploiement sans modifier le code, bac à sable Quelle version du prompt a produit cette réponse ?
Évaluations LLM juge, évaluateurs en code, retours utilisateurs, annotation manuelle, jeux de test La qualité monte-t-elle ou baisse-t-elle après un changement ?

Les traces et les sessions

Une trace d'assistant RAG se lit de haut en bas : reformulation de la question, recherche vectorielle, passages retenus, éventuel reranking, puis génération. Quand une réponse est fausse, on voit tout de suite si le bon document n'a pas été retrouvé ou si le modèle l'a mal lu. Ce sont deux problèmes différents, avec deux corrections différentes.

Les coûts et la latence

Le coût est calculé à partir des jetons consommés à chaque appel. On obtient un coût par exécution, par utilisateur ou par fonctionnalité. C'est ce chiffre qui permet de repérer un agent qui renvoie tout son contexte à chaque tour, un des mécanismes décrits dans notre diagnostic d'un agent IA qui boucle ou fait exploser la facture.

Les prompts et les évaluations

Les prompts peuvent être versionnés et déployés depuis l'interface sans redéployer le code. Les évaluations s'appliquent au trafic réel ou à des jeux de test : un LLM juge note les réponses, un utilisateur clique sur un pouce, un expert annote. La logique est celle d'un cycle : tracer, surveiller, constituer un jeu de test, expérimenter, évaluer.

Pour les métriques propres au RAG (fidélité, pertinence du contexte), l'évaluation hors ligne est détaillée dans ce guide de ianas.fr sur l'évaluation d'un RAG en production avec Ragas.

Langfuse cloud ou self-hosted : comment choisir

Le cloud est le bon choix pour démarrer vite et sans équipe d'exploitation. Le self-hosted s'impose quand les traces contiennent des données qui ne doivent pas quitter votre infrastructure : documents clients, données de santé, contrats, exigences d'un donneur d'ordre.

Critère Langfuse cloud Langfuse self-hosted
Mise en route Un compte, des clés d'API, quelques lignes de code Déployer et opérer les conteneurs et les bases
Où sont les traces Chez l'éditeur, dans la région proposée Chez vous, sous votre contrôle
Coût Au volume, avec un palier gratuit Infrastructure et temps d'exploitation
Mises à jour et sauvegardes Prises en charge par l'éditeur À votre charge
Pour qui Équipes produit, prototypes, volumes modérés Données sensibles, contraintes contractuelles, équipe technique

Langfuse self-hosted : ce que ça demande vraiment

Selon la documentation de l'éditeur, l'auto-hébergement repose sur deux conteneurs applicatifs, un serveur web (interface et API) et un worker de traitement asynchrone. Il s'appuie sur quatre briques de stockage : PostgreSQL pour les données transactionnelles, ClickHouse pour les données d'observabilité, Redis ou Valkey pour le cache et les files, et un stockage S3 pour les événements bruts et les pièces jointes.

Docker Compose convient pour un essai sur une machine. Pour la production, l'éditeur recommande Kubernetes avec Helm. Des déploiements sur AWS, Azure et GCP sont documentés. Ce n'est donc pas un « docker run » : il faut savoir sauvegarder, mettre à jour et surveiller ces bases.

Combien ça coûte côté cloud

Au 4 octobre 2026, la grille publiée sur langfuse.com indique un palier Hobby gratuit (50 000 unités par mois, 30 jours d'historique, 2 utilisateurs) et un palier Core à 29 dollars par mois (100 000 unités, 90 jours d'historique, utilisateurs illimités). Au-delà des unités incluses, un tarif dégressif s'applique. Vérifiez la page tarifs avant de vous engager : ces grilles évoluent.

Mettre en place Langfuse sur un RAG ou un agent

La mise en place tient en quatre étapes : créer le projet, instrumenter le code, nommer les étapes, puis ajouter des scores. La première trace utile arrive souvent le jour même, parce que Langfuse s'intègre au SDK OpenAI, à LangChain et à LlamaIndex, et accepte aussi l'ingestion OpenTelemetry.

  1. Créer le projet en cloud, ou déployer l'instance en self-hosted, puis récupérer les clés d'API publique et secrète.
  2. Instrumenter l'application avec le SDK Python ou JavaScript, ou via l'intégration du framework déjà utilisé. Les appels de modèle sont alors capturés avec leur coût et leur latence.
  3. Découper la chaîne en étapes nommées : reformulation, retrieval, reranking, génération pour un RAG ; appels d'outils et décisions pour un agent. Sans ce découpage, on voit un bloc opaque au lieu d'un parcours.
  4. Associer un identifiant d'utilisateur et de session, pour regrouper les conversations multi-tours et mesurer le coût par utilisateur.
  5. Ajouter des scores : retour utilisateur (pouce haut ou bas), évaluation par LLM juge sur un échantillon, annotation par un expert métier.

Dans un projet RAG

Sur un assistant documentaire, les deux informations les plus utiles sont les passages réellement récupérés et leur ordre. Beaucoup d'erreurs attribuées au modèle viennent d'un retrieval qui n'a pas ramené le bon extrait. La trace le montre en quelques secondes. Pour l'architecture d'ensemble, voir notre guide du RAG en entreprise et, pour les principes, l'explication de ianas.fr sur ce qu'est le RAG.

Dans un agent IA

Pour un agent, la trace est un arbre : décision, appel d'outil, résultat, nouvelle décision. On y repère les boucles (même outil appelé trois fois avec les mêmes arguments), les étapes qui prennent la moitié du temps et les exécutions anormalement chères. Langfuse affiche aussi les workflows d'agents sous forme de graphe. Selon le framework d'agents choisi (LangChain, LangGraph, CrewAI), l'instrumentation se branche à des endroits différents.

Avant d'envoyer des traces

Les prompts contiennent des données réelles : noms, e-mails, extraits de contrats. Décidez avant la mise en production de ce qui est masqué ou tronqué, et de la durée de conservation. Avec le cloud, c'est un point à documenter pour votre DPO. Avec le self-hosted, vous gardez la maîtrise, mais la responsabilité vous revient en entier.

Ce que ça change en production

En production, l'observabilité change trois choses : le temps de diagnostic d'une réponse fausse, la visibilité sur le coût et la confiance pour modifier un prompt ou un modèle. On passe de « il semble que ça marche moins bien » à une comparaison avant et après sur des cas réels.

  • Diagnostic. Un utilisateur signale une mauvaise réponse : on retrouve sa trace, on voit le contexte, on classe la cause (retrieval, prompt, modèle, donnée source).
  • Coût. On sait ce que coûte une exécution normale et on détecte la dérive avant la facture du mois.
  • Changements. Remplacer un modèle ou réécrire un prompt devient testable sur un jeu de cas, au lieu d'un pari.
  • Dialogue avec le métier. Les annotations d'un expert (juriste, comptable, technicien) alimentent le jeu de test.

Ce qu'un outil ne fait pas : décider à votre place de ce qu'est une bonne réponse. Les critères de qualité viennent du métier. Langfuse fournit l'endroit où les mesurer et les suivre, pas les critères eux-mêmes.

Alternatives à Langfuse et critères de choix

Plusieurs outils couvrent des besoins voisins : LangSmith (édité par LangChain), Arize Phoenix, Helicone, Opik, TruLens, ainsi que les modules d'observabilité des plateformes cloud. Aucun n'est le meilleur dans l'absolu : le bon choix dépend de la stack, de l'hébergement exigé et de la place donnée à l'évaluation.

  • Framework. Une équipe entièrement sur LangChain ou LangGraph a un intérêt naturel à regarder LangSmith. Une stack mixte ou maison trouve son compte dans un outil framework-agnostique reposant sur OpenTelemetry.
  • Hébergement. Si les traces ne doivent pas sortir, vérifiez que l'option auto-hébergée existe et que vous pouvez l'exploiter.
  • Évaluation. Si la priorité est le jeu de test et le LLM juge, comparez les fonctions d'évaluation, pas seulement le tableau de traces.
  • Équipe. Annotation humaine, gestion des droits et SSO comptent dès qu'un expert métier utilise l'outil.

Le comparatif détaillé, avec Ragas, DeepEval, promptfoo et les autres, se trouve dans notre article sur les outils d'évaluation et d'observabilité des LLM.

Questions fréquentes sur Langfuse et l'observabilité LLM

Langfuse, c'est quoi exactement ?

Langfuse est une plateforme open source d'observabilité pour applications LLM. Elle enregistre chaque appel de modèle, chaque recherche documentaire et chaque appel d'outil sous forme de trace, avec le coût, la latence et les messages échangés. Elle ajoute la gestion de prompts versionnés et l'évaluation des réponses, sur le trafic réel comme sur des jeux de test.

Langfuse est-il vraiment open source et gratuit ?

Le code de Langfuse est ouvert et peut être auto-hébergé sur votre infrastructure. Le service cloud propose un palier Hobby gratuit, limité à 50 000 unités par mois, 30 jours d'historique et 2 utilisateurs, selon la grille publiée sur langfuse.com au 4 octobre 2026. Au-delà, des paliers payants existent. L'auto-hébergement n'a pas de licence à payer pour les fonctions de base, mais il a un coût d'exploitation.

Que faut-il pour faire tourner Langfuse en self-hosted ?

L'auto-hébergement repose sur deux conteneurs applicatifs (web et worker) et quatre briques de stockage : PostgreSQL, ClickHouse, Redis ou Valkey, et un stockage de type S3. Docker Compose convient pour un test sur une machine, Kubernetes avec Helm est recommandé par l'éditeur pour la production. Prévoir quelqu'un qui sait sauvegarder, mettre à jour et surveiller ces briques.

Quelle différence entre observabilité LLM et monitoring LLM ?

Le monitoring suit des indicateurs agrégés : volume de requêtes, coût journalier, latence moyenne, taux d'erreur. L'observabilité va plus loin : elle conserve le détail de chaque exécution (prompt exact, documents récupérés, appels d'outils, réponse) pour comprendre pourquoi une réponse précise est mauvaise. En pratique, un outil comme Langfuse fournit les deux à partir des mêmes traces.

Langfuse fonctionne-t-il avec un RAG ou un agent ?

Oui. Un pipeline RAG se trace en étapes imbriquées : reformulation de la question, recherche vectorielle, reranking, génération. Un agent se trace comme un arbre d'appels de modèle et d'outils. Les SDK Python et JavaScript, l'intégration OpenAI, LangChain, LlamaIndex et l'ingestion OpenTelemetry couvrent la plupart des architectures.

Les données sont-elles envoyées hors de France avec Langfuse ?

Avec le cloud, les traces sont hébergées chez l'éditeur, dans la région proposée par l'éditeur (à vérifier avant de choisir). Avec l'auto-hébergement, elles restent dans votre infrastructure, ce qui simplifie les échanges avec un DPO ou un client exigeant. Dans les deux cas, pensez à masquer les données personnelles avant l'envoi, car les prompts contiennent souvent des noms, des e-mails ou des extraits de contrats.

Quelles alternatives à Langfuse pour surveiller un LLM en production ?

LangSmith (LangChain), Arize Phoenix, Helicone, Opik, TruLens et les modules d'observabilité des plateformes cloud couvrent des besoins voisins. Le choix dépend du framework utilisé, de la contrainte d'hébergement et de la place laissée à l'évaluation. Notre comparatif des outils d'évaluation et d'observabilité des LLM détaille les différences.

Un RAG ou un agent déjà en production ?

Objectivons la qualité, le coût et la trajectoire, trace en main.

Voir l'audit RAG et agents IA

Aller plus loin

Pour instrumenter, mesurer et corriger un assistant ou un agent déjà déployé, découvrez notre audit technique RAG et agents IA. Sources : documentation Langfuse, guide d'auto-hébergement et page tarifs, consultées le 4 octobre 2026.

Mise en production

Un RAG ou un agent déjà en place, qui ne tient pas ses promesses ?

On mesure la qualité sur vos vrais cas, on corrige ce qui fait échouer le système (recherche, modèle, coûts, latence) et on le déploie pour qu'il tienne dans la durée.

Anas Rabhi, ingénieur IA et data scientist, fondateur de Tensoria
Anas R. Ingénieur IA, fondateur de Tensoria ianas.fr

Je suis ingénieur IA et data scientist, fondateur de Tensoria. Depuis plus de 6 ans, j'accompagne les entreprises dans l'exploitation concrète de l'IA pour leur métier : assistants internes basés sur RAG, agents IA en production, automatisations sur mesure, traitement intelligent de documents. J'interviens du cadrage initial à la mise en production, sur stacks LLM modernes (Mistral, Claude, GPT) et infrastructures souveraines quand la confidentialité l'exige.