Pour la plupart des entreprises, Claude Opus 5 est un meilleur point de départ que Fable 5.1. Il coûte deux fois moins cher et reste très proche sur plusieurs évaluations. Fable 5.1 prend l'avantage quand la tâche devient longue, ouverte et difficile. GPT-5.6 Sol est moins cher encore, tandis que Gemini 3.1 Pro affiche le tarif le plus bas du groupe mais reste en preview.
Le classement brut ne suffit donc pas. Le bon modèle est celui qui atteint votre seuil de qualité au coût total le plus bas, avec une latence acceptable et des conditions de données compatibles avec votre activité. Voilà la grille de décision.
Verdict rapide
- ✓ Fable 5.1 : pour les agents les plus difficiles, quand le taux de réussite compte plus que le prix ou la vitesse.
- ✓ Opus 5 : meilleur choix par défaut pour le code et le travail complexe dans l'écosystème Claude.
- ✓ GPT-5.6 Sol : bon candidat si vous utilisez déjà Responses API, Codex et les outils OpenAI.
- ✓ Gemini 3.1 Pro : intéressant pour le multimodal et le prix, si le statut preview est acceptable.
- ✓ Tâches simples ou gros volume : aucun des quatre ; testez d'abord un modèle plus léger.
Le comparatif des caractéristiques et des prix
Les tarifs ci-dessous sont ceux affichés par les fournisseurs au 1er septembre 2026, par million de tokens et hors outils additionnels. Pour Gemini 3.1 Pro, le premier tarif vaut jusqu'à 200 000 tokens d'entrée ; au-delà, Google applique un palier plus cher.
| Modèle | Prix entrée / sortie | Contexte / sortie max. | Cutoff fiable | Statut |
|---|---|---|---|---|
| Claude Fable 5.1 | 10 $ / 50 $ | 1M / 128k | Juin 2026 | Disponibilité générale |
| Claude Opus 5 | 5 $ / 25 $ | 1M / 128k | Mai 2026 | Disponibilité générale |
| GPT-5.6 Sol | 4 $ / 20 $ | 1,05M / 128k | 16 février 2026 | API OpenAI |
| Gemini 3.1 Pro | 2 $ / 12 $ (≤ 200k) 4 $ / 18 $ (> 200k) |
1M / 64k | Janvier 2025 | Preview |
À caractéristiques proches, Fable 5.1 est le plus cher. Ce n'est pas un accident : Anthropic le positionne comme un palier d'escalade. Sa propre documentation de choix de modèle conseille Opus 5 pour la majorité des charges et Fable 5.1 pour les raisonnements exigeants ou lorsque les évaluations d'Opus 5 ne suffisent plus.
Le million de tokens de contexte n'est plus un différenciateur entre ces quatre modèles. La sortie maximale l'est davantage : Fable, Opus et Sol montent à 128 000 tokens, contre 64 000 pour Gemini 3.1 Pro. Dans la pratique, une sortie de 128 000 tokens reste rarement souhaitable. Elle coûte cher, prend du temps et devient difficile à valider.
Ce que disent les benchmarks — et ce qu'ils ne disent pas
Les chiffres publiés par Anthropic
Sur les évaluations de lancement, Fable 5.1 domine les trois modèles qu'Anthropic a rejoués. L'écart est très fort sur Terminal-Bench-Science 0.1 (52,6 % contre 29,0 % pour Opus 5 et 22,4 % pour GPT-5.6 Sol), mais plus étroit sur CursorBench 3.2.0 (73,4 % contre 70,0 % et 67,2 %).
Code agentique
73,4 %
Fable 5.1 sur CursorBench 3.2.0, contre 70,0 % pour Opus 5.
Automatisation
31,4 %
Fable 5.1 sur AutomationBench, contre 26,9 % pour Opus 5.
Recherche scientifique
52,6 %
Fable 5.1 sur Terminal-Bench-Science, contre 24,7 % pour Fable 5.
Ces chiffres sont utiles, mais ils viennent du laboratoire qui vend le modèle. Les harnais, outils, niveaux d'effort et systèmes de fallback influencent le score. GPT-5.6 Sol n'est pas forcément exécuté dans sa meilleure configuration OpenAI, et Gemini 3.1 Pro n'apparaît pas dans ce tableau de lancement. Pas de conclusion générale à tirer à partir d'une seule source.
Une mesure indépendante à réglage comparable
Artificial Analysis a évalué plusieurs niveaux d'effort sur son Intelligence Index. À effort high, Fable 5.1 obtient 62, Opus 5 obtient 61 et GPT-5.6 Sol 57. À effort maximal, les scores passent respectivement à 66, 63 et 61. Gemini 3.1 Pro Preview est mesuré à 48.
| Artificial Analysis Intelligence Index | Effort high | Effort max |
|---|---|---|
| Fable 5.1 | 62 | 66 |
| Opus 5 | 61 | 63 |
| GPT-5.6 Sol | 57 | 61 |
| Gemini 3.1 Pro Preview | 48 | |
Un écart d'un point entre Fable 5.1 et Opus 5 à l'effort élevé ne justifie pas automatiquement un prix multiplié par deux. À l'inverse, quatre points au niveau maximal peuvent devenir décisifs sur un problème où une seule erreur coûte plusieurs heures d'expert. Le benchmark sélectionne les finalistes. Votre tâche les départage.
Le coût réel sur une charge identique
Prenons un scénario volontairement simple : 100 tâches, chacune avec 100 000 tokens d'entrée et 5 000 tokens de sortie, sans cache, sans outil payant et sans retry. Ce n'est pas un devis de production, juste une comparaison à volume identique.
| Modèle | Coût pour 100 tâches | Écart vs Fable 5.1 |
|---|---|---|
| Fable 5.1 | 125 $ | — |
| Opus 5 | 62,50 $ | -50 % |
| GPT-5.6 Sol | 50 $ | -60 % |
| Gemini 3.1 Pro Preview | 26 $ | -79,2 % |
Le calcul devient vite faux en production. Les tokens de raisonnement, les recherches web, le stockage du cache, les appels d'outils, les réponses rejetées et les retries modifient la facture. Fable 5.1 a aussi un avantage inhabituel sur les longues sessions : sa lecture de cache à 0,25 $/M, deux fois moins chère que celle d'Opus 5 et quatre fois moins chère que celle de Fable 5.
La métrique utile n'est donc pas « dollars par million de tokens », mais euros par tâche validée. Si Fable réussit 92 dossiers sur 100 du premier coup et qu'un modèle moins cher n'en réussit que 65, l'écart de prix peut disparaître après la relecture humaine et les relances. Si les quatre modèles réussissent 98 dossiers, Fable est simplement trop cher.
Quel modèle pour quel usage
Fable 5.1 : les tâches longues où l'échec coûte cher
À tester en premier pour une migration logicielle large, une recherche scientifique ou technique en plusieurs étapes, une investigation d'incident complexe, une analyse qui croise de nombreux documents et outils, ou la production complète d'un livrable avec vérification. Son avantage doit apparaître dans le taux de réussite, pas seulement dans une réponse plus longue.
Opus 5 : le choix raisonnable pour le travail complexe
Opus 5 reste le candidat par défaut pour les agents de code, l'analyse documentaire, les tableurs et les présentations. Il partage le contexte d'un million de tokens et la sortie maximale de Fable, pour la moitié du tarif. Si vous êtes déjà dans Claude Code, Claude API ou Claude sur AWS, commencez ici puis escaladez seulement les cas difficiles vers Fable 5.1.
GPT-5.6 Sol et Gemini 3.1 Pro : les options moins chères
Sol coûte 4 $/M en entrée et 20 $/M en sortie au 1er septembre 2026, après une baisse de prix fin août 2026 qui a réduit sa facture de près d'un tiers. Il dispose de 1,05 million de tokens de contexte, de plusieurs niveaux de raisonnement et des outils de la Responses API : fonctions, recherche web, recherche de fichiers et computer use. Pour une entreprise déjà équipée de ChatGPT, Codex ou d'intégrations OpenAI, le coût de migration peut compter davantage qu'un petit écart de benchmark.
Gemini 3.1 Pro : multimodal et économique, avec le risque preview.
Gemini 3.1 Pro reste en preview dans la documentation Google. Son tarif de 2 $/M en entrée et 12 $/M en sortie sous 200 000 tokens est agressif, et son contexte atteint un million de tokens. C'est un bon candidat pour les flux multimodaux et les entreprises déjà engagées dans Google Cloud. En revanche, un modèle preview peut évoluer : comportement, quotas, identifiant ou conditions de service. Pour une application critique, il faut accepter cette instabilité ou attendre une version stable.
Classification, extraction et gros volume : descendre en gamme.
Aucun modèle frontière ne devrait être le choix automatique pour trier des emails, extraire dix champs d'une facture ou reformater un texte. Testez Claude Sonnet 5, Haiku 4.5, GPT-5.6 Luna ou un Gemini Flash. Un routeur hybride peut réserver Fable ou Opus aux 5 % de cas réellement difficiles et envoyer le reste vers un modèle rapide.
La règle qui évite le surcoût
Commencez par le modèle le moins cher qui semble capable de faire la tâche. Montez d'un palier seulement sur les cas qui échouent. Cette logique de routage donne souvent un meilleur service qu'un modèle frontière utilisé partout.
Les limites qu'un tableau ne montre pas
La latence varie énormément avec l'effort
Fable 5.1 est classé « slower » par Anthropic. Dans le test de revue de code de CodeRabbit, il a pris en moyenne 18 min 38 s par tâche, contre 12 min 32 s pour Fable 5, avec des pipelines différents. Un agent nocturne peut accepter cette attente. Un conseiller affiché dans un CRM devant un commercial, non.
Le verdict de Juan Pablo Flores et Gowtham Kishore Vijay chez CodeRabbit est explicite : « Fable 5.1 is a specialist reviewer, not an automatic replacement for every pull request. » Le modèle est un spécialiste à évaluer, pas un nouveau réglage universel.
Le statut produit compte autant que le score
Gemini 3.1 Pro est en preview. Fable 5.1 introduit des changements cassants sur les appels d'outils forcés et l'historique des blocs de raisonnement. GPT-5.6 Sol et Opus 5 ont leurs propres API, outils et conventions. Le modèle le plus précis sur un test peut demander le plus de travail d'intégration.
Les politiques de données ne sont pas interchangeables
Fable 5.1 applique par défaut une rétention de 30 jours, avec zéro rétention seulement sur autorisation expresse. Google et OpenAI ont des conditions différentes selon le produit, le contrat et la région. Pour des données personnelles, juridiques, industrielles ou de santé, comparez les offres contractuelles exactes, pas seulement les pages marketing.
Si votre exigence impose un hébergement maîtrisé ou des poids ouverts, aucun des quatre candidats ne répond à la contrainte. Il faut élargir le test à Mistral ou à un autre modèle déployable sur votre infrastructure. Notre comparatif Mistral, OpenAI ou Anthropic pour une entreprise française traite cet arbitrage.
La méthode pour trancher en production
Un bon protocole tient sur une feuille. Pas besoin de trois mois de benchmark.
- Prélever 30 à 100 tâches réelles. Inclure des cas simples, des cas difficiles et des échecs déjà observés en production.
- Définir la réussite avant le test. Exactitude des champs, citations correctes, absence d'invention, respect du format, validation par un expert.
- Garder le système comparable. Même contexte, mêmes outils, même consigne et niveaux d'effort documentés. Les adaptations spécifiques viennent dans un second tour.
- Mesurer le coût complet. Tokens, outils, latence, retries, temps de relecture et nombre de tâches réellement validées.
- Tester le routage. Un petit modèle par défaut, Opus ou Sol pour les cas complexes, Fable 5.1 pour les exceptions les plus dures.
Le résultat peut être moins élégant qu'un classement unique : deux ou trois modèles derrière un routeur. C'est souvent ce qui fonctionne le mieux. Le modèle frontière n'est plus une fondation immuable ; c'est une ressource que l'on appelle quand son surcoût achète réellement de la qualité.
Questions fréquentes sur le comparatif Fable 5.1
En pratique : partez du modèle le moins cher qui atteint votre seuil de qualité, puis ajoutez Fable 5.1 comme palier d'escalade uniquement sur les cas où il améliore réellement le taux de réussite.
Pour aller plus loin
- Claude Fable 5.1 en entreprise : capacités, nouveaux tarifs de cache, sécurité et migration API.
- Claude Opus 5 pour une PME : pourquoi le palier inférieur reste le choix par défaut.
- Quel modèle GPT-5.6 choisir : Sol, Terra et Luna selon le volume et la difficulté.
- Opus 4.8 vs GPT-5.5 vs Gemini 3.1 Pro : le comparatif de la génération précédente.
- Comment évaluer un LLM en entreprise : métriques, dataset et protocole de décision.
Sources
- Anthropic — annonce et benchmarks de Fable 5.1
- Claude Platform — modèles, caractéristiques et recommandation de choix
- OpenAI Platform — caractéristiques et tarifs de GPT-5.6 Sol
- Google AI for Developers — caractéristiques de Gemini 3.1 Pro
- Google AI for Developers — tarifs Gemini API
- Artificial Analysis — Fable 5.1 à effort high
Comparer avant d'intégrer
Besoin d'un benchmark sur vos propres cas d'usage ?