Pour la plupart des usages en entreprise, Claude Sonnet 5.5 et GPT-6 Sol sont les deux modèles à tester en premier. Ils coûtent tous les deux 2 $ par million de tokens en entrée et 10 $ en sortie, cinq fois moins que Claude Fable 5.1 ou GPT-6 Astra. Claude Opus 5.5 se réserve au travail long et ouvert, quand le modèle doit décider seul de la démarche. Pour le volume (tri d'emails, extraction simple), GPT-6 Luna et Gemini 3.8 Flash font le travail pour une fraction du prix.
En quatre semaines, Anthropic, OpenAI et Google ont renouvelé leur gamme. Notre comparatif de la génération précédente, publié le 1er septembre, est déjà dépassé sur les prix. Voici le tableau à jour au 28 septembre 2026, le choix par tâche, un calcul de coût par document et la méthode pour trancher sur vos propres données.
En résumé
- ✓ Sonnet 5.5 et GPT-6 Sol (2 $ / 10 $) couvrent l'assistant interne, la rédaction, le code courant et les agents au parcours balisé.
- ✓ Opus 5.5 (4 $ / 20 $) est le palier au-dessus, pour les agents qui planifient seuls et les analyses longues.
- ✓ GPT-6 Luna (0,10 $ / 0,50 $) et Gemini 3.8 Flash (0,75 $ / 3,75 $ jusqu'au 31 décembre) traitent le volume.
- ✓ Fable 5.1 et GPT-6 Astra (10 $ / 50 $) restent des paliers d'escalade, pas des modèles par défaut.
- ✓ Les chiffres des éditeurs désignent des candidats. Un test sur 30 à 50 de vos cas réels désigne le gagnant.
Le tableau de la génération actuelle
Sept modèles comptent pour une entreprise fin septembre 2026, plus Gemini 3.1 Pro que l'on cite encore souvent. Les prix sont les tarifs API publics, en dollars par million de tokens (entrée / sortie), hors cache, batch et outils payants.
| Modèle | Sortie | Prix entrée / sortie | Positionnement | Bon pour |
|---|---|---|---|---|
| Claude Fable 5.1 | 1er sept. | 10 $ / 50 $ | Le plus puissant de la gamme Anthropic | Agents très longs, recherche et analyse difficiles, en escalade |
| GPT-6 Astra | 3 sept. | 10 $ / 50 $ | Le modèle le plus avancé d'OpenAI | Usage d'ordinateur, navigation, cybersécurité, cas les plus durs |
| Claude Opus 5.5 | 22 sept. | 4 $ / 20 $ | Remplace Opus 5, annoncé au niveau de Fable 5.1 | Agents qui planifient seuls, analyses longues, gros refactorings |
| Claude Sonnet 5.5 | 28 sept. | 2 $ / 10 $ | Milieu de gamme, très proche d'Opus 5.5 selon Anthropic | Tâches cadrées du quotidien, documents, rédaction, correction de bugs |
| GPT-6 Sol | 22 sept. | 2 $ / 10 $ | Tâches exigeantes du quotidien, dont le code | Assistant, rédaction, code, agents au parcours balisé |
| Gemini 3.8 Flash | 2 sept. | 0,75 $ / 3,75 $ puis 1,50 $ / 7,50 $ au 1er janvier 2027 |
Rapide, multimodal, contexte d'un million de tokens | PDF et images en volume, agents à faible coût |
| GPT-6 Luna | 22 sept. | 0,10 $ / 0,50 $ | Volume, tâches au but clair | Tri d'emails, extraction simple, résumés, questions rapides |
| Gemini 3.1 Pro | Preview | 2 $ / 12 $ (jusqu'à 200 000 tokens, relevé au 1er sept.) | Haut de gamme Google, encore en preview à ce relevé | Multimodal, entreprises déjà sur Google Cloud |
Trois paliers de prix se dégagent. En haut, Fable 5.1 et GPT-6 Astra à 10 $ / 50 $. Au milieu, Opus 5.5 à 4 $ / 20 $, puis Sonnet 5.5 et GPT-6 Sol à 2 $ / 10 $. En bas, Gemini 3.8 Flash et GPT-6 Luna, de 13 à 100 fois moins chers que le haut de gamme sur les tokens de sortie.
Ce qui a le plus bougé, c'est le prix du milieu de gamme. Début septembre, le modèle raisonnable par défaut coûtait 5 $ / 25 $ (Claude Opus 5) ou 4 $ / 20 $ (GPT-5.6 Sol). Il coûte aujourd'hui 2 $ / 10 $, chez Anthropic comme chez OpenAI, qui annonce une série GPT-6 deux fois moins chère que la 5.6. Côté Anthropic, Opus 5.5 baisse de 20 % au token par rapport à Opus 5 et, selon Anthropic, coûte environ 40 % de moins à l'usage pour un niveau comparable à Fable 5.1. Il remplace Opus 5 deux mois après sa sortie.
Hors tableau
Claude Haiku 5.5 est annoncé par Anthropic « dans les prochaines semaines ». DeepSeek V4.1-Flash, sorti autour du 10 septembre avec des poids ouverts sous licence MIT, intéresse surtout ceux qui veulent héberger le modèle eux-mêmes (voir DeepSeek V4.1 pour une entreprise française). Si vos données ne peuvent pas quitter une infrastructure maîtrisée, aucun modèle du tableau ne règle la question seul, et un modèle ouvert hébergé chez vous ou en France est à évaluer (voir notre offre d'IA souveraine).
Sonnet ou Opus, GPT-6 ou Claude, lequel l'emporte ?
Aucun modèle ne gagne partout. Chaque duel se tranche sur la nature de la tâche et sur l'écosystème dans lequel vous travaillez déjà.
Sonnet 5.5 ou Opus 5.5 ?
Anthropic trace lui-même la frontière. Dans son annonce de Sonnet 5.5, il le place à deux points d'Opus 5.5 sur GDPval-AA, une évaluation de travail professionnel, tout en précisant qu'Opus 5.5 reste nettement plus fort sur le travail complexe et ouvert qui demande un jugement soutenu. Sonnet 5.5 est présenté comme le plus fort sur les tâches bien cadrées du quotidien, la correction de bugs et la production de documents.
La question à se poser est donc simple. Savez-vous décrire le résultat attendu ? Si oui, prenez Sonnet 5.5, deux fois moins cher. Si le modèle doit choisir lui-même sa démarche, sur une longue session ou plusieurs dizaines d'étapes, testez Opus 5.5.
GPT-6 Sol ou Claude ?
GPT-6 Sol et Sonnet 5.5 ont exactement le même prix. OpenAI annonce pour Sol environ deux fois moins d'erreurs que son prédécesseur sur son évaluation interne de factualité, avec une fiabilité proche d'Astra. OpenAI affirme aussi que Sol et Luna font mieux que Fable et Opus. C'est une affirmation d'éditeur, rapportée par TechCrunch sans chiffres comparatifs détaillés, donc à vérifier sur vos cas.
À prix égal, ce qui départage souvent, c'est l'outillage. Si votre équipe travaille dans ChatGPT Work et Codex, ou si vos intégrations passent déjà par l'API OpenAI, Sol est le candidat naturel. Si vous êtes sur Claude, ou sur AWS, Google Cloud ou Azure avec Claude, Sonnet 5.5 et Opus 5.5 s'intègrent sans changer d'outils. Face à Opus 5.5, Sol coûte deux fois moins cher. Opposez-lui d'abord Sonnet 5.5, et Opus 5.5 seulement si Sol échoue sur vos cas difficiles.
Pour un usage quotidien dans ChatGPT ou Claude, l'écart entre ces modèles se voit moins que l'écart de pratique entre deux collaborateurs. Une équipe qui sait cadrer ses demandes tire plus de Sonnet 5.5 qu'une équipe qui pose des questions vagues à Opus 5.5, d'où notre formation Claude en intra.
Gemini 3.1 Pro face à Opus 5.5 ?
La question revient parce que Gemini 3.1 Pro coûte moins cher qu'Opus 5.5 au token (2 $ / 12 $ contre 4 $ / 20 $). Elle a pourtant perdu de son intérêt. Gemini 3.1 Pro était déjà nettement derrière Opus 5 sur l'indice d'Artificial Analysis cité dans notre comparatif du 1er septembre (48 contre 61 à effort élevé), il était encore en preview, et il coûte désormais plus cher en sortie que Sonnet 5.5 ou GPT-6 Sol.
Pour un agent long et complexe, testez Opus 5.5 en premier. Si vous êtes chez Google Cloud, le duel utile est plutôt Gemini 3.8 Flash, qui lit nativement PDF, images, audio et vidéo, contre Sonnet 5.5 ou GPT-6 Sol.
Quel modèle pour quelle tâche d'entreprise ?
Le bon modèle est le moins cher qui atteint votre seuil de qualité sur votre tâche. C'est la logique détaillée dans notre article sur le choix d'un modèle pour automatiser. Voici les points de départ que nous testons en premier, et le signal qui justifie de monter d'un palier.
| Tâche | Point de départ | Palier supérieur | Quand monter |
|---|---|---|---|
| Extraction de documents | Gemini 3.8 Flash ou GPT-6 Luna | Sonnet 5.5 ou GPT-6 Sol | Mises en page très variées, champs à interpréter |
| Tri d'emails | GPT-6 Luna | Sonnet 5.5 ou GPT-6 Sol | Plusieurs demandes par email, long historique, réponse à rédiger |
| Assistant interne sur documents | Sonnet 5.5 ou GPT-6 Sol | Opus 5.5 | Questions qui croisent plusieurs documents |
| Rédaction | Sonnet 5.5 | Opus 5.5 | Documents longs où le fond compte autant que la forme |
| Agent multi-étapes connecté aux outils | Sonnet 5.5 ou GPT-6 Sol si le parcours est balisé, Opus 5.5 sinon | Fable 5.1 ou GPT-6 Astra | Échecs répétés et mesurés sur les dossiers longs |
| Code | Sonnet 5.5 ou GPT-6 Sol | Opus 5.5, puis Fable 5.1 ou Astra | Refactoring large, migration, incident difficile |
Extraction de documents. Factures, bons de commande, attestations, relevés. Le format de sortie est fixe et la marge d'interprétation faible. Commencez par Gemini 3.8 Flash si vos documents arrivent en PDF scannés ou en photos, et par GPT-6 Luna si le texte est déjà extrait proprement. Montez à Sonnet 5.5 ou Sol quand les mises en page varient beaucoup (dix fournisseurs, dix modèles de facture) ou quand un champ demande de l'interprétation, comme une clause de révision de prix. Notre retour sur l'extraction de factures avec Gemini 3.8 Flash détaille ce cas, et nos projets d'extraction de documents par IA mesurent la précision avant la mise en production.
Tri d'emails. Classer un email entrant, identifier le client, sortir le motif, router vers le bon service. GPT-6 Luna suffit dans la plupart des cas, et OpenAI le positionne précisément sur ces tâches au but clair. Montez d'un palier pour les emails qui mélangent plusieurs demandes ou s'appuient sur un long historique, ou quand l'étape suivante est de rédiger la réponse. Sur ce cas, ce qui demande le plus de travail, c'est la connexion au CRM et la règle d'escalade vers un humain, ce que nous construisons dans nos projets d'automatisation des emails entrants.
Assistant interne sur vos documents. Un assistant qui répond à partir de vos procédures, contrats ou fiches techniques. Sonnet 5.5 est notre premier choix, pour son coût et pour sa rédaction plus claire, un des progrès mis en avant par Anthropic. GPT-6 Sol est l'équivalent chez OpenAI, au même prix. Opus 5.5 ne se justifie que si les questions demandent de croiser plusieurs documents et de raisonner, comme comparer deux versions d'un contrat. La qualité dépend d'abord de la recherche des bons passages, comme le montrent les erreurs les plus fréquentes d'un projet RAG.
Rédaction. Réponses clients, comptes rendus, propositions commerciales, notes internes. Sonnet 5.5 par défaut. Luna peut suffire pour des textes courts et très cadrés, comme un accusé de réception ou une relance. Opus 5.5 vaut son prix sur les documents longs où le fond compte, un mémoire technique ou la synthèse de plusieurs dizaines de pages.
Agent multi-étapes connecté à vos outils. Un agent qui lit un dossier, interroge l'ERP, met à jour le CRM et prépare un livrable. Tout dépend du parcours. S'il est balisé, avec des étapes connues et des outils bien définis, Sonnet 5.5 ou GPT-6 Sol suffisent souvent. Si l'agent doit planifier lui-même et tenir sur une longue session, commencez par Opus 5.5. Fable 5.1 et Astra servent de palier d'escalade quand Opus échoue de façon répétée et mesurée. Un routeur hybride qui n'envoie au modèle cher que les dossiers difficiles coûte souvent bien moins qu'un modèle haut de gamme partout. C'est l'approche de nos agents IA sur mesure.
Code. Pour la correction de bugs et les évolutions courantes, Sonnet 5.5, qu'Anthropic présente comme fort sur ce terrain, ou GPT-6 Sol si votre équipe travaille dans Codex. Opus 5.5 pour les refactorings larges et les migrations. Fable 5.1 et Astra pour les investigations les plus dures, quand l'heure d'un développeur senior coûte plus que la facture API.
Vous hésitez entre deux modèles pour votre cas précis ?
On fait passer Sonnet 5.5, GPT-6 Sol et un modèle léger sur 30 à 50 de vos vrais documents, emails ou questions, à prompt identique. Vous voyez la qualité, le coût par tâche et la latence de chacun avant de choisir.
Combien coûte une tâche, modèle par modèle ?
Le prix au million de tokens ne dit rien tant qu'on ne le ramène pas à une tâche. Prenons un cas courant, l'extraction de données d'un document, avec des hypothèses volontairement simples.
- Un document de 3 000 tokens en entrée, consigne comprise.
- Une réponse structurée de 500 tokens en sortie.
- 10 000 documents par mois.
- Ni cache, ni batch, ni tokens de raisonnement, ni nouvelle tentative.
Le calcul pour Sonnet 5.5
- Entrée, 3 000 × 2 $ / 1 000 000 = 0,006 $
- Sortie, 500 × 10 $ / 1 000 000 = 0,005 $
- Total, 0,011 $ par document, soit 0,011 × 10 000 = 110 $ par mois
Le même calcul pour chaque modèle donne ce tableau.
| Modèle | Entrée par document | Sortie par document | Coût par document | 10 000 documents par mois |
|---|---|---|---|---|
| Fable 5.1 ou GPT-6 Astra | 0,030 $ | 0,025 $ | 0,055 $ | 550 $ |
| Opus 5.5 | 0,012 $ | 0,010 $ | 0,022 $ | 220 $ |
| Sonnet 5.5 ou GPT-6 Sol | 0,006 $ | 0,005 $ | 0,011 $ | 110 $ |
| Gemini 3.8 Flash (jusqu'au 31 décembre 2026) | 0,00225 $ | 0,001875 $ | 0,004125 $ | 41,25 $ |
| Gemini 3.8 Flash (à partir du 1er janvier 2027) | 0,0045 $ | 0,00375 $ | 0,00825 $ | 82,50 $ |
| GPT-6 Luna | 0,0003 $ | 0,00025 $ | 0,00055 $ | 5,50 $ |
Sur ce cas, passer de Fable 5.1 à Sonnet 5.5 divise la facture par cinq, et passer de Sonnet 5.5 à Luna la divise encore par vingt. En production, trois effets font dévier ce calcul.
Le raisonnement. Les tokens de réflexion sont en général facturés au tarif de sortie. Si le modèle réfléchit 2 000 tokens avant de répondre, la sortie passe de 500 à 2 500 tokens. Sonnet 5.5 coûte alors 0,006 $ + 0,025 $ = 0,031 $ par document, soit 310 $ par mois, près de trois fois plus. Sur une extraction simple, un effort de raisonnement bas suffit souvent. Gemini 3.8 Flash, de son côté, consomme plus de tokens que la version 3.7 pour un tarif unitaire identique, comme le détaille notre analyse prix et performances de Gemini 3.8 Flash.
Le cache. Si 2 000 des 3 000 tokens d'entrée sont une consigne fixe relue depuis le cache à 0,20 $ par million, l'entrée de Sonnet 5.5 tombe à 0,0004 $ + 0,002 $ = 0,0024 $. Le document revient à 0,0074 $, soit 74 $ par mois au lieu de 110 $. L'écriture du cache, facturée 2,50 $ par million pour Sonnet 5.5, se paie à chaque renouvellement et pèse peu sur un flux continu.
Les erreurs. C'est souvent le poste le plus lourd. Supposons, à titre d'illustration, qu'un modèle léger se trompe sur 10 % des documents et un modèle intermédiaire sur 3 %. Sur 10 000 documents, cela fait 700 corrections de plus chaque mois. À deux minutes la correction, 23 heures de travail humain, pour une économie d'API d'environ 105 $. Si l'écart n'est que de 0,5 point, soit 50 corrections et moins de deux heures par mois, Luna reprend l'avantage. La métrique qui compte est le coût par tâche validée, pas le prix au token. Nous développons ce raisonnement pour les gros volumes dans le coût d'une automatisation avec GPT-6 Luna et Gemini 3.8 Flash.
Ce que les annonces ne disent pas
Chaque éditeur publie des résultats mesurés sur ses propres protocoles. Ils servent à choisir quels modèles tester, pas lequel mettre en production.
OpenAI affirme que GPT-6 Sol et Luna font mieux que Fable et Opus. Anthropic place Opus 5.5 au niveau de Fable 5.1. Ces affirmations peuvent être vraies sur les tests retenus par chaque éditeur et fausses sur votre tâche. Les harnais, les consignes et les niveaux d'effort diffèrent d'un laboratoire à l'autre, et aucun ne teste vos factures, vos emails ou votre vocabulaire métier.
Le critère le plus souvent oublié est le respect du format. Un modèle plus capable qui ajoute une phrase avant le JSON attendu casse une intégration que l'ancien modèle respectait. Sur un tableau de benchmark, cet écart n'apparaît nulle part.
La méthode pour comparer sur vos données
- Constituer 30 à 50 cas réels. Des cas simples, des cas difficiles et les erreurs déjà observées en production, chacun avec la bonne réponse attendue, validée par quelqu'un du métier.
- Fixer le seuil avant le test. Par exemple 95 % des champs exacts, aucun montant inventé, un JSON valide à chaque appel. Un seuil fixé après coup finit par s'ajuster au modèle qu'on préfère.
- Garder un prompt identique. Même consigne, mêmes documents, mêmes outils, niveau d'effort noté. On n'adapte le prompt à un modèle qu'au second tour, une fois le classement brut connu.
- Mesurer quatre choses. La qualité (exactitude champ par champ, ou réponse juste et sourcée), le coût réel par tâche à partir des tokens consommés, la latence (temps médian et pire cas) et le respect du format de sortie.
- Retenir le moins cher qui passe le seuil. Les cas limites qu'il rate peuvent être routés vers le palier au-dessus.
Le plus long est de constituer les cas et leurs réponses attendues. Le passage des modèles, lui, s'automatise et se relance à chaque nouvelle sortie. Les métriques à suivre sont détaillées dans notre guide pour évaluer un LLM en entreprise et, pour un assistant sur documents, dans cet article sur l'évaluation d'un RAG en production.
Faut-il migrer maintenant ?
Oui si un test sur vos cas montre un gain, non par réflexe. La réponse dépend surtout du modèle sur lequel vous tournez aujourd'hui.
| Vous tournez sur | À tester | Pourquoi maintenant |
|---|---|---|
| Claude Opus 5 | Opus 5.5, et Sonnet 5.5 en parallèle | Opus 5.5 remplace Opus 5 pour 20 % de moins au token, et Sonnet 5.5 coûte 2,5 fois moins qu'Opus 5 |
| Claude Sonnet 5 | Sonnet 5.5 | Même prix, plus de 30 % plus rapide et jusqu'à 30 % de coût en moins par tâche selon Anthropic |
| GPT-5.6 Sol ou Terra | GPT-6 Sol | Sol passe de 4 $ / 20 $ à 2 $ / 10 $, moins cher que Terra à son lancement, et la série GPT-6 n'a pas de palier Terra |
| GPT-5.6 Luna | GPT-6 Luna | Prix divisé par deux environ, 12 $ contre 5,50 $ par mois dans notre exemple |
| Fable 5.1 ou GPT-6 Astra | Opus 5.5 et GPT-6 Sol | 550 $ par mois contre 220 $ ou 110 $ dans notre exemple, si la qualité tient |
| Gemini 3.8 Flash | GPT-6 Luna, avant décembre | Le tarif double le 1er janvier 2027, de 41,25 $ à 82,50 $ par mois dans notre exemple |
Le test sur votre jeu d'évaluation vient toujours en premier. Un prompt calibré pour Opus 5 ou GPT-5.6 peut se comporter autrement sur la nouvelle version, même meilleure en moyenne, en particulier sur le format de sortie. Faites ensuite tourner le nouveau modèle en parallèle sur le trafic réel pendant quelques jours, sans utiliser ses réponses, et comparez. Gardez enfin l'ancien modèle en configuration de secours tant que le fournisseur le maintient.
Le rythme des sorties plaide pour une architecture où le modèle est un simple paramètre. Opus 5 a été remplacé deux mois après sa sortie. Si changer de modèle vous oblige à reprendre l'application, c'est ce point à traiter avant toute migration, comme l'explique notre guide de déploiement d'un LLM en production.
Vous n'avez encore rien en production ? N'attendez pas le prochain modèle. Entre deux modèles du même palier, l'écart est faible comparé à celui qui sépare un cas d'usage bien choisi d'un cas mal choisi. Commencez par identifier une à trois tâches qui se prêtent à l'IA et vérifiez leur faisabilité sur vos données, c'est l'objet de notre diagnostic flash IA en une semaine. Le choix du modèle vient à la fin, sur vos propres cas.
Votre système IA tourne sur Opus 5, GPT-5.6 ou Gemini 3.8 Flash ?
On rejoue vos vrais cas sur Opus 5.5, Sonnet 5.5 ou GPT-6, à prompt identique, et on ne migre que si le gain de qualité ou de coût est mesuré. Votre production reste en place pendant le test.
Questions fréquentes sur le comparatif Sonnet 5.5, Opus 5.5 et GPT-6
En pratique, partez de Sonnet 5.5 ou GPT-6 Sol pour le travail courant, de Luna ou Gemini 3.8 Flash pour le volume, et ne montez vers Opus 5.5, puis Fable 5.1 ou Astra, que sur les cas où vos propres tests montrent un gain.
Pour aller plus loin
- Fable 5.1 vs Opus 5, GPT-5.6 Sol et Gemini 3.1 Pro, le comparatif de la génération précédente.
- Claude Sonnet 5.5 en entreprise, ce que change le nouveau milieu de gamme d'Anthropic.
- Claude Opus 5.5 en entreprise, le remplaçant d'Opus 5 et sa baisse de prix.
- GPT-6 Sol ou Luna, quel palier OpenAI pour quel usage.
- GPT-6 Astra en entreprise, le haut de gamme d'OpenAI et ses cas d'usage.
- Automatiser à gros volume avec GPT-6 Luna ou Gemini 3.8 Flash, le coût réel.
- DeepSeek V4.1 en France, l'option à poids ouverts.
- Quel modèle d'IA choisir pour l'automatisation, la méthode du plus petit modèle qui passe la barre.
Sources