GPT-6 Astra, dévoilé par OpenAI le 3 septembre 2026, coûte 10 $ par million de tokens en entrée et 50 $ en sortie. C'est exactement le tarif de Claude Fable 5.1, sorti deux jours plus tôt. Ce prix se justifie quand le coût d'une erreur dépasse largement le coût des tokens et que la tâche demande vraiment du raisonnement long ou de l'usage d'ordinateur, par exemple un agent qui navigue et agit dans vos logiciels, une analyse complexe ou du code.
Pour de l'extraction de documents, du tri d'emails, de la rédaction cadrée ou un assistant documentaire, c'est surpayer. GPT-5.6 Sol, Claude Opus 5 ou Gemini 3.8 Flash font ce travail pour deux à treize fois moins cher par token. Cet article donne la règle de calcul, deux exemples chiffrés et ce que change pour vous le classement « critique » d'Astra en cybersécurité.
En résumé
- ✓ Sortie : 3 septembre 2026 en aperçu limité, puis ChatGPT (Plus, Pro, Business, Enterprise), API et AWS dans les jours suivants.
- ✓ Prix API : 10 $ / 50 $ par million de tokens, entrée en cache à 1 $, batch à moitié prix, mode Fast au double.
- ✓ Terrain fort : usage d'ordinateur, navigation, développement logiciel, travail professionnel long.
- ✓ La règle : Astra se paie quand l'écart d'erreurs multiplié par le coût d'une erreur dépasse le surcoût de tokens.
- ✓ Cybersécurité : premier modèle OpenAI classé « critique », avec des usages offensifs bridés et des accès à encadrer chez vous.
Ce qu'OpenAI a annoncé le 3 septembre
GPT-6 Astra est présenté par OpenAI comme son modèle le plus intelligent. L'éditeur revendique l'état de l'art sur l'usage d'ordinateur, la navigation web, le développement logiciel, la cybersécurité, les sciences et le travail professionnel. Il passe au-dessus de GPT-5.6 Sol, qui était jusqu'ici le haut de la gamme.
Le lancement se fait en aperçu limité le 3 septembre 2026, avec un déploiement annoncé dans les jours suivants dans ChatGPT Plus, Pro, Business et Enterprise, dans l'API et sur AWS. Les détails sont dans l'annonce officielle d'OpenAI. Le 2 septembre, Astra n'avait encore ni date ni prix, comme nous l'écrivions dans notre comparatif Gemini 3.8 Flash, Fable 5.1, Muse et Astra. C'est désormais un modèle qu'on peut tester et budgéter.
| Tarif API GPT-6 Astra | Prix par million de tokens |
|---|---|
| Entrée standard | 10 $ |
| Entrée en cache | 1 $ |
| Sortie | 50 $ |
| Batch (traitement différé) | Moitié prix, soit 5 $ / 25 $ |
| Mode Fast | Tarif doublé |
Côté performances, OpenAI met en avant les agents. Sur Terminal-Bench 4.0, un test de tâches en ligne de commande, Astra obtiendrait 57,9 % contre 37,3 % pour GPT-5.6 Sol. OpenAI annonce aussi des progrès nets sur l'usage d'un ordinateur, avec des tâches accomplies en moins d'étapes. Ce sont des chiffres communiqués par OpenAI, mesurés dans son propre harnais. Elles indiquent une direction, pas le résultat que vous obtiendrez sur vos tâches.
Astra face aux modèles disponibles au 3 septembre
| Modèle | Prix (entrée / sortie, par M tokens) | Écart avec Astra en sortie | Position utile |
|---|---|---|---|
| GPT-6 Astra | 10 $ / 50 $ | Référence | Usage d'ordinateur, agents, code, analyse longue |
| Claude Fable 5.1 | 10 $ / 50 $ | Même prix | Agents longue durée, code, recherche multi-étapes |
| Claude Opus 5 | 5 $ / 25 $ | 2 fois moins cher | Point de départ recommandé par Anthropic pour la plupart des usages |
| GPT-5.6 Sol | 4 $ / 20 $ (tarif promotionnel depuis le 21 août) | 2,5 fois moins cher | Tâches exigeantes, agents multi-étapes |
| Gemini 3.8 Flash | 0,75 $ / 3,75 $ (jusqu'au 31 décembre 2026) | Plus de 13 fois moins cher | Volume, extraction, multimodal, sortie JSON |
Le tarif de Sol vient de la baisse de prix de GPT-5.6 Sol fin août. Celui de Gemini 3.8 Flash double au 1er janvier 2027, comme le détaille notre article sur les prix et performances de Gemini 3.8 Flash. Même après cette hausse, l'écart avec Astra reste de l'ordre de un à sept.
Quand le modèle le plus puissant vaut-il son prix ?
Un modèle plus cher se rembourse uniquement par les erreurs qu'il évite. La question utile n'est donc pas « Astra est-il meilleur ? », mais « combien me coûte une erreur, et combien Astra en évite sur ma tâche ? ».
La règle de calcul
Le modèle le plus cher est rentable quand l'écart de taux d'erreur, multiplié par le coût d'une erreur, dépasse le surcoût de tokens par tâche. Divisez le surcoût par tâche par l'écart de taux d'erreur, et vous obtenez le coût minimal d'une erreur à partir duquel Astra se paie.
Premier exemple, un agent qui saisit des commandes dans l'ERP
Prenons un agent qui reçoit une demande d'achat, vérifie le contrat-cadre et le stock, puis crée la commande dans l'ERP. Chaque dossier consomme, disons, 60 000 tokens en entrée (consignes, pièces lues, historique des étapes) et 8 000 tokens en sortie (raisonnement et actions). On garde tout en dollars pour simplifier.
| Poste | GPT-5.6 Sol (4 $ / 20 $) | GPT-6 Astra (10 $ / 50 $) |
|---|---|---|
| 60 000 tokens en entrée | 0,24 $ | 0,60 $ |
| 8 000 tokens en sortie | 0,16 $ | 0,40 $ |
| Coût par dossier | 0,40 $ | 1,00 $ |
| 2 000 dossiers par mois | 800 $ | 2 000 $ |
Le surcoût d'Astra est de 0,60 $ par dossier, soit 1 200 $ par mois. Supposons maintenant qu'Astra fasse passer le taux d'erreur de 5 % à 3 %. Sur 2 000 dossiers, cela fait 40 erreurs évitées par mois. Le seuil de rentabilité est donc de 1 200 $ divisés par 40, soit 30 $ par erreur évitée.
- Si une erreur est une commande fausse envoyée au fournisseur, avec retour, avoir, relances et parfois un retard de production, elle coûte bien plus que 30 $. Astra se paie largement.
- Si l'agent prépare seulement un brouillon qu'un acheteur relit et corrige en deux minutes, l'erreur coûte quelques dollars. Quarante erreurs à 3 $ font 120 $ d'économie pour 1 200 $ de surcoût. Vous payez dix fois trop.
Le même agent, sur la même tâche, justifie ou non Astra selon la façon dont il est intégré. La validation humaine baisse le coût d'une erreur, donc l'intérêt du modèle le plus cher. Les taux d'erreur de cet exemple sont des hypothèses d'illustration. Le seul moyen de connaître l'écart réel est de faire passer les deux modèles sur vos propres dossiers.
Second exemple, 30 000 factures à extraire chaque mois
Une extraction de facture consomme environ 3 000 tokens en entrée et 500 en sortie. Sur Astra, cela fait 0,055 $ par facture, soit 1 650 $ par mois pour 30 000 factures. Sur Gemini 3.8 Flash, au tarif de lancement, on tombe à environ 0,004 $ par facture, soit près de 124 $ par mois.
Plus de 1 500 $ d'écart mensuel, pour quel gain ? L'extraction de dix champs sur une facture est une tâche cadrée. Les erreurs résiduelles sont interceptées par des contrôles déterministes (HT plus TVA égale TTC, rapprochement avec le référentiel fournisseurs, détection des doublons), quel que soit le modèle. C'est ce que nous détaillons dans l'extraction de factures avec Gemini 3.8 Flash vers un CRM. Ici, Astra est un surcoût sans contrepartie.
Deux effets peuvent déplacer ces calculs. Les tokens de raisonnement sont en général facturés comme de la sortie, donc un modèle qui réfléchit plus longtemps coûte plus que ne le laisse penser son prix unitaire. À l'inverse, un agent qui relit le même contexte bénéficie du cache, à 1 $ par million de tokens chez Astra. Mesurez sur une trace réelle, pas sur une estimation.
Où Astra a sa place, et où c'est surpayer
Astra se justifie sur les tâches longues où une erreur à une étape fait échouer toute la chaîne, et où cette erreur coûte cher. Sur les tâches courtes et cadrées, un modèle intermédiaire atteint déjà le niveau attendu.
| Usage | Astra justifié ? | Pourquoi |
|---|---|---|
| Agent qui agit dans un logiciel sans API | Candidat sérieux | Usage d'ordinateur, longues séquences d'actions, erreurs coûteuses |
| Analyse croisant contrat, avenants, factures et emails | Oui si l'enjeu est élevé | Raisonnement long sur des sources hétérogènes |
| Code : migration, investigation d'incident | Oui, en escalade | Tâches multi-fichiers où le modèle doit garder le fil |
| Extraction de factures, bons de commande | Non | Tâche cadrée, erreurs rattrapées par des contrôles |
| Tri et routage d'emails | Non | Classification courte, fort volume |
| Rédaction cadrée (réponses types, comptes rendus) | Non | Format fixe, relecture humaine |
| Assistant documentaire (RAG) | Rarement | La qualité dépend surtout de la recherche dans vos documents |
Ce que l'usage d'ordinateur permet dans une PME
Beaucoup de logiciels métier n'ont pas d'API exploitable. Un portail fournisseur, l'extranet d'un assureur, un ERP ancien ou un site administratif se pilotent à la souris. Un agent qui voit l'écran, clique et saisit peut traiter ces tâches sans développement côté éditeur. C'est le point fort annoncé d'Astra.
C'est aussi le terrain où la fiabilité par étape pèse le plus. Une tâche de 30 actions réussie à 98 % à chaque étape aboutit environ une fois sur deux (0,98 puissance 30, soit 55 %). À 99,5 % par étape, on passe à environ 86 %. Quelques points de fiabilité par étape comptent donc bien plus sur un agent long que sur une extraction en une seule étape.
L'usage d'ordinateur reste plus lent et plus fragile qu'un appel d'API. Quand une API existe, on la préfère, via des outils bien définis ou le protocole MCP. Un agent qui navigue lit aussi du contenu qu'il ne maîtrise pas, et une page peut contenir des instructions malveillantes. Les principes pour s'en protéger sont les mêmes que pour sécuriser un RAG contre l'injection de prompt. C'est pour cela que nos agents IA sur mesure partent d'une tâche précise, avec des droits limités à cette tâche et une validation humaine sur les actions qui engagent l'entreprise.
Vous envisagez un agent qui agit dans vos logiciels ?
On part d'une tâche précise : ce que l'agent a le droit de faire, ce qu'il soumet à validation, comment on mesure ses erreurs. Le modèle se choisit ensuite, sur vos cas.
Astra ou Claude Fable 5.1, au même prix ?
À prix affiché identique, Astra et Fable 5.1 se départagent sur votre tâche et votre environnement, pas sur un classement. Les deux éditeurs publient des scores proches sur les agents.
Sur Terminal-Bench 4.0, OpenAI annonce 57,9 % pour Astra, et Anthropic annonçait 55,8 % pour Fable 5.1 deux jours plus tôt. Deux points d'écart entre deux protocoles différents ne départagent rien. Côté mesures indépendantes, Fable 5.1 a déjà été évalué comme plus discipliné sur les tâches difficiles, mais lent. Pour Astra, le jour de l'annonce, on dispose surtout des chiffres d'OpenAI.
Trois différences pèsent davantage sur la facture et sur l'intégration.
- Le cache. Fable 5.1 facture la relecture du cache 0,25 $ par million de tokens, Astra facture l'entrée en cache 1 $. Sur un agent qui relit des centaines de milliers de tokens de contexte à chaque étape, l'écart se voit sur la facture.
- La vitesse. Astra propose un mode Fast au tarif doublé. Utile si un utilisateur attend la réponse, inutile pour un traitement de nuit, où le batch à moitié prix est plus pertinent.
- L'écosystème. Vos contrats cloud, la région de traitement des données, les outils que l'agent doit appeler et l'éditeur que vos équipes utilisent déjà pèsent souvent plus que deux points de benchmark.
Les deux modèles sont d'abord des modèles d'escalade. Anthropic recommande lui-même Claude Opus 5 pour la majorité des usages. Côté OpenAI, la logique équivalente consiste à laisser GPT-5.6 Sol traiter le flux courant et à réserver Astra aux cas où Sol échoue. Notre article sur le routeur hybride entre modèles rapides et modèles puissants décrit cette architecture. Pour situer l'ensemble des modèles frontière, voir aussi notre comparatif Fable 5.1, Opus 5, GPT-5.6 Sol et Gemini 3.1 Pro.
Le classement « critique » en cybersécurité, qu'est-ce que ça change pour vous ?
Astra est le premier modèle qu'OpenAI classe au seuil « critique » en cybersécurité dans son cadre d'évaluation des risques (Preparedness Framework). Selon OpenAI, le modèle peut, dans certaines conditions, découvrir et exploiter de façon autonome des vulnérabilités jusque-là inconnues, comme le rapportent CNBC et CSO Online.
La conséquence côté OpenAI est un accès gradué. La version publique refuse les tâches offensives avancées, comme produire un exploit fonctionnel. Les capacités les plus poussées sont réservées à des défenseurs vérifiés, via le programme Daybreak, avec un élargissement progressif.
Pour trier des factures ou répondre sur une base documentaire, ce classement ne change rien à votre quotidien. Il porte sur la capacité du modèle à agir sur des systèmes informatiques, précisément ce qu'on attend d'un agent. Le cadre à poser ressemble à celui d'un prestataire à qui l'on ouvre un accès.
- Des accès contrôlés. Une clé API par projet, jamais partagée, et une liste claire des personnes qui peuvent lancer un agent capable d'agir sur un poste ou un navigateur.
- Le moindre privilège pour l'agent. Un compte dédié, des droits limités à la tâche, un environnement isolé (navigateur ou machine virtuelle dédiée), sans accès aux comptes d'administration.
- Une trace de chaque action. Chaque clic, saisie ou appel d'outil est journalisé, pour comprendre une erreur et la corriger.
- Une validation humaine sur l'irréversible. Paiement, suppression, envoi vers l'extérieur, modification de droits. Notre article sur ce qui se passe quand une automatisation se trompe détaille les mécanismes de mise en attente et de reprise.
- Des refus possibles sur des usages légitimes. Un audit de sécurité de votre propre code ou l'analyse d'une attaque peuvent être bloqués par les garde-fous. Prévoyez un modèle de repli ou une procédure pour ces cas.
Côté données, les questions restent les mêmes qu'avec tout fournisseur d'API : contrat de traitement, région, durée de conservation, sous-traitants. Notre checklist sécurité, RGPD et souveraineté liste les points à vérifier avant d'envoyer des données sensibles.
Comment décider sans surpayer ?
La décision se prend sur une vingtaine à une cinquantaine de cas réels, pas sur une annonce. Le protocole tient en quatre étapes.
- Chiffrer le coût d'une erreur sur la tâche visée, en temps de reprise et en conséquences (litige, retard, client perdu). C'est le chiffre qui manque le plus souvent.
- Sélectionner les cas difficiles : ceux où votre modèle actuel échoue, hésite ou demande une relecture lourde.
- Rejouer les mêmes cas sur le modèle en place et sur Astra, à prompt et données identiques. Mesurer le coût par tâche réussie, les erreurs critiques et la latence de bout en bout. Notre guide pour évaluer un LLM en entreprise détaille les métriques.
- Router plutôt que migrer. Si Astra gagne sur les cas difficiles, on l'utilise pour ces cas, et le flux courant reste sur un modèle moins cher.
Un agent qui consomme trop, boucle ou dérape ne se corrige presque jamais en changeant de modèle. Les causes habituelles sont une trajectoire mal bornée, un outil mal décrit ou un contexte qui gonfle à chaque étape, comme nous le montrons dans notre article sur l'agent IA qui boucle ou dérape. Passer ce même agent sur Astra multiplie surtout la facture.
Point terrain Tensoria
Sur les agents qu'on met en production, les incidents viennent rarement d'un manque d'intelligence du modèle. Ils viennent d'un droit d'écriture trop large, d'un cas que personne n'avait prévu ou d'une étape sans validation. Un modèle plus puissant réduit certaines erreurs, il ne remplace ni les permissions ni les contrôles.
Votre agent ou votre automatisation tourne déjà sur Sol, Opus ou Fable ?
On fait passer Astra sur vos vrais cas, à prompt identique, et vous voyez l'écart de qualité et de coût par tâche réussie avant de toucher à la production.
Ce qui a bougé depuis le 3 septembre
Le 22 septembre 2026, OpenAI a sorti GPT-6 Sol (2 $ / 10 $ par million de tokens) et GPT-6 Luna (0,10 $ / 0,50 $), comme le rapporte TechCrunch. OpenAI annonce pour GPT-6 Sol environ deux fois moins d'erreurs que son prédécesseur et une fiabilité proche d'Astra, pour un prix cinq fois inférieur. C'est une affirmation d'éditeur, à vérifier sur vos cas. Nous comparons les deux dans quel modèle GPT-6 choisir, Sol ou Luna.
Le même jour, Anthropic a sorti Claude Opus 5.5 à 4 $ / 20 $, qu'il place au niveau de Fable 5.1 pour bien moins cher (détails dans notre article sur Claude Opus 5.5 en entreprise). Le 28 septembre, Claude Sonnet 5.5 est arrivé à 2 $ / 10 $.
Reprenons l'exemple de l'agent de commandes. Avec GPT-6 Sol, un dossier coûte 0,20 $ au lieu de 0,40 $. Le surcoût d'Astra monte à 0,80 $ par dossier. Et si GPT-6 Sol ne laisse plus qu'un point d'écart d'erreurs au lieu de deux, le seuil de rentabilité passe de 30 $ à 80 $ par erreur évitée. Pour la plupart des usages, l'argument pour Astra se réduit encore. Il reste pertinent sur les tâches longues, rares et coûteuses en cas d'erreur, et vos tests doivent le montrer.
Pour la vue d'ensemble de cette nouvelle génération, lisez notre comparatif Sonnet 5.5, Opus 5.5, GPT-6 Sol et Gemini 3.8. Si votre projet est un agent qui agit dans vos outils, notre article sur connecter un agent IA à votre logiciel, par API ou MCP détaille les permissions et la validation humaine à prévoir.
Pour aller plus loin
- Le modèle Anthropic au même tarif : ce que Claude Fable 5.1 change pour une entreprise.
- La logique de choix par tâche : quel modèle d'IA choisir pour automatiser.
- Les paliers de la génération précédente : GPT-5.6 Sol, Terra ou Luna.
- Le panorama des agents en entreprise : notre guide des agents IA.