GPT-6 Luna, sorti le 22 septembre 2026, coûte 0,10 $ par million de tokens en entrée et 0,50 $ en sortie. Pour trier et extraire 10 000 emails entrants par mois, cela représente environ 6 $ de facture API selon nos hypothèses. Le même travail coûte 45 $ avec Gemini 3.8 Flash au tarif de lancement, 90 $ à partir du 1er janvier 2027, et 240 $ avec Claude Opus 5.5.
À ces montants, le prix du modèle pèse peu dans le coût d'une automatisation à gros volume. Ce qui coûte le plus cher, ce sont les emails et les documents renvoyés à un humain, les erreurs qui passent sans être vues, l'intégration au CRM ou à l'ERP et la maintenance. La règle de choix en découle : le modèle le moins cher qui tient la précision attendue, mesurée sur vos propres documents.
Ci-dessous, deux cas chiffrés avec leurs hypothèses, cinq modèles comparés et les pièges de facturation à connaître avant de choisir.
En résumé
- ✓ GPT-6 Luna est le moins cher des cinq modèles comparés : environ 6 $ par mois pour 10 000 emails, 5,50 $ pour 5 000 factures, selon nos hypothèses.
- ✓ Gemini 3.8 Flash coûte 7,5 fois plus que Luna au tarif de lancement, et 15 fois plus après le doublement du 1er janvier 2027.
- ✓ Même Claude Opus 5.5, le plus cher du comparatif, reste sous 250 $ par mois sur ces volumes.
- ✓ Un email repris à la main coûte autant que des milliers d'emails traités par l'API : le taux de reprise pèse plus que le prix du token.
- ✓ On retient le modèle le moins cher qui tient la précision mesurée sur vos documents, dans une architecture où il reste interchangeable.
Combien coûtent GPT-6 Luna, Gemini 3.8 Flash et les autres ?
Au 24 septembre 2026, cinq modèles sont sur la table pour une automatisation à fort volume. Deux sont conçus pour le volume : GPT-6 Luna et Gemini 3.8 Flash. DeepSeek V4.1-Flash est l'option la moins chère hors OpenAI. GPT-6 Sol et Claude Opus 5.5 servent ici de repère haut de gamme, pour mesurer l'écart.
| Modèle | Sortie | Prix entrée / sortie (par million de tokens) | Positionnement |
|---|---|---|---|
| GPT-6 Luna | 22 septembre 2026 | 0,10 $ / 0,50 $ (entrée en cache : 0,01 $) | Volume, tâches au but clair : résumer, extraire, répondre vite |
| DeepSeek V4.1-Flash | Autour du 10 septembre 2026 | 0,15 $ / 0,60 $ en heures creuses, 0,30 $ / 1,20 $ en heures pleines | Poids ouverts sous licence MIT, contexte d'un million de tokens |
| Gemini 3.8 Flash | 2 septembre 2026 | 0,75 $ / 3,75 $ jusqu'au 31 décembre 2026, puis 1,50 $ / 7,50 $ | Multimodal, PDF en entrée native, raisonnement réglable |
| GPT-6 Sol | 22 septembre 2026 | 2 $ / 10 $ | Tâches exigeantes du quotidien, dont le code |
| Claude Opus 5.5 | 22 septembre 2026 | 4 $ / 20 $ (lecture de cache : 0,20 $) | Haut de gamme Anthropic, remplace Opus 5 |
OpenAI destine Luna aux tâches à fort volume au but clair : résumer des documents, extraire des informations, répondre à des questions rapides, d'après TechCrunch. Fin juillet, GPT-5.6 Luna était encore facturé 0,20 $ / 1,20 $ (voir notre article sur la baisse de prix de GPT-Sol). Opus 5.5, lui, baisse de 20 % par rapport à Opus 5, selon BetaNews.
Pour le détail de chaque modèle, voir nos articles GPT-6 Sol ou Luna, Gemini 3.8 Flash, prix et performances et Claude Opus 5.5 en entreprise. Ici, on multiplie ces prix par des volumes réels.
Deux cas chiffrés : 10 000 emails et 5 000 factures par mois
Un prix au million de tokens ne dit rien tant qu'on ne l'a pas multiplié par un volume. Voici deux flux courants en PME et en ETI, avec des hypothèses explicites pour que vous puissiez refaire le calcul avec vos propres chiffres.
Cas 1 : trier et extraire 10 000 emails entrants par mois
Une boîte partagée reçoit 10 000 emails par mois : commandes, demandes de devis, réclamations, factures, relances. Une bonne partie arrive avec une pièce jointe courte. Pour chaque email, le modèle classe la demande, extrait les champs utiles (client, référence, date, montant, produit) et rédige un résumé de deux lignes pour le CRM.
- Instructions, catégories, schéma JSON et quelques exemples : 1 500 tokens.
- Email et court historique : 800 tokens.
- Pièce jointe courte (une page, texte extrait) : 1 200 tokens.
- Sortie (JSON, résumé, raisonnement léger) : 500 tokens.
- Un seul appel par email, sans cache ni nouvelle tentative.
Soit 35 millions de tokens en entrée et 5 millions en sortie par mois.
| Modèle (prix entrée / sortie) | Entrée : 35 M tokens | Sortie : 5 M tokens | Total par mois | Pour 1 000 emails |
|---|---|---|---|---|
| GPT-6 Luna (0,10 / 0,50) | 3,50 $ | 2,50 $ | 6,00 $ | 0,60 $ |
| DeepSeek V4.1-Flash, heures creuses (0,15 / 0,60) | 5,25 $ | 3,00 $ | 8,25 $ | 0,83 $ |
| DeepSeek V4.1-Flash, heures pleines (0,30 / 1,20) | 10,50 $ | 6,00 $ | 16,50 $ | 1,65 $ |
| Gemini 3.8 Flash, tarif de lancement (0,75 / 3,75) | 26,25 $ | 18,75 $ | 45,00 $ | 4,50 $ |
| Gemini 3.8 Flash, au 1er janvier 2027 (1,50 / 7,50) | 52,50 $ | 37,50 $ | 90,00 $ | 9,00 $ |
| GPT-6 Sol (2 / 10) | 70,00 $ | 50,00 $ | 120,00 $ | 12,00 $ |
| Claude Opus 5.5 (4 / 20) | 140,00 $ | 100,00 $ | 240,00 $ | 24,00 $ |
Cas 2 : extraire 5 000 factures ou bons de livraison par mois
Un service comptable ou logistique reçoit 5 000 factures fournisseurs ou bons de livraison par mois. Le modèle extrait l'en-tête (fournisseur, numéro, dates, montants HT, TVA et TTC) et les lignes, dans un JSON prêt à être contrôlé puis envoyé à l'ERP.
- Instructions et schéma (en-tête, lignes, TVA, références) : 2 000 tokens.
- Document de deux pages en moyenne, texte extrait : 3 000 tokens.
- Sortie (en-tête et 10 à 15 lignes en JSON, raisonnement léger) : 1 200 tokens.
Soit 25 millions de tokens en entrée et 6 millions en sortie par mois. Nous envoyons le même texte extrait à tous les modèles pour garder une comparaison juste. En pratique, chaque fournisseur compte les pages PDF et les images à sa façon (Google annonce par exemple 258 tokens par page PDF dans son API) : envoyer le PDF brut peut revenir moins cher ou plus cher selon le modèle, et cela se mesure pendant le test.
| Modèle (prix entrée / sortie) | Entrée : 25 M tokens | Sortie : 6 M tokens | Total par mois | Pour 1 000 documents |
|---|---|---|---|---|
| GPT-6 Luna (0,10 / 0,50) | 2,50 $ | 3,00 $ | 5,50 $ | 1,10 $ |
| DeepSeek V4.1-Flash, heures creuses (0,15 / 0,60) | 3,75 $ | 3,60 $ | 7,35 $ | 1,47 $ |
| DeepSeek V4.1-Flash, heures pleines (0,30 / 1,20) | 7,50 $ | 7,20 $ | 14,70 $ | 2,94 $ |
| Gemini 3.8 Flash, tarif de lancement (0,75 / 3,75) | 18,75 $ | 22,50 $ | 41,25 $ | 8,25 $ |
| Gemini 3.8 Flash, au 1er janvier 2027 (1,50 / 7,50) | 37,50 $ | 45,00 $ | 82,50 $ | 16,50 $ |
| GPT-6 Sol (2 / 10) | 50,00 $ | 60,00 $ | 110,00 $ | 22,00 $ |
| Claude Opus 5.5 (4 / 20) | 100,00 $ | 120,00 $ | 220,00 $ | 44,00 $ |
Entre le modèle le moins cher et le plus cher, l'écart est d'un facteur 40, soit de 6 $ à 240 $ par mois. Gemini 3.8 Flash coûte 7,5 fois plus que Luna aujourd'hui et 15 fois plus à partir de janvier, tout en restant sous 100 $. DeepSeek V4.1-Flash se place juste au-dessus de Luna en heures creuses ; pour un traitement au fil de l'eau pendant vos heures de bureau, vérifiez la plage horaire exacte avant de budgéter au tarif réduit.
Le cache et les modes différés font encore baisser ces montants : les instructions, identiques d'un appel à l'autre, peuvent être facturées au tarif de cache (0,01 $ par million chez Luna), et Gemini propose un mode Batch à moitié prix. L'ordre de grandeur ne bouge pas.
Vous voulez ce calcul sur vos propres volumes et vos documents ?
On part d'un échantillon de vos emails entrants, on fait passer les modèles candidats dessus et vous voyez le coût par email traité, la part renvoyée à votre équipe et le modèle qui tient la précision.
Pourquoi la facture API pèse si peu dans le coût d'une automatisation ?
À moins de 250 $ par mois dans le cas le plus cher de notre comparatif, le modèle est rarement la ligne la plus lourde d'une automatisation à gros volume. Ce qui pèse, c'est tout ce qui se passe quand le modèle se trompe ou hésite.
La reprise humaine
Aucun modèle ne traite 100 % des emails ou des factures sans intervention. Une partie des cas part en revue : pièce jointe illisible, demande ambiguë, total qui ne se réconcilie pas, fournisseur inconnu. Chaque cas repris prend du temps à quelqu'un. Prenons 3 minutes par email repris, 4 minutes par facture (il faut comparer les lignes au PDF) et un coût chargé de 35 € de l'heure. Ce sont des hypothèses, à remplacer par les vôtres.
| Poste mensuel | Cas 1 : 10 000 emails | Cas 2 : 5 000 factures |
|---|---|---|
| API GPT-6 Luna | 6 $ | 5,50 $ |
| API Gemini 3.8 Flash (tarif 2027) | 90 $ | 82,50 $ |
| API Claude Opus 5.5 | 240 $ | 220 $ |
| Reprise humaine (5 % des emails, 8 % des factures) | 500 emails, 25 h, environ 875 € | 400 factures, environ 27 h, environ 930 € |
| Quatre points de reprise en plus | 400 emails, 20 h, environ 700 € | 200 factures, environ 13 h, environ 470 € |
Un email repris à la main, à 3 minutes et 35 € de l'heure, coûte 1,75 €. C'est à peu près ce que coûtent 3 000 emails traités par Luna. Et quatre points de reprise en plus coûtent davantage, chaque mois, que toute la différence entre Luna et Opus 5.5.
Les erreurs qui passent sans être vues
Une reprise coûte du temps. Une erreur non détectée coûte davantage : une facture enregistrée avec le mauvais montant, une commande saisie sur le mauvais client, une réclamation classée en simple demande d'information. Elle ressort plus tard, en litige ou en écart de rapprochement. Un système fiable recalcule donc les totaux, vérifie les référentiels et envoie en revue ce qui ne se réconcilie pas, comme nous le détaillons pour l'extraction de factures vers un CRM.
L'intégration et la maintenance
Le modèle ne se branche pas seul à votre CRM ou à votre ERP. Il faut lire la boîte mail, router les pièces jointes, écrire dans le logiciel métier sans doublons, proposer une file de revue lisible, surveiller la production et rejouer les tests à chaque changement de modèle. C'est un budget de projet puis de suivi, sans commune mesure avec quelques dizaines de dollars d'API par mois. Si votre flux tourne dans n8n, notre guide de l'automatisation n8n en PME détaille ce que cette couche demande en production.
Point terrain Tensoria
« Sur un flux de quelques milliers de documents par mois, on passe beaucoup plus de temps à réduire la file de revue qu'à optimiser le prix du modèle. Gagner deux points de documents traités sans relecture rapporte en général plus qu'un changement de tarif. » Anas Rabhi, fondateur de Tensoria
Comment choisir le modèle le moins cher qui tient la précision ?
On retient le modèle le moins cher dont la précision, mesurée sur vos propres documents, atteint le niveau attendu. Le prix départage les modèles qui passent le test, il ne remplace pas le test.
Mesurer sur vos documents, pas sur un classement
Prenez quelques centaines d'emails ou de factures réels et représentatifs : formats fréquents, scans médiocres, cas pénibles, avec la bonne réponse annotée. Faites passer chaque candidat à prompt et schéma identiques. Mesurez la précision champ par champ, les valeurs inventées, la part de cas envoyés en revue et la latence. La méthode complète est dans notre guide pour évaluer un LLM en entreprise. Pour un tri en quelques catégories seulement, un petit modèle de classification peut même suffire, comme le montre ce comparatif BERT, SLM ou API LLM pour classer du texte.
Raisonner en coût par document validé
La métrique utile est le coût par document intégré sans correction : facture API, temps de revue et coût des erreurs rattrapées plus tard, divisés par le nombre de documents correctement intégrés. Avec les hypothèses du cas 1, passer de Luna à Opus 5.5 coûte 234 $ de plus par mois. À 1,75 € par email repris (en assimilant dollar et euro pour l'ordre de grandeur), ce surcoût est remboursé dès qu'Opus évite environ 130 reprises, soit 1,3 point de taux de reprise.
Si Opus 5.5 fait mieux que ça sur vos emails, c'est lui le moins cher au total. S'il fait jeu égal avec Luna, c'est Luna. Aucun classement public ne répond à cette question à votre place.
Combiner deux modèles plutôt que choisir
Sur un flux hétérogène, la réponse la plus économique est souvent une cascade : le modèle économique traite tout, et les cas où il hésite (champ manquant, total incohérent, catégorie incertaine) repartent vers un modèle plus fort. Dans le cas 1, Luna sur 100 % des emails plus Sol sur 10 % d'entre eux coûte 6 $ + 12 $, soit 18 $ par mois. Dans le cas 2, 5,50 $ + 11 $, soit 16,50 $. Le principe et ses limites sont détaillés dans notre article sur le routage entre petit et grand modèle.
C'est le schéma que nous utilisons le plus souvent pour l'automatisation du traitement des emails entrants, avec l'escalade vers un humain en dernier recours.
Vos factures ou bons de livraison passent encore par une saisie manuelle ?
On mesure la précision champ par champ sur un lot de vos documents réels, avant toute mise en production, et vous voyez quelle part peut passer sans relecture.
Les pièges à vérifier avant de choisir un modèle à bas prix
Un prix au million de tokens est une grille tarifaire, pas une facture. Trois points font régulièrement déraper le budget ou le projet.
Les tarifs de lancement qui doublent
Gemini 3.8 Flash coûte 0,75 $ / 3,75 $ jusqu'au 31 décembre 2026, puis 1,50 $ / 7,50 $ au 1er janvier 2027. Sur nos deux cas, la facture passe de 45 $ à 90 $ et de 41,25 $ à 82,50 $. En valeur absolue, c'est supportable. Le problème apparaît quand un budget a été construit sur le tarif de lancement pour un volume dix fois plus grand. La baisse de GPT-5.6 Sol d'août 2026 était elle aussi présentée comme une offre promotionnelle, garantie jusqu'à une date donnée. Budgétez au tarif qui s'appliquera dans six mois, pas à celui du jour.
Les tokens de raisonnement, facturés même quand on ne les voit pas
Les modèles actuels peuvent raisonner avant de répondre. Ces tokens de raisonnement n'apparaissent pas dans le JSON final, mais ils sont facturés au tarif de sortie. Google l'indique dans sa grille pour Gemini 3.8 Flash, et OpenAI comme Anthropic facturent eux aussi le raisonnement comme de la sortie. Or la sortie coûte quatre à cinq fois plus cher que l'entrée chez tous les modèles de ce comparatif.
Si le raisonnement ajoute 2 000 tokens par email dans le cas 1, la sortie passe de 5 à 25 millions de tokens par mois. Luna passe de 6 $ à 16 $, Gemini 3.8 Flash de 45 $ à 120 $ (240 $ en 2027), Sol de 120 $ à 320 $ et Opus 5.5 de 240 $ à 640 $. Pour du tri et de l'extraction, commencez au niveau de raisonnement le plus bas et ne montez que si le test montre un gain. Notre analyse de Gemini 3.8 Flash montre d'ailleurs que ce modèle produit plus de tokens de sortie que son prédécesseur à effort élevé.
Un seul fournisseur et des données sensibles
Les modèles changent vite : Opus 5.5 remplace Opus 5 deux mois après sa sortie, et Gemini 3.8 Flash est arrivé trois semaines après 3.7 Flash. Une automatisation taillée pour un seul modèle se retrouve coincée à chaque changement de prix ou de version. D'où trois précautions : isoler l'appel au modèle derrière une couche unique, garder le jeu de test à jour, prévoir un modèle de repli chez un autre fournisseur. Changer de modèle doit se résumer à une ligne de configuration suivie d'un test.
Les emails et les factures contiennent des données personnelles, des coordonnées bancaires et des prix négociés. Avant d'envoyer ce flux à une API, vérifiez le contrat de sous-traitance, la région de traitement et la durée de conservation (notre checklist sécurité et RGPD pour PME liste les points à contrôler). DeepSeek V4.1-Flash illustre l'arbitrage : son API officielle est la moins chère après Luna, mais elle est opérée par un éditeur chinois, ce qui pose la question du transfert de données hors de l'Union européenne. Ses poids ouverts permettent en revanche de l'héberger ailleurs (voir DeepSeek V4.1 en entreprise en France).
Pour les flux les plus sensibles, un modèle ouvert hébergé chez vous ou en France est une option à part entière : le coût se compte alors en infrastructure plutôt qu'en tokens.
Ce qui a bougé depuis le 24 septembre
Le 28 septembre 2026, Anthropic a sorti Claude Sonnet 5.5, au même prix que GPT-6 Sol : 2 $ en entrée, 10 $ en sortie, lecture de cache à 0,20 $. Avec nos hypothèses, il coûte donc 120 $ par mois dans le cas des emails et 110 $ dans celui des factures. Anthropic annonce jusqu'à 30 % de coût en moins par tâche par rapport à Sonnet 5, grâce à moins de tokens et moins d'appels d'outils, et un niveau proche d'Opus 5.5 (chiffres de l'éditeur, à vérifier sur vos cas, voir l'annonce officielle).
Il ne rivalise pas avec Luna sur le prix, mais c'est un candidat sérieux pour l'étage « modèle fort » d'une cascade, à la place de Sol ou d'Opus. Voir notre article sur Claude Sonnet 5.5 en entreprise et le comparatif Sonnet 5.5, Opus 5.5, GPT-6 Sol et Gemini 3.8. Anthropic annonce aussi Claude Haiku 5.5 dans les prochaines semaines, à ajouter au test dès sa sortie si vos automatisations tournent chez Anthropic.
Pour aller plus loin
- La méthode de choix qui ne dépend pas du modèle du jour : quel modèle d'IA choisir pour l'automatisation.
- Un flux documentaire de bout en bout : automatiser le traitement des bordereaux de livraison.
- Les briques d'une chaîne d'extraction fiable : OCR de factures par IA, stacks et validation.