Outils & Modèles Par

Gemini 3.8 Flash entreprise : prix et performances

Gemini 3.8 Flash est probablement le modèle à tester en premier lorsqu'une entreprise doit traiter beaucoup de documents ou faire tourner des agents à faible coût. Google l'a lancé le 2 septembre 2026 en disponibilité générale, à 0,75 $ par million de tokens en entrée et 3,75 $ en sortie jusqu'à la fin de l'année. Il combine un contexte d'un million de tokens, des entrées texte, image, audio, vidéo et PDF, et une vitesse mesurée autour de 300 tokens par seconde.

Le point à ne pas rater : « Flash » ne veut plus dire seulement « petit modèle qui répond vite ». Cette version raisonne davantage, appelle plus d'outils et se rapproche de modèles bien plus chers sur plusieurs tests. Elle consomme aussi plus de tokens que Gemini 3.7 Flash. Le tarif unitaire reste identique, pas toujours la facture finale.

En bref

  • Disponible maintenant : modèle stable gemini-3.8-flash dans la Gemini API et Google Cloud, pas une preview.
  • Prix promotionnel : 0,75 $/M en entrée et 3,75 $/M en sortie jusqu'au 31 décembre 2026, puis tarif doublé.
  • Rapide : environ 300 tokens de sortie par seconde dans le test indépendant d'Artificial Analysis.
  • Multimodal : texte, images, audio, vidéo et PDF en entrée ; texte et JSON structuré en sortie.
  • Point de vigilance : le modèle travaille davantage que 3.7 Flash et peut donc coûter plus cher par tâche malgré le même prix par token.

Ce que Gemini 3.8 Flash change pour une entreprise

Google présente 3.8 Flash comme son « workhorse » le plus intelligent : un modèle fait pour absorber du volume, mais désormais entraîné pour le code longue durée, les agents autonomes et les tâches métier à plusieurs étapes. Il arrive trois semaines après 3.7 Flash et constitue, selon l'annonce officielle de Google, la troisième version Flash publiée en six semaines.

Cette cadence dit quelque chose du marché : les fournisseurs n'attendent plus un cycle annuel pour déplacer le rapport qualité-prix. Claude Fable 5.1 est sorti la veille avec un positionnement haut de gamme ; Google répond par un modèle beaucoup moins cher, pensé pour être multiplié dans des workflows. Comparer uniquement le meilleur score n'a plus beaucoup de sens. Il faut comparer le coût d'un résultat validé.

Caractéristique Gemini 3.8 Flash Conséquence pratique
Identifiant APIgemini-3.8-flashVersion stable, disponibilité générale
EntréesTexte, image, audio, vidéo, PDFUn seul modèle pour des dossiers multimodaux
SortieTexte, jusqu'à 65 536 tokensJSON structuré possible, pas de génération native d'image ou d'audio
Contexte1 048 576 tokensDocuments longs, historiques et lots de pièces
Raisonnementlow, medium, highArbitrage qualité, coût et latence par tâche
OutilsFonctions, recherche, File Search, code, URL ContextIntégration dans des agents et applications métier

Le modèle est disponible dans Google AI Studio, la Gemini API, Gemini Enterprise Agent Platform, Antigravity et les produits grand public annoncés par Google. Dans l'application Gemini, l'accès au lancement concerne les abonnés Google AI Pro et Ultra. Pour une intégration métier, la vraie distinction reste entre un test dans Google AI Studio en entreprise et une API facturée, supervisée et rattachée à un projet Cloud.

Prix de Gemini 3.8 Flash : attractif en 2026, doublé en 2027

Le tarif affiché au lancement est simple, mais temporaire. Jusqu'au 31 décembre 2026, Google facture 0,75 $ par million de tokens en entrée et 3,75 $ en sortie au tarif standard global. Le 1er janvier 2027, le prix passe à 1,50 $ et 7,50 $. Cette date doit entrer dans le budget dès le POC : un projet rentable uniquement grâce à la promotion n'est pas encore rentable.

Mode Gemini API, région globale Jusqu'au 31 décembre 2026 À partir du 1er janvier 2027
Entrée standard0,75 $/M1,50 $/M
Sortie, raisonnement inclus3,75 $/M7,50 $/M
Lecture du cache0,075 $/M0,15 $/M
Stockage du cache0,50 $/M/heure1 $/M/heure
Batch ou Flex0,375 $/M entrée, 1,875 $/M sortie0,75 $/M entrée, 3,75 $/M sortie

Le cache réduit de 90 % le prix des tokens d'entrée déjà calculés. C'est utile lorsqu'un agent relit le même référentiel, le même catalogue ou les mêmes consignes sur des milliers de requêtes. Batch et Flex divisent également le prix des tokens par deux, en échange d'une exécution non prioritaire. Pour une extraction nocturne de factures, cette concession est souvent acceptable. Pour répondre à un commercial devant un client, beaucoup moins.

Un calcul simple sur 10 000 documents

Supposons 10 000 pièces consommant chacune 3 000 tokens d'entrée et 300 tokens de sortie, raisonnement compris. Le volume total atteint 30 millions de tokens entrants et 3 millions sortants. Au tarif promotionnel standard, la facture modèle serait de 33,75 $ : 22,50 $ d'entrée et 11,25 $ de sortie.

Le même lot coûterait 16,88 $ en Batch, puis 67,50 $ au tarif standard de janvier 2027. Ce calcul exclut le stockage, la recherche, les retries, les pièces rejetées et la supervision humaine. Surtout, il suppose 300 tokens de sortie. À effort élevé, le raisonnement peut faire grimper ce volume sans que le JSON final paraisse plus long.

Le prix par token ne suffit pas

Artificial Analysis a observé ce piège dès le jour du lancement : malgré un prix unitaire identique à 3.7 Flash, le coût moyen de son évaluation passe de 0,40 $ à 0,58 $ au niveau de raisonnement élevé. La cause mesurée est une hausse de 30 % des tokens de sortie et davantage de tours d'agent.

La métrique à suivre reste donc le coût par document correctement intégré ou par tâche validée, pas le coût du million de tokens. Notre article sur le choix d'un modèle IA pour automatiser détaille cette logique de dimensionnement.

Performances : très rapide, mais pas toujours plus court

Les résultats de lancement sont solides. Sur les tests rejoués par Google, Gemini 3.8 Flash atteint 61,4 % sur Vals Finance Agent v2 contre 59,0 % pour 3.7 Flash, 10,0 % contre 8,8 % sur Harvey's Legal Agent Benchmark, et 54,9 % contre 53,6 % sur HLE-Verified. Sur ce dernier test, l'écart avec Claude Opus 5 n'est que de 0,5 point.

Ces chiffres viennent du fournisseur. Ils confirment une progression sur le travail financier, juridique et multidisciplinaire, mais ne prouvent pas qu'une extraction de facture ou qu'un agent CRM sera meilleur dans votre environnement. Le prompt, les outils, la qualité du scan et le schéma de données peuvent déplacer le résultat bien davantage que deux points de benchmark.

Intelligence Index

59

Artificial Analysis, effort élevé ; 3.7 Flash obtient 56.

Débit de sortie

~300 t/s

Mesure indépendante au niveau de raisonnement élevé.

Temps par tâche

2,5 min

Moyenne du même test à effort élevé, contre 2,2 min pour 3.7.

Ce que mesure le test indépendant

Artificial Analysis donne un signal plus comparable entre fournisseurs. Son Intelligence Index place 3.8 Flash à 59 en high, contre 56 pour 3.7 Flash. En medium, le score descend à 57 et le coût moyen à 0,41 $ ; en low, le modèle obtient 52 pour 0,24 $.

Ce réglage n'est pas cosmétique. Au niveau élevé, le débit de génération tourne autour de 300 tokens par seconde, mais la tâche complète prend 2,5 minutes parce que le modèle réfléchit et boucle davantage. Au niveau bas, elle tombe à 0,8 minute. Il faut donc régler l'effort par type de dossier, pas une fois pour toute l'application.

Le benchmark sélectionne, la production tranche

Un bon protocole tient sur 50 à 200 cas réels : mêmes documents, même schéma, mêmes outils et même règle de validation pour tous les candidats. Mesurez les champs justes, les champs absents, les valeurs inventées, la latence au percentile 95 et les reprises humaines. Le guide pour évaluer un LLM en entreprise permet de construire cette recette sans transformer un benchmark public en décision d'achat.

Les usages où Gemini Flash est vraiment rentable

Documents, factures et données structurées

C'est probablement le meilleur angle pour une PME. Gemini 3.8 Flash lit nativement un PDF ou une image et peut retourner un objet conforme à un JSON Schema. On peut donc extraire un numéro de facture, un fournisseur, une date, une devise, les montants HT et TTC, la TVA et les lignes, puis envoyer le résultat vers un ERP ou un CRM. Le pipeline complet est détaillé dans notre guide Gemini 3.8 Flash : de la facture au CRM.

Le vrai avantage de Google n'est pas une « intelligence documentaire » magique. C'est la chaîne complète : compréhension visuelle du PDF, sorties structurées selon un schéma JSON, appels de fonctions, puis briques Cloud comme Document AI, BigQuery ou les connecteurs applicatifs. Moins de plomberie entre OCR, modèle et base de données.

Un JSON valide n'est pas une donnée juste

Le schéma garantit la forme de la réponse, pas la vérité des montants. Recalculez HT + TVA = TTC, vérifiez la devise et le format des dates, rejetez les doublons et envoyez les cas incohérents en revue humaine. L'automatisation fiable commence après la sortie du modèle.

Google indique que ses modèles Gemini peuvent interpréter texte, images, graphiques et tableaux dans des PDF, y compris des documents longs. Pour de la facturation répétitive et très standardisée, comparez néanmoins Gemini à un parseur spécialisé de Document AI. Un modèle généraliste apporte de la souplesse ; un processeur dédié apporte des champs normalisés et des scores de confiance. Les deux peuvent aussi être combinés.

Agents, code et recherche multimodale

3.8 Flash est également intéressant pour un agent qui consulte des documents, appelle une API, contrôle une interface ou exécute du code. Function calling, File Search, Google Search, Google Maps, URL Context et code execution sont pris en charge ; computer use reste en preview. Le contexte d'un million de tokens évite de découper trop tôt un dossier complexe.

Son prix permet surtout de multiplier les appels : un premier passage classe la demande, un second extrait les données, un troisième contrôle les incohérences et un quatrième prépare l'action CRM. Pour les 5 % de cas ambigus, un routeur peut escalader vers un modèle plus coûteux. Cette architecture est souvent plus stable que de demander à un seul appel « frontière » de tout faire.

Quand choisir Flash-Lite ou un modèle plus puissant

Pour traduire, classer trois catégories ou extraire deux champs propres à très gros volume, Gemini 3.5 Flash-Lite reste moins cher. À l'autre extrême, une recherche juridique ouverte, une migration de code critique ou une analyse où chaque étape dépend finement de la précédente peut justifier Opus, Fable ou GPT-Sol. Le comparatif des modèles frontière pour l'entreprise donne les ordres de grandeur.

Gemini 3.8 Flash occupe le milieu : assez intelligent pour traiter les exceptions et assez économique pour rester dans la boucle principale. C'est exactement ce qui rend la famille Flash intéressante. Pas le record absolu. Le débit utile.

Limites, migration API et données : les trois tests avant production

Plus de raisonnement signifie plus de tokens

Google le dit dans sa propre fiche de modèle Gemini 3.8 Flash : le modèle peut être lent, atteindre un timeout et consommer davantage de tokens à effort élevé. Il peut aussi halluciner. Son cutoff principal est mars 2026, avec certaines connaissances limitées à janvier 2025 selon les domaines.

Pour une extraction, commencez par low sur les documents simples et n'escaladez que les anomalies. Pour un agent, plafonnez le nombre d'étapes, journalisez chaque outil et imposez une condition d'arrêt. Sans ces garde-fous, un modèle bon marché peut tourner longtemps et devenir cher.

La migration depuis 3.7 n'est pas seulement un identifiant

Le passage à gemini-3.8-flash est direct, mais la documentation Google impose plusieurs conventions. thinking_level="minimal" renvoie une erreur ; seules les valeurs low, medium et high sont acceptées. temperature, top_p et top_k sont ignorés, tandis que les anciens thinking_budget, tours préremplis du modèle et paramètres de pénalité doivent être supprimés.

Les appels de fonctions doivent aussi conserver une correspondance stricte entre l'appel et la réponse. Ce sont de petits changements, mais ils suffisent à casser silencieusement une chaîne d'outils. Rejouez donc la recette complète, y compris les erreurs, les timeouts et les fallbacks.

Disponibilité générale ne signifie pas conformité automatique

Sur la Gemini API payante, Google indique ne pas utiliser les prompts, documents ou réponses pour améliorer ses produits. Une journalisation limitée peut subsister pour la détection des abus. La rétention zéro existe, mais elle dépend des fonctions utilisées : cache, Files API et Grounding peuvent avoir leurs propres règles.

Pour une entreprise française, vérifiez le DPA, la région, les sous-traitants, la rétention réelle et les transferts avant d'envoyer factures, contrats ou données RH. Les conditions de mars 2026 précisent qu'en EEE les règles de traitement des services payants s'appliquent aussi aux services gratuits ; elles imposent également les services payants lorsqu'une application est mise à disposition d'utilisateurs de l'EEE. Notre checklist sécurité, RGPD et souveraineté détaille ce contrôle.

Notre verdict

Faites entrer Gemini 3.8 Flash dans votre shortlist pour l'extraction multimodale, les agents à fort volume et le code outillé. Gardez 3.7 Flash si la consommation minimale prime, Flash-Lite si la tâche est triviale, et un modèle frontière si vos cas difficiles échouent encore. Le bon réglage se mesure dossier par dossier.

Questions fréquentes sur Gemini 3.8 Flash en entreprise

Gemini 3.8 Flash est le modèle Flash lancé par Google le 2 septembre 2026. Disponible en version stable et en disponibilité générale, il accepte le texte, les images, l'audio, la vidéo et les PDF, avec 1 048 576 tokens en entrée et 65 536 tokens en sortie. Google le destine au code longue durée, aux agents autonomes et aux workflows métier complexes.
Jusqu'au 31 décembre 2026, Gemini 3.8 Flash coûte 0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie sur le tarif standard global. Le cache lu coûte 0,075 dollar par million de tokens. À partir du 1er janvier 2027, ces tarifs passent respectivement à 1,50 dollar, 7,50 dollars et 0,15 dollar. Batch et Flex divisent les prix d'entrée et de sortie par deux.
Son débit de génération reste très élevé : Artificial Analysis mesure environ 300 tokens par seconde au niveau de raisonnement élevé. Mais une tâche complète dure en moyenne 2,5 minutes, contre 2,2 minutes pour Gemini 3.7 Flash dans le même test, car 3.8 produit environ 30 % de tokens supplémentaires et effectue davantage d'étapes. Rapide à générer ne signifie donc pas toujours plus rapide pour finir le travail.
Oui, c'est un candidat sérieux : il lit nativement les PDF et les images et peut retourner un JSON conforme à un schéma défini. Il faut toutefois tester les montants, taxes, devises, dates, fournisseurs et lignes de facture sur un lot représentatif, puis contrôler les totaux avec des règles déterministes. Un JSON valide ne garantit pas que chaque valeur extraite soit juste.
Gemini 3.8 Flash accepte jusqu'à 1 048 576 tokens en entrée et produit jusqu'à 65 536 tokens en sortie. Cette capacité permet de traiter des dossiers longs et plusieurs documents, dans la limite du poids des fichiers, du quota et du nombre réel de tokens consommés.
Sur les services payants de la Gemini API, Google indique ne pas utiliser les prompts, fichiers ou réponses pour améliorer ses produits. Une journalisation limitée peut subsister pour prévenir les abus, sauf configuration compatible avec la rétention zéro. En France et dans l'Espace économique européen, les conditions de traitement des services payants s'appliquent aussi aux services gratuits, mais une mise en production doit tout de même être cadrée contractuellement et techniquement.
Pas sans évaluation. Gemini 3.8 Flash mérite d'entrer dans une sélection pour l'extraction multimodale, le code agentique et les traitements à fort volume. Il faut le comparer au modèle en place sur 50 à 200 cas réels, mesurer le taux de réussite, la latence de bout en bout, les tokens consommés et le coût par tâche validée avant de déplacer le trafic.

Le verdict tient en une phrase : 3.8 Flash est un excellent candidat de production, mais son niveau de raisonnement doit être routé aussi soigneusement que le modèle lui-même.


Pour aller plus loin

Sources

Tester sur vos documents

Vous voulez mesurer Gemini 3.8 Flash sur un flux réel avant de migrer ?

Planifier un échange

Passer à l'action

Vous voulez appliquer ça dans votre entreprise ?

Six questions pour situer votre besoin. On revient vers vous avec une première lecture et le bon point de départ.

Demander un devis
Anas Rabhi, ingénieur IA et data scientist, fondateur de Tensoria
Anas R. Ingénieur IA, fondateur de Tensoria ianas.fr

Je suis ingénieur IA et data scientist, fondateur de Tensoria. Depuis plus de 6 ans, j'accompagne les entreprises dans l'exploitation concrète de l'IA pour leur métier : assistants internes basés sur RAG, agents IA en production, automatisations sur mesure, traitement intelligent de documents. J'interviens du cadrage initial à la mise en production, sur stacks LLM modernes (Mistral, Claude, GPT) et infrastructures souveraines quand la confidentialité l'exige.