Gemini 3.8 Flash est probablement le modèle à tester en premier lorsqu'une entreprise doit traiter beaucoup de documents ou faire tourner des agents à faible coût. Google l'a lancé le 2 septembre 2026 en disponibilité générale, à 0,75 $ par million de tokens en entrée et 3,75 $ en sortie jusqu'à la fin de l'année. Il combine un contexte d'un million de tokens, des entrées texte, image, audio, vidéo et PDF, et une vitesse mesurée autour de 300 tokens par seconde.
Le point à ne pas rater : « Flash » ne veut plus dire seulement « petit modèle qui répond vite ». Cette version raisonne davantage, appelle plus d'outils et se rapproche de modèles bien plus chers sur plusieurs tests. Elle consomme aussi plus de tokens que Gemini 3.7 Flash. Le tarif unitaire reste identique, pas toujours la facture finale.
En bref
- ✓ Disponible maintenant : modèle stable
gemini-3.8-flashdans la Gemini API et Google Cloud, pas une preview. - ✓ Prix promotionnel : 0,75 $/M en entrée et 3,75 $/M en sortie jusqu'au 31 décembre 2026, puis tarif doublé.
- ✓ Rapide : environ 300 tokens de sortie par seconde dans le test indépendant d'Artificial Analysis.
- ✓ Multimodal : texte, images, audio, vidéo et PDF en entrée ; texte et JSON structuré en sortie.
- ✓ Point de vigilance : le modèle travaille davantage que 3.7 Flash et peut donc coûter plus cher par tâche malgré le même prix par token.
Ce que Gemini 3.8 Flash change pour une entreprise
Google présente 3.8 Flash comme son « workhorse » le plus intelligent : un modèle fait pour absorber du volume, mais désormais entraîné pour le code longue durée, les agents autonomes et les tâches métier à plusieurs étapes. Il arrive trois semaines après 3.7 Flash et constitue, selon l'annonce officielle de Google, la troisième version Flash publiée en six semaines.
Cette cadence dit quelque chose du marché : les fournisseurs n'attendent plus un cycle annuel pour déplacer le rapport qualité-prix. Claude Fable 5.1 est sorti la veille avec un positionnement haut de gamme ; Google répond par un modèle beaucoup moins cher, pensé pour être multiplié dans des workflows. Comparer uniquement le meilleur score n'a plus beaucoup de sens. Il faut comparer le coût d'un résultat validé.
| Caractéristique | Gemini 3.8 Flash | Conséquence pratique |
|---|---|---|
| Identifiant API | gemini-3.8-flash | Version stable, disponibilité générale |
| Entrées | Texte, image, audio, vidéo, PDF | Un seul modèle pour des dossiers multimodaux |
| Sortie | Texte, jusqu'à 65 536 tokens | JSON structuré possible, pas de génération native d'image ou d'audio |
| Contexte | 1 048 576 tokens | Documents longs, historiques et lots de pièces |
| Raisonnement | low, medium, high | Arbitrage qualité, coût et latence par tâche |
| Outils | Fonctions, recherche, File Search, code, URL Context | Intégration dans des agents et applications métier |
Le modèle est disponible dans Google AI Studio, la Gemini API, Gemini Enterprise Agent Platform, Antigravity et les produits grand public annoncés par Google. Dans l'application Gemini, l'accès au lancement concerne les abonnés Google AI Pro et Ultra. Pour une intégration métier, la vraie distinction reste entre un test dans Google AI Studio en entreprise et une API facturée, supervisée et rattachée à un projet Cloud.
Prix de Gemini 3.8 Flash : attractif en 2026, doublé en 2027
Le tarif affiché au lancement est simple, mais temporaire. Jusqu'au 31 décembre 2026, Google facture 0,75 $ par million de tokens en entrée et 3,75 $ en sortie au tarif standard global. Le 1er janvier 2027, le prix passe à 1,50 $ et 7,50 $. Cette date doit entrer dans le budget dès le POC : un projet rentable uniquement grâce à la promotion n'est pas encore rentable.
| Mode Gemini API, région globale | Jusqu'au 31 décembre 2026 | À partir du 1er janvier 2027 |
|---|---|---|
| Entrée standard | 0,75 $/M | 1,50 $/M |
| Sortie, raisonnement inclus | 3,75 $/M | 7,50 $/M |
| Lecture du cache | 0,075 $/M | 0,15 $/M |
| Stockage du cache | 0,50 $/M/heure | 1 $/M/heure |
| Batch ou Flex | 0,375 $/M entrée, 1,875 $/M sortie | 0,75 $/M entrée, 3,75 $/M sortie |
Le cache réduit de 90 % le prix des tokens d'entrée déjà calculés. C'est utile lorsqu'un agent relit le même référentiel, le même catalogue ou les mêmes consignes sur des milliers de requêtes. Batch et Flex divisent également le prix des tokens par deux, en échange d'une exécution non prioritaire. Pour une extraction nocturne de factures, cette concession est souvent acceptable. Pour répondre à un commercial devant un client, beaucoup moins.
Un calcul simple sur 10 000 documents
Supposons 10 000 pièces consommant chacune 3 000 tokens d'entrée et 300 tokens de sortie, raisonnement compris. Le volume total atteint 30 millions de tokens entrants et 3 millions sortants. Au tarif promotionnel standard, la facture modèle serait de 33,75 $ : 22,50 $ d'entrée et 11,25 $ de sortie.
Le même lot coûterait 16,88 $ en Batch, puis 67,50 $ au tarif standard de janvier 2027. Ce calcul exclut le stockage, la recherche, les retries, les pièces rejetées et la supervision humaine. Surtout, il suppose 300 tokens de sortie. À effort élevé, le raisonnement peut faire grimper ce volume sans que le JSON final paraisse plus long.
Le prix par token ne suffit pas
Artificial Analysis a observé ce piège dès le jour du lancement : malgré un prix unitaire identique à 3.7 Flash, le coût moyen de son évaluation passe de 0,40 $ à 0,58 $ au niveau de raisonnement élevé. La cause mesurée est une hausse de 30 % des tokens de sortie et davantage de tours d'agent.
La métrique à suivre reste donc le coût par document correctement intégré ou par tâche validée, pas le coût du million de tokens. Notre article sur le choix d'un modèle IA pour automatiser détaille cette logique de dimensionnement.
Performances : très rapide, mais pas toujours plus court
Les résultats de lancement sont solides. Sur les tests rejoués par Google, Gemini 3.8 Flash atteint 61,4 % sur Vals Finance Agent v2 contre 59,0 % pour 3.7 Flash, 10,0 % contre 8,8 % sur Harvey's Legal Agent Benchmark, et 54,9 % contre 53,6 % sur HLE-Verified. Sur ce dernier test, l'écart avec Claude Opus 5 n'est que de 0,5 point.
Ces chiffres viennent du fournisseur. Ils confirment une progression sur le travail financier, juridique et multidisciplinaire, mais ne prouvent pas qu'une extraction de facture ou qu'un agent CRM sera meilleur dans votre environnement. Le prompt, les outils, la qualité du scan et le schéma de données peuvent déplacer le résultat bien davantage que deux points de benchmark.
Intelligence Index
59
Artificial Analysis, effort élevé ; 3.7 Flash obtient 56.
Débit de sortie
~300 t/s
Mesure indépendante au niveau de raisonnement élevé.
Temps par tâche
2,5 min
Moyenne du même test à effort élevé, contre 2,2 min pour 3.7.
Ce que mesure le test indépendant
Artificial Analysis donne un signal plus comparable entre fournisseurs. Son Intelligence Index place 3.8 Flash à 59 en high, contre 56 pour 3.7 Flash. En medium, le score descend à 57 et le coût moyen à 0,41 $ ; en low, le modèle obtient 52 pour 0,24 $.
Ce réglage n'est pas cosmétique. Au niveau élevé, le débit de génération tourne autour de 300 tokens par seconde, mais la tâche complète prend 2,5 minutes parce que le modèle réfléchit et boucle davantage. Au niveau bas, elle tombe à 0,8 minute. Il faut donc régler l'effort par type de dossier, pas une fois pour toute l'application.
Le benchmark sélectionne, la production tranche
Un bon protocole tient sur 50 à 200 cas réels : mêmes documents, même schéma, mêmes outils et même règle de validation pour tous les candidats. Mesurez les champs justes, les champs absents, les valeurs inventées, la latence au percentile 95 et les reprises humaines. Le guide pour évaluer un LLM en entreprise permet de construire cette recette sans transformer un benchmark public en décision d'achat.
Les usages où Gemini Flash est vraiment rentable
Documents, factures et données structurées
C'est probablement le meilleur angle pour une PME. Gemini 3.8 Flash lit nativement un PDF ou une image et peut retourner un objet conforme à un JSON Schema. On peut donc extraire un numéro de facture, un fournisseur, une date, une devise, les montants HT et TTC, la TVA et les lignes, puis envoyer le résultat vers un ERP ou un CRM. Le pipeline complet est détaillé dans notre guide Gemini 3.8 Flash : de la facture au CRM.
Le vrai avantage de Google n'est pas une « intelligence documentaire » magique. C'est la chaîne complète : compréhension visuelle du PDF, sorties structurées selon un schéma JSON, appels de fonctions, puis briques Cloud comme Document AI, BigQuery ou les connecteurs applicatifs. Moins de plomberie entre OCR, modèle et base de données.
Un JSON valide n'est pas une donnée juste
Le schéma garantit la forme de la réponse, pas la vérité des montants. Recalculez HT + TVA = TTC, vérifiez la devise et le format des dates, rejetez les doublons et envoyez les cas incohérents en revue humaine. L'automatisation fiable commence après la sortie du modèle.
Google indique que ses modèles Gemini peuvent interpréter texte, images, graphiques et tableaux dans des PDF, y compris des documents longs. Pour de la facturation répétitive et très standardisée, comparez néanmoins Gemini à un parseur spécialisé de Document AI. Un modèle généraliste apporte de la souplesse ; un processeur dédié apporte des champs normalisés et des scores de confiance. Les deux peuvent aussi être combinés.
Agents, code et recherche multimodale
3.8 Flash est également intéressant pour un agent qui consulte des documents, appelle une API, contrôle une interface ou exécute du code. Function calling, File Search, Google Search, Google Maps, URL Context et code execution sont pris en charge ; computer use reste en preview. Le contexte d'un million de tokens évite de découper trop tôt un dossier complexe.
Son prix permet surtout de multiplier les appels : un premier passage classe la demande, un second extrait les données, un troisième contrôle les incohérences et un quatrième prépare l'action CRM. Pour les 5 % de cas ambigus, un routeur peut escalader vers un modèle plus coûteux. Cette architecture est souvent plus stable que de demander à un seul appel « frontière » de tout faire.
Quand choisir Flash-Lite ou un modèle plus puissant
Pour traduire, classer trois catégories ou extraire deux champs propres à très gros volume, Gemini 3.5 Flash-Lite reste moins cher. À l'autre extrême, une recherche juridique ouverte, une migration de code critique ou une analyse où chaque étape dépend finement de la précédente peut justifier Opus, Fable ou GPT-Sol. Le comparatif des modèles frontière pour l'entreprise donne les ordres de grandeur.
Gemini 3.8 Flash occupe le milieu : assez intelligent pour traiter les exceptions et assez économique pour rester dans la boucle principale. C'est exactement ce qui rend la famille Flash intéressante. Pas le record absolu. Le débit utile.
Limites, migration API et données : les trois tests avant production
Plus de raisonnement signifie plus de tokens
Google le dit dans sa propre fiche de modèle Gemini 3.8 Flash : le modèle peut être lent, atteindre un timeout et consommer davantage de tokens à effort élevé. Il peut aussi halluciner. Son cutoff principal est mars 2026, avec certaines connaissances limitées à janvier 2025 selon les domaines.
Pour une extraction, commencez par low sur les documents simples et n'escaladez que les anomalies. Pour un agent, plafonnez le nombre d'étapes, journalisez chaque outil et imposez une condition d'arrêt. Sans ces garde-fous, un modèle bon marché peut tourner longtemps et devenir cher.
La migration depuis 3.7 n'est pas seulement un identifiant
Le passage à gemini-3.8-flash est direct, mais la documentation Google impose plusieurs conventions. thinking_level="minimal" renvoie une erreur ; seules les valeurs low, medium et high sont acceptées. temperature, top_p et top_k sont ignorés, tandis que les anciens thinking_budget, tours préremplis du modèle et paramètres de pénalité doivent être supprimés.
Les appels de fonctions doivent aussi conserver une correspondance stricte entre l'appel et la réponse. Ce sont de petits changements, mais ils suffisent à casser silencieusement une chaîne d'outils. Rejouez donc la recette complète, y compris les erreurs, les timeouts et les fallbacks.
Disponibilité générale ne signifie pas conformité automatique
Sur la Gemini API payante, Google indique ne pas utiliser les prompts, documents ou réponses pour améliorer ses produits. Une journalisation limitée peut subsister pour la détection des abus. La rétention zéro existe, mais elle dépend des fonctions utilisées : cache, Files API et Grounding peuvent avoir leurs propres règles.
Pour une entreprise française, vérifiez le DPA, la région, les sous-traitants, la rétention réelle et les transferts avant d'envoyer factures, contrats ou données RH. Les conditions de mars 2026 précisent qu'en EEE les règles de traitement des services payants s'appliquent aussi aux services gratuits ; elles imposent également les services payants lorsqu'une application est mise à disposition d'utilisateurs de l'EEE. Notre checklist sécurité, RGPD et souveraineté détaille ce contrôle.
Notre verdict
Faites entrer Gemini 3.8 Flash dans votre shortlist pour l'extraction multimodale, les agents à fort volume et le code outillé. Gardez 3.7 Flash si la consommation minimale prime, Flash-Lite si la tâche est triviale, et un modèle frontière si vos cas difficiles échouent encore. Le bon réglage se mesure dossier par dossier.
Questions fréquentes sur Gemini 3.8 Flash en entreprise
Le verdict tient en une phrase : 3.8 Flash est un excellent candidat de production, mais son niveau de raisonnement doit être routé aussi soigneusement que le modèle lui-même.
Pour aller plus loin
- GPT-Sol baisse ses prix : comparer une autre baisse qui change le coût des automatisations.
- Évaluer un LLM en entreprise : construire un test métier avant toute migration.
- Google AI Studio en entreprise : comprendre les conditions d'usage professionnel et les données.
- Routeur hybride SLM/LLM : envoyer chaque tâche vers le modèle et le niveau d'effort adaptés.
Sources
- Google — annonce de Gemini 3.8 Flash, 2 septembre 2026
- Google AI for Developers — fiche technique de Gemini 3.8 Flash
- Google AI for Developers — tarifs standard, Batch, Flex, Priority et cache
- Google Cloud — guide développeur et migration vers Gemini 3.8 Flash
- Google DeepMind — model card, limites et évaluations
- Artificial Analysis — vitesse, coût par tâche et Intelligence Index indépendants
- Google AI for Developers — compréhension native des documents PDF
- Google AI for Developers — traitement des données et conditions de la Gemini API
Tester sur vos documents
Vous voulez mesurer Gemini 3.8 Flash sur un flux réel avant de migrer ?