Gemini 3.8 Flash : prix gelé, mais ma facture a pris 37 %

Six jours de test sur de vrais agents de code : ce que le troisième Flash de l'été change, et ce qu'il coûte une fois les tokens comptés.

Logo Gemini 3.8 Flash avec compteur de tokens en surchauffe

Google a publié Gemini 3.8 Flash le 3 septembre, son troisième modèle Flash en six semaines. Le tarif d'appel ne bouge pas d'un centime. Et pourtant, après six jours de test sur mes agents de code, ma facture par tâche a grimpé de 37 %. Ce n'est pas une arnaque, c'est plus subtil — et si vous faites tourner des agents en production, ça vous concerne directement.

Trois Flash en six semaines : où en est Google

3.6 en juillet, 3.7 fin août, 3.8 le 3 septembre. Google sort des Flash comme d'autres sortent des patchs de sécurité. Il y a trois semaines, je trouvais déjà que 3.7 Flash tenait tête à GPT-5.6 Terra pour trois fois moins cher ; 3.8 pousse le curseur plus loin, et cette fois Google ose la comparaison frontale avec les modèles frontier.

Sur HLE-Verified, le benchmark de raisonnement multi-étapes, Google annonce 54,9 % — devant GPT-5.6 Sol (54,5 %) et Claude Opus 5 (54,4 %). Un Flash qui coiffe les vaisseaux amiraux d'OpenAI et d'Anthropic sur un benchmark de raisonnement, il fallait le dire vite il y a six mois. Sur Vals Finance Agent v2, un test d'agents appliqués à la finance, 3.8 monte à 61,4 % contre 59 % pour 3.7. Et sur DeepSWE v1.1, le successeur de SWE-bench, il dépasserait « la plupart des modèles plus volumineux » selon Google.

Précaution d'usage : ces chiffres sortent des labos de Mountain View, pas d'un évaluateur indépendant. Mais mon test terrain, lui, ne vient pas d'un communiqué de presse.

Combien coûte Gemini 3.8 Flash (et jusqu'à quand)

Le tarif reprend celui de 3.7 Flash : 0,75 $ le million de tokens en entrée, 3,75 $ en sortie. En batch, moitié prix : 0,375 $ et 1,875 $. Fenêtre de contexte d'un peu plus d'un million de tokens en entrée, 65 536 en sortie. Sur le papier, un des meilleurs rapports intelligence/prix du marché.

Sauf que ce tarif est explicitement promotionnel. Brief IA le confirme : le prix d'introduction court jusqu'au 31 décembre 2026, puis passe au tarif standard — 1,50 $ en entrée, 7,50 $ en sortie. Le double, du jour au lendemain.

Et il y a un deuxième étage à la fusée. J'ai rejoué vendredi mon pipeline de revue de PR — 40 pull requests réelles, même prompt système, mêmes repos — d'abord sur 3.7, puis sur 3.8. Résultat : 9,2 M de tokens d'entrée et 610 k de sortie sur 3.7, soit 9,19 $. Sur 3.8 : 12,4 M d'entrée, 890 k de sortie, 12,64 $. Même prix unitaire, +37 % sur la facture. Le modèle « travaille » plus : il relit, vérifie, déroule des chaînes de raisonnement plus longues. CryptoActu arrive au même ordre de grandeur : environ +40 % de coût réel par tâche. C'est exactement le genre de dérive silencieuse que j'avais déjà chiffrée en optimisant la consommation de tokens de mes agents avec le tool calling programmatique : le prix au million ne veut plus rien dire, seul le coût par tâche terminée compte.

La contrepartie honnête : sur mes 40 PR, 3.8 a levé trois vrais bugs que 3.7 avait laissés passer, dont une condition de course dans un worker de facturation. Trois bugs pour 3,45 $ de plus, je signe. Mais c'est un choix à faire les yeux ouverts, pas un « même prix » à prendre au pied de la lettre.

Gemini 3.8 Flash pour le code et les agents : mon test de six jours

Le modèle est disponible via l'API Gemini, Google AI Studio, Android Studio, Stitch pour la génération d'interfaces, et Antigravity pour les workflows d'agents — j'ai fait l'essentiel de mon test dans Antigravity, piloté depuis agy, le CLI Antigravity que j'avais adopté après l'enterrement de Gemini CLI. Côté application grand public, il faut un abonnement Google AI Pro ou Ultra.

Sur du code agentique longue durée — le cœur de cible affiché — le gain est net. Mon agent de migration TypeScript, qui plafonnait avec 3.7 sur les dépendances circulaires, a bouclé en autonomie un chantier de 60 fichiers que je découpais à la main avant. La robustesse aux injections de prompt, mesurée par les évaluations Gray Swan, progresse aussi : mon agent de veille qui navigue sur des pages web tierces n'a mordu à aucun des pièges classiques que je lui tends depuis des mois.

Tout n'a pas marché. Mon vrai plantage de la semaine : un refactoring lancé sur un monorepo, où 3.8 a généré un diff massif… qui a claqué le plafond de sortie de 65 536 tokens en plein milieu d'un fichier. Diff tronqué, patch inapplicable, 1,80 $ de tokens partis en fumée. J'ai perdu deux heures avant de comprendre qu'il fallait découper par paquets de modules. Le million de tokens en entrée fait rêver, mais la sortie reste un goulot — et le modèle, plus bavard que 3.7, le sature plus vite.

Deuxième réserve : en niveau d'effort bas (le mode économique), 3.8 retombe grosso modo au niveau de 3.7. Google le dit à demi-mot en maintenant 3.7 au catalogue « lorsque l'efficacité prime ». Traduction : le gain de 3.8 se paie en tokens de raisonnement, ou ne se matérialise pas.

Flash Cyber et Fairwind : le modèle que vous ne pourrez pas essayer

Le lancement cache un deuxième modèle : Gemini 3.8 Flash Cyber, spécialisé en cybersécurité. Les chiffres sont sérieux — 86,2 % sur CyberGym contre 85,6 % pour GPT-5.5-Cyber, 47,2 % de correctifs valides sur CWE-Bench pour environ 3,60 $ l'exécution. En test interne chez Google, il aurait produit 2,6 fois plus de correctifs valides sur le code de Chrome que des modèles commerciaux plus gros ; chez Wiz, un rappel supérieur de 7,5 à 9,7 points pour un coût 2,3 à 5,2 fois moindre.

Mais vous ne le toucherez pas. L'accès passe par le programme Fairwind : plus de 650 partenaires triés — gouvernements, opérateurs d'infrastructures critiques, mainteneurs de logiciels — sur candidature, avec authentification multifacteur obligatoire et accès limité aux équipes sécurité. La logique est la même que celle qui a conduit OpenAI à sortir GPT-6 Astra bridé sur ses capacités cyber la semaine dernière : les capacités offensives des modèles progressent plus vite que la confiance qu'on peut accorder à n'importe quel détenteur de carte bleue. En trois mois, le modèle cyber en accès libre est passé du statut de produit à celui d'exception.

Pour une PME, la conséquence est concrète : les meilleurs outils de détection de vulnérabilités par IA seront intégrés dans des produits (scanners, EDR, plateformes cloud) par les membres de Fairwind, pas accessibles en direct via une clé API. Prévoyez le budget licence, pas le budget tokens.

Gemini 3.7 ou 3.8 Flash : lequel garder pour vos agents

Ma grille après six jours, sans langue de bois. Basculez sur 3.8 si vos agents font du code longue durée, de l'analyse de gros documents ou des chaînes outil-raisonnement-vérification : le taux de complétion en autonomie justifie le surcoût de consommation. Restez sur 3.7 pour tout ce qui est extraction, tri, résumé, classification : 3.8 en effort bas n'y apporte rien, et 3.7 reste supporté et moins gourmand. Et si votre facture d'agents dépasse quelques centaines d'euros par mois, mesurez le coût par tâche sur un échantillon avant de migrer — pas le prix au million.

Face à la concurrence, le positionnement est limpide : GPT-6 Astra facture 10 $/50 $ le million de tokens, soit 13 fois plus, pour un contrôle d'ordinateur autonome que tout le monde n'utilisera pas. Claude reste ma référence sur les refactos délicats où la précision du premier jet prime sur le prix — c'est d'ailleurs toujours lui qui pilote mes chantiers critiques.

Verdict : qui doit passer sur 3.8 Flash avant le 31 décembre

Gemini 3.8 Flash est probablement le meilleur rapport capacité/prix du moment pour des agents de code — à condition de raisonner en coût par tâche et d'accepter que la facture réelle monte de 30 à 40 % par rapport à 3.7. La fenêtre est connue : tarif d'introduction jusqu'au 31 décembre 2026, doublement au 1er janvier. Si vous devez valider un POC d'agents, faites-le maintenant, avec le tarif plein dans le business plan. Ceux qui n'ont que des besoins simples n'ont aucune raison de bouger : 3.7 fait le travail. Et ceux qui espéraient mettre la main sur Flash Cyber peuvent passer leur chemin — Google a décidé que ce marché-là ne serait pas en libre-service.

FAQ

Gemini 3.8 Flash est-il gratuit ?
Partiellement. Vous pouvez le tester sans payer dans Google AI Studio avec les quotas du niveau gratuit. Dans l'application Gemini, il est réservé aux abonnés Google AI Pro et Ultra. En API, il est facturé 0,75 $ le million de tokens en entrée et 3,75 $ en sortie jusqu'au 31 décembre 2026.
Combien coûtera Gemini 3.8 Flash en 2027 ?
Le double du tarif actuel : 1,50 $ le million de tokens en entrée et 7,50 $ en sortie à partir du 1er janvier 2027. Le prix actuel est explicitement un tarif d'introduction. Budgétez vos projets 2027 au tarif plein.
Quelle différence entre Gemini 3.7 Flash et 3.8 Flash ?
Même prix, mêmes canaux de distribution, mais 3.8 raisonne plus longtemps : meilleurs scores en code agentique (61,4 % contre 59 % sur Vals Finance Agent v2), meilleure résistance aux injections de prompt, et environ 40 % de tokens consommés en plus par tâche complexe. En niveau d'effort bas, l'écart avec 3.7 disparaît presque.
Comment accéder à Gemini 3.8 Flash Cyber ?
Vous ne pouvez pas, sauf si votre organisation est éligible au programme Fairwind : gouvernements, opérateurs d'infrastructures critiques et mainteneurs de logiciels, sur candidature, avec MFA obligatoire et accès restreint aux équipes sécurité. Plus de 650 partenaires y sont admis à ce jour.
Gemini 3.8 Flash vaut-il le coup face à GPT-6 Astra ?
Pour des agents de code et d'analyse documentaire, oui : Astra coûte 13 fois plus cher (10 $/50 $ contre 0,75 $/3,75 $ le million de tokens). Astra garde l'avantage sur le contrôle autonome d'ordinateur complet. Si votre besoin est du code et du raisonnement outillé, 3.8 Flash suffit dans la grande majorité des cas.
Partager
Résumé vidéoen cours…