Google a fait passer gemini-3.8-flash en disponibilité générale. Contrairement aux précédentes versions de Flash, positionnées sur la rapidité et le prix, celle-ci vise l'ingénierie logicielle de longue durée, les agents autonomes et les flux de travail d'entreprise complexes.
Ce qui change
Ce positionnement est en soi la nouvelle. Flash a toujours été le niveau bon marché et rapide qu'on appelle des milliers de fois au sein d'un système. Google le présente désormais exactement pour le type de charge de travail qui exigeait auparavant le modèle phare : des agents qui tournent longtemps et doivent garder la trace de ce qu'ils faisaient.
La veille, le 1er septembre, la compréhension vidéo agentique a été déployée sur l'ensemble des modèles Flash. Google indique qu'elle utilise jusqu'à 88 % de tokens en moins pour les contenus longs par rapport au traitement statique image par image.
Pourquoi ce chiffre de tokens compte
Pour les tâches d'agents de longue durée, la facture dépend du nombre de tokens que le modèle consomme pour décider quoi faire, et non du prix affiché au million. Une réduction de 88 % sur l'entrée vidéo change carrément la donne sur les charges de travail vidéo abordables : un enregistrement complet dont l'analyse coûtait des dollars ne coûte plus que quelques centimes.
Cela explique aussi le repositionnement. Si le niveau bon marché peut gérer le contexte efficacement sur de longues durées, la raison de recourir à un modèle phare pour le travail d'agents s'affaiblit.
La tendance plus large
Google a déployé cette mise à jour deux jours après Fable 5.1 d'Anthropic et un jour avant l'annonce de GPT-6 Astra par OpenAI. Mais là où les deux autres rivalisaient sur les capacités de pointe, Google a joué la carte du coût par unité de travail. Ce sont des paris différents sur ce que le marché achètera ensuite.
Que faire
Si vous avez des charges de travail d'agents actuellement figées sur un modèle phare en raison de la gestion du contexte, cela mérite un nouveau benchmark. La comparaison intéressante n'est pas le score aux benchmarks mais le nombre total de tokens consommés par tâche accomplie — c'est là que se joue la victoire ou non d'un modèle de niveau Flash misant sur l'efficacité.
Il faut aussi se rappeler que Google a supprimé les paramètres d'échantillonnage temperature, top_p et top_k sur ses récents modèles Flash. Le code migrant vers 3.8 ne devrait plus les utiliser.