Le modèle
Google a lancé Gemini 3.6 Flash le 21 juillet 2026. Le modèle est proposé à 1,50 dollar par million de tokens en entrée et 7,50 dollars par million en sortie, contre 9 dollars précédemment pour Gemini 3.5 Flash. La fenêtre de contexte reste à 1 million de tokens.
La principale avancée mise en avant par Google est l'efficacité : sur l'Artificial Analysis Index, 3.6 Flash consomme environ 17% de tokens en moins que son prédécesseur pour obtenir des résultats comparables. Sur des benchmarks de code comme DeepSWE, la réduction peut atteindre 65% selon Google.
Ce que ça change en pratique
L'amélioration d'efficacité concerne surtout les workflows agentiques. Le modèle enchaîne moins d'étapes de raisonnement et d'appels d'outils pour terminer une tâche multi-étapes. Combinée à la baisse du prix unitaire, cette réduction du nombre de tokens se traduit par un coût total par tâche significativement inférieur pour les applications à fort volume.
Gemini 3.6 Flash est disponible dès le premier jour sur Google AI Studio, l'API Gemini, l'application Gemini, Android Studio et Vertex AI. Google a également annoncé 3.5 Flash-Lite à 0,30 dollar par million de tokens en entrée, ciblant les cas d'usage à très grande échelle où le coût prime sur la performance.
Ce qui manque
Gemini 3.5 Pro reste retardé sans date annoncée. Google évoque Gemini 4 sans calendrier précis. La variante "Cyber" de 3.5 Flash, destinée aux évaluations de sécurité, est disponible mais avec des restrictions d'accès non détaillées publiquement.
Sur les benchmarks de raisonnement de haut niveau, 3.6 Flash ne rivalise pas avec les modèles frontier d'Anthropic ou d'OpenAI. C'est un modèle de production optimisé pour le débit et le coût, pas pour la performance maximale.
Sources
- Google launches Gemini 3.6 Flash and 3.5 Flash-Lite, teases Gemini 4 — 9to5Google, 21 juillet 2026
- Gemini 3.6 Flash Is Here: The Efficiency Release — Analytics Vidhya, juillet 2026
- Gemini 3.6 Flash: Google Ships Its New Workhorse Model — Digital Applied, juillet 2026