🧠 IA & agents

Gemini 3.6 Flash : agents rapides, calcul des tokens prudent

Cœur d'IA abstrait original comprimant des tokens vers du code, des documents et des outils

Google a lancé trois modèles Gemini le 21 juillet : Gemini 3.6 Flash, le moins cher 3.5 Flash-Lite et le spécialisé 3.5 Flash Cyber. La promesse de 3.6 Flash intéresse directement les concepteurs d'agents : de meilleurs résultats avec moins d'étapes de raisonnement, d'appels d'outils et de tokens de sortie que 3.5 Flash. Le tarif baisse aussi à 1,50 dollar par million de tokens d'entrée et 7,50 dollars par million de tokens de sortie.

Il faut en revanche résister au raccourci « 65 % moins cher ». Google cite jusqu'à 65 % de tokens de sortie en moins sur DeepSWE, un benchmark de génie logiciel. L'entreprise mentionne aussi 17 % de moins dans l'indice Artificial Analysis. Ce sont deux mesures distinctes sur des évaluations données, pas la promesse d'une réduction identique sur chaque facture. Le coût d'un agent dépend du contexte, du cache, de la longueur des réponses, des erreurs, des outils et du nombre de boucles nécessaires.

Ce qui est disponible

Gemini 3.6 Flash est proposé dans l'API Gemini et Google AI Studio, la plateforme d'agents d'entreprise et l'application Gemini. La documentation accepte texte, image, vidéo, audio et PDF en entrée, avec du texte en sortie. Appels de fonctions, exécution de code, recherche de fichiers, ancrage web et sorties structurées sont pris en charge. Le contrôle d'ordinateur reste en préversion. La fenêtre documentée atteint 1 048 576 tokens d'entrée et 65 536 tokens de sortie.

Gemini 3.5 Flash-Lite vise les grands volumes. Google l'affiche à 0,30 dollar le million en entrée et 2,50 dollars en sortie, et reprend une mesure Artificial Analysis à 350 tokens de sortie par seconde. Il peut convenir à la classification, l'extraction ou des étapes brèves qui n'exigent pas le modèle plus coûteux.

Gemini 3.5 Flash Cyber suit une autre distribution. Le modèle spécialisé est intégré à l'agent de sécurité CodeMender. Google annonce un pilote limité aux gouvernements et partenaires de confiance, pas une API générale. Gemini 3.5 Pro n'a pas été lancé : il est testé avec des partenaires. Lui attribuer aujourd'hui un prix public ou des performances finales serait spéculatif.

Pourquoi la quantité compte autant que le tarif

Un agent enchaîne plusieurs requêtes : plan, outil, observation, correction, nouvelle tentative. La facture combine volume et prix unitaire à chaque étape. Un modèle qui écrit 17 % de moins et évite une boucle inutile peut économiser davantage que ne le suggère le barème. À l'inverse, un modèle bon marché qui recommence plusieurs fois peut coûter plus cher.

Dans un agent qui lit un dossier puis utilise cinq outils, le cache, la taille des résultats et la répétition de l'historique peuvent dominer. Les tarifs de tokens n'incluent ni moteur de recherche externe, ni base de données, ni navigateur, ni calcul supplémentaire. Ils n'intègrent pas non plus le temps humain de correction.

La bonne mesure est donc le coût par tâche acceptée : tokens totaux, appels au modèle et aux outils, latence, erreurs et temps de relecture. Il faut exécuter les mêmes tâches représentatives avec l'ancien et le nouveau modèle avant d'annoncer une économie.

Des benchmarks bornés

Google publie des scores supérieurs sur DeepSWE, MLE-Bench, OSWorld-Verified et une évaluation de travail intellectuel. Ils suggèrent des progrès en code, recherche et interaction avec ordinateur, sans prouver une supériorité sur chaque dépôt ou interface. Les environnements d'évaluation sont plus propres que les systèmes réels et le fournisseur choisit les résultats mis en avant.

La réduction des modifications indésirables et des boucles est prometteuse, mais doit être mesurée localement. Un agent de code peut agir vite sur le mauvais fichier. Un agent visuel peut réussir un benchmark puis échouer sur l'authentification ou une interface interne. Le contrôle d'ordinateur en préversion exige permissions minimales, bac à sable et confirmations.

Tester sans basculer à l'aveugle

Une évaluation parallèle sur vingt à cinquante tâches suffit pour commencer. Prompts, outils et critères de succès doivent rester identiques. On compare qualité finale, tokens, boucles et durée, en séparant les incidents de sécurité des erreurs ordinaires.

Le routage peut être plus rentable qu'un modèle unique : Flash-Lite pour extraire ou trier, 3.6 Flash pour planifier ou réparer. Un modèle plus grand ne se justifie que si sa qualité réduit les reprises ou le risque.

Il faut également conserver une voie de retour. Les identifiants de modèles, les quotas et certains outils en préversion peuvent évoluer. Une migration robuste épingle la version utilisée, journalise chaque changement et permet de revenir au modèle précédent si la qualité ou la latence se dégrade. Le prix affiché le jour du lancement ne remplace ni un budget d'alerte ni un plafond de dépense par tâche.

Verdict

Gemini 3.6 Flash est lancé et largement accessible, avec des prix et limites documentés. Les données publiées étayent une meilleure efficacité sur plusieurs tests. Le chiffre « jusqu'à 65 % » est spécifique à un benchmark et aux tokens de sortie, pas une remise universelle. La promesse utile reste mesurable : moins de boucles et de texte peuvent réduire le coût d'une tâche achevée. Seule la télémétrie de production dira de combien.

✔ Comment nous avons vérifié

Vérifié le 22 juillet 2026 avec l'annonce et la documentation API de Google, puis les analyses indépendantes d'Ars Technica et Axios. Les tarifs et limites sont ceux affichés ; les benchmarks et l'exemple à 65 % restent attribués et non généralisés.

Sources

  1. Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash CyberGoogle
  2. Gemini 3.6 Flash model documentationGoogle AI for Developers
  3. Google announces Gemini 3.6 Flash and cybersecurity AIArs Technica
  4. Google releases series of new cheaper Gemini modelsAxios

À lire aussi