Aller au contenu principal

Gemini 3.8 Flash face à Claude : la nouvelle bataille du coût et des performances pour les agents IA

· 10 minutes de lecture
Claude Dev
Claude Dev

Google a lancé Gemini 3.8 Flash le 2 septembre 2026, en le présentant comme son modèle Flash le plus intelligent et en le rendant disponible pour la production. Le lancement comprend aussi Gemini 3.8 Flash Cyber, réservé aux défenseurs en cybersécurité dans le cadre d’un accès de confiance.

Gemini 3.8 Flash ne cherche pas à gagner par la taille. Sa proposition combine un contexte de 1 million de tokens, des entrées multimodales, le grounding Google, un raisonnement configurable, une exécution rapide et un prix API de lancement de 0,75 $ par million de tokens en entrée et 3,75 $ par million en sortie jusqu’au 31 décembre 2026.

Cette tarification change la comparaison avec Claude. Fable 5.1 est le plus proche par son ambition sur les tâches longues, mais coûte 10/50 $ par million de tokens. Opus 5 coûte 5/25 $, et Sonnet 5 2/10 $. Gemini est donc beaucoup moins cher à l’unité, mais Google précise que les tâches difficiles peuvent consommer davantage de tokens de raisonnement et d’appels d’outils.

Les premiers retours sont encourageants sans être conclusifs : certains utilisateurs trouvent 3.8 Flash plus complet et moins pressé que 3.7, tandis que d’autres signalent davantage de latence, de quota consommé et des déploiements variables. La bonne question n’est pas « quel modèle est le plus intelligent en général ? », mais lequel fournit le meilleur résultat accepté par dollar, par minute et par cycle de revue humaine ?

Ce que Google a publié

Le modèle API de production utilise l’identifiant stable gemini-3.8-flash. Google le destine au génie logiciel sur longue durée, aux agents autonomes et aux workflows d’entreprise complexes.

Son profil API comprend :

  • Entrées : texte, images, vidéo, audio et PDF.
  • Sortie : texte.
  • Limite d’entrée : 1 048 576 tokens.
  • Limite de sortie : 65 536 tokens, avec les tokens de raisonnement inclus dans la sortie facturée.
  • Niveaux de raisonnement : low, medium et high; medium est le niveau par défaut et minimal n’est pas pris en charge.
  • Outils : Search grounding, Google Maps grounding, URL Context, File Search, Code Execution, Function Calling, sorties structurées, caching et Computer Use en preview.
  • Modes de service : Standard, Batch, Flex et Priority.

Le tarif Standard de lancement est de 0,75/3,75 $ par million de tokens en entrée/sortie jusqu’à la fin de 2026. Il passe à 1,50/7,50 $ le 1er janvier 2027. Batch et Flex divisent par deux le prix des tokens par rapport à Standard, tandis que Priority est plus cher. Le cache ajoute des coûts de tokens et de stockage.

Google AI Studio propose une offre gratuite, mais Google indique que son contenu peut servir à améliorer ses produits. Selon la page tarifaire, l’usage API payant n’est pas utilisé à cette fin. Cette différence doit faire partie de l’analyse de coût et de conformité en production.

Le choix central : Gemini travaille davantage quand la tâche est difficile

Google annonce des progrès en génie logiciel, tâches agentiques, raisonnement spécialisé et workflows d’entreprise. Le modèle peut effectuer davantage d’étapes de raisonnement, appeler plusieurs fois les outils et vérifier son travail pendant l’exécution.

low convient aux pipelines d’incidents, au chat temps réel, aux brouillons et à l’analyse rapide. medium est le point de départ conseillé pour le code complexe et les agents. high maximise le raisonnement et l’orchestration d’outils.

Claude expose un compromis comparable, mais différemment :

  • Gemini 3.8 Flash : low / medium / high, avec medium par défaut.
  • Claude Sonnet 5 : raisonnement adaptatif avec contrôle effort, pour l’exécution quotidienne rapide.
  • Claude Opus 5 : raisonnement adaptatif, effort élevé par défaut, contexte de 1 million et prix de 5/25 $.
  • Claude Fable 5.1 : raisonnement adaptatif toujours actif, effort élevé par défaut, contexte de 1 million et prix de 10/50 $ pour les tâches longues les plus difficiles.

Le prix du token n’est donc pas le prix de la tâche. Un modèle moins cher peut utiliser deux fois plus de tokens, multiplier les appels d’outils ou demander davantage de corrections humaines.

Gemini 3.8 Flash face à Claude : comparaison technique

ModèleContexteSortie max.Entrée / sortie APIContrôle du raisonnementUsage privilégié
Gemini 3.8 Flash1 M64K0,75 / 3,75 $ jusqu’à fin 2026low / medium / highAgents rapides, multimodaux et sensibles au coût
Claude Sonnet 51 M128K2 / 10 $Adaptatif + effortCoding quotidien et exécution générale
Claude Opus 51 M128K5 / 25 $Adaptatif + effortIngénierie complexe et entreprise
Claude Fable 5.11 M128K10 / 50 $Adaptatif, toujours actifRaisonnement long, recherche et migrations difficiles

Ce tableau n’est pas un classement de qualité. Gemini documente nativement les entrées audio, vidéo et PDF, ainsi que Search grounding, Maps grounding, URL Context et Computer Use en preview. Claude propose des entrées texte et image, la vision et l’utilisation d’outils. Pour un produit centré sur Google, cette surface peut réduire le travail d’intégration.

Claude conserve un avantage de capacité de sortie : Opus 5 et Fable 5.1 montent à 128K tokens de sortie. Anthropic documente aussi les blocs de raisonnement, l’état des agents et les mécanismes de fallback. Un banc d’essai multi-fournisseur doit tester séparément les appels d’outils, le contexte, les sorties structurées et les reprises.

Le prix est le plus grand avantage de Gemini — et son piège

Au tarif de lancement 2026, Gemini 3.8 Flash revient à environ 37,5 % du prix de Sonnet 5, 15 % de celui d’Opus 5 et 7,5 % de celui de Fable 5.1, en entrée comme en sortie.

Ces ratios excluent les requêtes Search et Maps, le stockage du cache, l’exécution des outils, les retries, la revue humaine et le raisonnement supplémentaire. Une métrique plus utile est :

coût par résultat accepté
= tokens + appels d’outils + grounding + retries + temps de revue

Pour l’extraction à grande échelle, les brouillons et les petits sous-agents, l’avantage de Gemini est convaincant. Pour une migration difficile, une heure supplémentaire de revue peut annuler la remise sur les tokens. Fable 5.1 est cher parce qu’il vise les tâches où rater la cause racine coûte plus cher que l’inférence.

Les points forts de Gemini

1. Entrées multimodales et grounding Google

Gemini 3.8 Flash accepte texte, images, vidéo, audio et PDF, puis peut les relier à Search, Maps, URL Context, File Search et Code Execution. C’est une base pratique pour les assistants qui passent d’un document à une page web, une carte, un dépôt de code et un résultat d’outil.

2. Routage d’agents sensible au coût

low pour les tours courants, medium pour les agents normaux et high seulement lorsque la tâche le justifie forment une politique de routage simple. Batch et Flex ajoutent d’autres compromis coût-latence. Si la qualité des tâches acceptées est comparable, l’économie favorise Gemini.

3. Une variante cyber dédiée

Google propose Gemini 3.8 Flash Cyber aux défenseurs de confiance via le programme Fairwind. Anthropic sépare de façon comparable Fable 5.1 et Mythos 5.1, à accès restreint. Pour la sécurité défensive, vérifiez le programme d’accès, les logs, la rétention et les catégories de tâches autorisées.

Là où Claude reste plus convaincant

1. Davantage de marge en sortie

La sortie maximale de 128K tokens d’Opus 5 et Fable 5.1 compte pour le code généré, les rapports volumineux et les agents qui doivent renvoyer beaucoup de travail structuré en une seule réponse.

2. Une escalade plus lisible dans Claude Code

Sonnet 5 couvre l’exécution générale, Opus 5 l’ingénierie complexe et Fable 5.1 les tâches longues les plus difficiles. Anthropic recommande de commencer le plus souvent avec Opus 5, puis de passer à Fable lorsque même un effort élevé échoue. Pour une équipe déjà équipée de Claude Code, cette progression premium est facile à comprendre.

3. Des contrats d’état pour les agents personnalisés

Fable 5.1 demande de traiter soigneusement les blocs de raisonnement, l’historique append-only, les outils et les états de refus ou de fallback. Cela augmente le coût de migration, mais rend les longues sessions plus testables. La compatibilité ne doit jamais être déduite du seul prix par token.

Ce que rapportent les premiers utilisateurs

Sur r/GeminiAI, des utilisateurs décrivent 3.8 Flash comme toujours rapide, plus factuel et détaillé que 3.7, et moins « lazy » sur les prompts sérieux. D’autres signalent des erreurs, de la lenteur ou un déploiement différent selon le compte et l’application.

Dans les communautés Google Antigravity, certains rapportent que 3.8 Flash analyse mieux les dépôts et trouve davantage de problèmes, mais consomme plus de temps et de quota. Cela correspond à la documentation de Google : les tâches complexes peuvent entraîner plus de tokens de raisonnement et d’appels d’outils.

Un test communautaire de 98 tâches MindTrial rapporte 86/98 pour Gemini 3.8 Flash, 90/98 pour Fable 5.1 et 88/98 pour Opus 5. Le même test mesure environ 1 h 46 pour Gemini 3.8, contre 1 h 03 pour 3.7, avec des tokens de raisonnement passant d’environ 660K à 1,57 M. C’est un signal directionnel issu d’un seul jeu de tâches et d’un seul harness, pas un benchmark définitif.

Politique de routage pratique

TâchePremier modèle à testerEscalade
Extraction à fort volume, brouillons, transformations simplesGemini 3.8 Flash low/mediumSonnet 5
Documents multimodaux, audio, vidéo, PDF ou cartesGemini 3.8 FlashOpus 5
Modifications de dépôt et boucles de tests courantesGemini medium ou Sonnet 5Opus 5
Grande migration ou débogage interservicesOpus 5Fable 5.1
Recherche sur longs documents et décisions dépendantesOpus 5 ou Fable 5.1Fable 5.1
Cybersécurité défensive approuvéeFlash Cyber ou MythosRevue humaine

Checklist d’évaluation

Utilisez le même jeu de tâches et mesurez le taux de réussite accepté, les scores partiels, le temps total, le temps avant la première sortie utile, les tokens d’entrée/sortie/raisonnement, les appels d’outils et de grounding, les retries, les refus, les corrections humaines, la longueur du contexte à l’échec, le coût par résultat accepté et le respect des conventions du projet.

Testez les trois niveaux de Thinking de Gemini. Ne comparez pas Gemini en high à Claude en low, ni un chat sans outils à un agent outillé. Pour Claude, testez Sonnet 5, Opus 5 et Fable 5.1 avec les niveaux d’effort réellement payés.

Conclusion

Gemini 3.8 Flash est un candidat particulièrement fort pour les agents à fort volume et les workflows intégrés à Google : contexte de 1 million, entrées multimodales, grounding et Thinking réglable pour un prix très bas.

Claude conserve une voie premium claire : Sonnet 5 pour l’exécution quotidienne, Opus 5 pour l’ingénierie complexe et Fable 5.1 pour les tâches longues où une meilleure analyse de la cause racine justifie le coût.

Les spécifications et les premiers retours convergent : Gemini est bon marché, rapide et capable, mais peut dépenser son avantage en raisonnement et en appels d’outils supplémentaires. Ne choisissez donc pas sur une démo ou une étiquette. Mesurez le résultat accepté et routez selon la forme de la tâche.

Sources