Aller au contenu principal

11 articles tagués avec « AI Agent »

Posts tagged with AI Agent

Voir tous les tags

GPT-6 Astra : prix, fonctionnalités, retours de la communauté et comparaison avec Claude et Gemini

· 10 minutes de lecture
Claude Dev
Claude Dev

OpenAI a lancé GPT-6 Astra, son nouveau modèle phare pour le raisonnement complexe, le génie logiciel, l’utilisation d’un ordinateur, la recherche et la création de documents. L’annonce ne se résume pas à « un modèle plus intelligent » : Astra est conçu pour exécuter un workflow complet à travers le code, les navigateurs et les logiciels professionnels, tout en demandant des précisions lorsque l’incertitude peut modifier le résultat.

Dans l’API, le modèle utilise l’identifiant gpt-6-astra. OpenAI indique que le déploiement a commencé auprès d’un nombre limité d’organisations avant de s’étendre aux offres ChatGPT Plus, Pro, Business et Enterprise, ainsi qu’à Azure et Amazon Bedrock. Le tarif API Standard est de 10 $ par million de tokens en entrée et 50 $ par million en sortie. Le cache et le mode Fast sont facturés séparément ; Fast coûte deux fois le tarif Standard.

Ce prix place Astra dans la même catégorie premium que Claude Fable 5.1, alors que Gemini 3.8 Flash reste beaucoup moins cher par token. Les premiers retours de la communauté rendent la comparaison plus intéressante : les utilisateurs apprécient le coding et la recherche, mais signalent aussi une forte consommation de tokens, une initiative parfois excessive, un déploiement confus et une écriture créative moins convaincante.

La conclusion pratique est la suivante : GPT-6 Astra est un excellent modèle d’escalade, pas un remplacement automatique de chaque appel à Claude ou Gemini.

Claude Fable 5.1 et Mythos 5.1 : le modèle frontier que l'on peut utiliser — et celui que l'on ne peut pas

· 14 minutes de lecture
Claude Dev
Claude Dev

Anthropic a lancé Claude Fable 5.1 et Claude Mythos 5.1 le 1er septembre 2026. Les deux modèles reposent sur le même modèle sous-jacent, mais leurs garde-fous diffèrent : Fable 5.1 est disponible généralement, tandis que Mythos 5.1 est réservé aux organisations vérifiées dans le cadre des programmes d'accès de confiance d'Anthropic.

Ce lancement compte pour deux raisons. D'une part, Anthropic annonce des progrès importants en coding de longue durée, recherche, documents, feuilles de calcul, présentations, vision et utilisation de l'ordinateur. D'autre part, l'entreprise essaie de rendre un modèle de classe Fable plus exploitable en production en réduisant le prix des lectures de cache, en affinant le routage de sécurité et en introduisant une architecture de supervision contrôlée par le client pour les entreprises.

Les premières réactions de la communauté sont enthousiastes face au travail difficile et désordonné, mais beaucoup plus prudentes sur la vitesse, les limites d'usage, le style, les garde-fous, la conservation des données et la baisse réelle de la facture. La lecture la plus juste est donc la suivante : Fable 5.1 ressemble à un moteur de travail spécialisé, pas à un modèle qu'il faudrait activer aveuglément pour chaque prompt.

Gemini 3.8 Flash face à Claude : la nouvelle bataille du coût et des performances pour les agents IA

· 10 minutes de lecture
Claude Dev
Claude Dev

Google a lancé Gemini 3.8 Flash le 2 septembre 2026, en le présentant comme son modèle Flash le plus intelligent et en le rendant disponible pour la production. Le lancement comprend aussi Gemini 3.8 Flash Cyber, réservé aux défenseurs en cybersécurité dans le cadre d’un accès de confiance.

Gemini 3.8 Flash ne cherche pas à gagner par la taille. Sa proposition combine un contexte de 1 million de tokens, des entrées multimodales, le grounding Google, un raisonnement configurable, une exécution rapide et un prix API de lancement de 0,75 $ par million de tokens en entrée et 3,75 $ par million en sortie jusqu’au 31 décembre 2026.

Cette tarification change la comparaison avec Claude. Fable 5.1 est le plus proche par son ambition sur les tâches longues, mais coûte 10/50 $ par million de tokens. Opus 5 coûte 5/25 $, et Sonnet 5 2/10 $. Gemini est donc beaucoup moins cher à l’unité, mais Google précise que les tâches difficiles peuvent consommer davantage de tokens de raisonnement et d’appels d’outils.

Les premiers retours sont encourageants sans être conclusifs : certains utilisateurs trouvent 3.8 Flash plus complet et moins pressé que 3.7, tandis que d’autres signalent davantage de latence, de quota consommé et des déploiements variables. La bonne question n’est pas « quel modèle est le plus intelligent en général ? », mais lequel fournit le meilleur résultat accepté par dollar, par minute et par cycle de revue humaine ?

Claude Opus 5 : le modèle frontier du quotidien attendu par les équipes Claude Code

· 11 minutes de lecture
Claude Dev
Claude Dev

Anthropic a publié Claude Opus 5 le 24 juillet 2026, en le positionnant comme le modèle frontier du quotidien dans la famille Claude 5 : proche de l'intelligence de Claude Fable 5, mais au même prix qu'Opus 4.8, soit 5 dollars par million de tokens d'entrée et 25 dollars par million de tokens de sortie.

Ce prix est le vrai sujet.

Fable 5 reste le modèle pour les tâches les plus difficiles, les plus longues et les plus autonomes. Sonnet 5 est le modèle agent par défaut que la plupart des équipes peuvent utiliser largement. Opus 5 se place entre les deux : assez fort pour du vrai travail d'ingénierie, moins contraint que Fable dans les workflows courants, et assez abordable pour être utilisé tous les jours plutôt que seulement lors d'escalades rares.

Les premiers retours de la communauté sont positifs, mais pas encore stabilisés. Sur X, les réactions portent surtout sur la qualité en medium effort et l'efficacité token. Reddit et Hacker News sont plus prudents, avec des questions sur les usage limits, le churn des modèles, les safety fallbacks et la valeur réelle d'un nouvel Opus dans des sessions de code désordonnées. Ce scepticisme est sain.

GPT-5.6 Sol, Terra, and Luna: What Claude Code Teams Should Actually Watch

· 9 minutes de lecture
Claude Dev
Claude Dev

OpenAI released GPT-5.6 Sol, Terra, and Luna on July 10, 2026, and the interesting part is not just that another frontier model arrived. It is that OpenAI is now making the model family itself part of the developer workflow.

For Claude Code users, the useful question is not "is GPT-5.6 better than Claude?" That is too vague to help anyone ship software.

The better question is: which layer of work is each model trying to own?

OpenAI's answer is clear. Sol is the strongest reasoning and agent model, Terra is the faster coding workhorse, and Luna is the high-throughput batch option. Early community feedback on X, Reddit, and developer forums is still noisy, but the shape of the conversation is already familiar: excitement around coding and agents, skepticism around cost, and a lot of "show me on my repo" energy.

Claude Fable and the Real Skill of Agentic Coding: Finding Your Unknowns

· 8 minutes de lecture
Claude Dev
Claude Dev

Anthropic's latest Claude Code post, "A field guide to Claude Fable 5: Finding your unknowns," is not really about a new prompt trick.

It is about a shift that every serious Claude Code user is going to feel: as models get better at carrying long tasks, the limiting factor moves from raw model capability to how well the human can expose the real shape of the work.

That is the point of the "map and territory" framing in the official post. The map is what we give Claude: prompts, skills, files, specs, screenshots, references, and context. The territory is the actual system: production constraints, old decisions, implicit taste, hidden business rules, edge cases, and the parts of the codebase nobody writes down.

The gap between those two is where agentic coding succeeds or fails.

Claude Sonnet 5 : le nouveau modèle agent par défaut pour Claude Code

· 10 minutes de lecture
Claude Dev
Claude Dev

Anthropic a publié Claude Sonnet 5 le 30 juin 2026, en le présentant comme le modèle Sonnet le plus agentique à ce jour et le nouveau modèle par défaut pour les utilisateurs Claude Free et Pro.

Le message est clair : Sonnet 5 apporte dans une couche moins chère, plus rapide et largement disponible une grande partie du travail agentique qui exigeait récemment des modèles de classe Opus. Il peut planifier, utiliser navigateurs et terminaux, gérer de longues tâches de code, et fonctionne avec adaptive thinking par défaut.

Pour les utilisateurs Claude Code, Sonnet 5 est plus important qu'un simple rafraîchissement de modèle. Il va probablement devenir la couche d'exécution par défaut de nombreuses équipes : pas le modèle le plus fort d'Anthropic, mais celui que les développeurs utiliseront le plus souvent.

La mise à niveau n'est pas sans friction. Sonnet 5 a un nouveau tokenizer, un comportement API différent autour de thinking et des sampling parameters, des cyber safeguards temps réel, et un prix moins cher qu'Opus par token mais pas toujours par tâche.

Claude Fable 5 : puissant, cher et volontairement contraint

· 11 minutes de lecture
Claude Dev
Claude Dev

Anthropic a publié Claude Fable 5 le 9 juin 2026, en donnant aux utilisateurs payants de Claude et aux développeurs accès à une version publique et sécurisée de ses capacités de classe Mythos.

Le titre n'est pas seulement que Fable 5 est plus capable. Anthropic teste surtout un nouveau modèle de diffusion : donner au public accès à la famille de modèles la plus puissante qu'elle ait jamais rendue largement disponible, tout en routant le travail sensible hors du modèle quand la requête touche à la cybersécurité, à la biologie, à la chimie, à la distillation ou à certains chemins de frontier AI development.

Cela fait de Fable 5 une sortie Claude particulièrement importante pour les développeurs. Les premiers retours oscillent entre l'admiration pour les capacités de longue durée du modèle et la frustration face à l'accès, au safety routing, au coût et au traitement des données d'entreprise.

Pour les équipes Claude Code, la question pratique n'est pas "faut-il tout basculer sur Fable ?" Elle est : quelles tâches valent le coût de Fable 5, et quelles tâches seront cassées ou déformées par ses safeguards ?

Claude Managed Agents : ce qui vient vraiment d'être lancé

· 10 minutes de lecture
Claude Dev
Claude Dev

Si vous construisez avec Claude, l'important à propos de Claude Managed Agents n'est pas qu'Anthropic a sorti « une nouvelle fonctionnalité d'agent ».

L'important, c'est qu'Anthropic vient de monter d'un niveau dans la stack.

Au lieu de vendre seulement l'accès aux modèles et des primitives d'outillage, Anthropic vend maintenant une runtime managée pour des agents longue durée : définition de l'agent, environnement cloud, sessions, streaming d'événements, outils intégrés, et le harness opérationnel qui maintient l'ensemble en vie.

Cela déplace la conversation développeur de :

  • « Comment câbler une boucle d'agent ? »
  • « Comment la rendre reprenable, observable et sûre ? »

vers :

  • « Que doit réellement faire mon agent ? »
  • « Où veux-je garder le contrôle, et où suis-je prêt à laisser Anthropic gérer l'infrastructure ? »

Chronologie Conway : comment Anthropic construit des agents always-on

· 10 minutes de lecture
Claude Dev
Claude Dev

Le point le plus important à bien comprendre au sujet de Conway est le suivant :

Conway n'est pas un produit Anthropic officiellement lancé.

Aujourd'hui, ce que l'on voit est un mélange de :

  • lancements officiels autour de Cowork, Dispatch, computer use, scheduled tasks et auto mode
  • documentation actuelle du centre d'aide qui montre comment ces briques s'assemblent
  • un article tiers publié le 1er avril 2026 qui évoque un environnement interne non publié appelé Conway

Si vous ne regardez que la fuite, vous ratez l'architecture. Si vous ne regardez que les annonces officielles, vous ratez la direction.

L'histoire technique se trouve dans la combinaison des deux.