Saltar al contenido principal

11 publicaciones etiquetados con "AI Agent"

Posts tagged with AI Agent

Ver Todas las Etiquetas

GPT-6 Astra: precio, funciones, opiniones de la comunidad y comparación con Claude y Gemini

· 10 min de lectura
Claude Dev
Claude Dev

OpenAI ha lanzado GPT-6 Astra, su nuevo modelo insignia para razonamiento complejo, ingeniería de software, uso del ordenador, investigación y creación de documentos. La novedad no es únicamente que sea «más inteligente»: Astra está diseñado para ejecutar un flujo de trabajo completo entre código, navegadores y software profesional, y para pedir aclaraciones cuando una decisión pueda cambiar el resultado.

En la API, el modelo se identifica como gpt-6-astra. OpenAI afirma que el despliegue comenzó con un conjunto limitado de organizaciones y se está ampliando a ChatGPT Plus, Pro, Business y Enterprise, además de Azure y Amazon Bedrock. El precio API Standard es de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida. La caché y el modo Fast se cobran por separado; Fast cuesta el doble que Standard.

Este precio coloca a Astra en la misma gama premium que Claude Fable 5.1, mientras que Gemini 3.8 Flash sigue siendo mucho más barato por token. Los primeros comentarios de la comunidad hacen que la comparación sea menos simple: se elogia su coding y su capacidad de investigación, pero también se mencionan un consumo elevado de tokens, iniciativa irregular, confusión durante el despliegue y una experiencia de escritura creativa menos convincente.

La conclusión práctica es clara: GPT-6 Astra parece un modelo potente de escalado, no un sustituto automático de cada llamada a Claude o Gemini.

Claude Fable 5.1 y Mythos 5.1: el modelo frontier que puedes usar y el que no

· 14 min de lectura
Claude Dev
Claude Dev

Anthropic lanzó Claude Fable 5.1 y Claude Mythos 5.1 el 1 de septiembre de 2026. Son el mismo modelo subyacente con salvaguardas distintas: Fable 5.1 está disponible de forma general, mientras que Mythos 5.1 se ofrece únicamente a organizaciones verificadas mediante los programas de acceso confiable de Anthropic.

El lanzamiento importa por dos motivos. Primero, Anthropic afirma que Fable 5.1 mejora de forma notable la programación de larga duración, la investigación, los documentos, las hojas de cálculo, las presentaciones, la visión y el uso de ordenadores. Segundo, intenta hacer más viable un modelo de clase Fable en producción al reducir el precio de las lecturas de caché, afinar el enrutamiento de seguridad e introducir una arquitectura empresarial de monitorización controlada por el cliente.

Las primeras reacciones de la comunidad son entusiastas ante el trabajo difícil y desordenado, pero bastante más prudentes respecto a la velocidad, los límites de uso, el estilo de escritura, las salvaguardas, la retención de datos y si el menor precio unitario acaba reduciendo la factura. La lectura más razonable es que Fable 5.1 es un motor de trabajo especializado, no un modelo que convenga activar a ciegas para cada prompt.

Gemini 3.8 Flash frente a Claude: la nueva batalla de coste y rendimiento para agentes

· 10 min de lectura
Claude Dev
Claude Dev

Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026, presentándolo como su modelo Flash más inteligente y dejándolo disponible para producción. El lanzamiento incluye también Gemini 3.8 Flash Cyber, un modelo de acceso confiable para defensores de ciberseguridad.

Gemini 3.8 Flash no intenta ganar por tamaño. Su propuesta combina 1M de tokens de contexto, entrada multimodal, grounding de Google, thinking configurable, servicio rápido y un precio introductorio de 0,75 dólares por millón de tokens de entrada y 3,75 dólares por millón de tokens de salida hasta el 31 de diciembre de 2026.

Eso cambia la comparación con Claude. El equivalente más cercano por ambición de largo recorrido es Claude Fable 5.1, que cuesta 10/50 dólares por millón; Claude Opus 5 cuesta 5/25; y el resumen actual de Anthropic lista Claude Sonnet 5 a 2/10. Gemini 3.8 Flash es mucho más barato por token, pero Google advierte que puede consumir más tokens de razonamiento y más llamadas a herramientas en tareas difíciles.

Las primeras reacciones son prometedoras, aunque no concluyentes. Usuarios dicen que 3.8 Flash es menos apresurado y más completo que 3.7; otros señalan mayor latencia, consumo de cuota, despliegue irregular y mejoras poco claras en conjuntos pequeños. La pregunta correcta no es “¿Gemini es más inteligente que Claude?”, sino: ¿qué modelo entrega el mejor resultado terminado por dólar, minuto y ciclo de revisión humana?

Claude Opus 5: el modelo frontier diario que los equipos de Claude Code pedían

· 11 min de lectura
Claude Dev
Claude Dev

Anthropic lanzó Claude Opus 5 el 24 de julio de 2026, posicionándolo como el modelo frontier diario dentro de la familia Claude 5: cerca de la inteligencia de Claude Fable 5, pero con el mismo precio de Opus 4.8: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida.

Ese precio es la historia.

Fable 5 sigue siendo el modelo para el trabajo más difícil, largo y autónomo. Sonnet 5 es el modelo agente por defecto que la mayoría de equipos puede usar ampliamente. Opus 5 queda entre ambos: suficientemente fuerte para ingeniería seria, menos restringido que Fable en flujos normales, y con precio para uso diario repetido en vez de escalaciones raras.

El feedback temprano de la comunidad es positivo, pero todavía no está asentado. En X domina el entusiasmo por la calidad en medium effort y la eficiencia de tokens. Reddit y Hacker News son más cautos: límites de uso, churn de modelos, safety fallbacks y si otro Opus realmente se siente mejor dentro de sesiones de coding desordenadas. Esa cautela es correcta.

GPT-5.6 Sol, Terra, and Luna: What Claude Code Teams Should Actually Watch

· 9 min de lectura
Claude Dev
Claude Dev

OpenAI released GPT-5.6 Sol, Terra, and Luna on July 10, 2026, and the interesting part is not just that another frontier model arrived. It is that OpenAI is now making the model family itself part of the developer workflow.

For Claude Code users, the useful question is not "is GPT-5.6 better than Claude?" That is too vague to help anyone ship software.

The better question is: which layer of work is each model trying to own?

OpenAI's answer is clear. Sol is the strongest reasoning and agent model, Terra is the faster coding workhorse, and Luna is the high-throughput batch option. Early community feedback on X, Reddit, and developer forums is still noisy, but the shape of the conversation is already familiar: excitement around coding and agents, skepticism around cost, and a lot of "show me on my repo" energy.

Claude Fable and the Real Skill of Agentic Coding: Finding Your Unknowns

· 8 min de lectura
Claude Dev
Claude Dev

Anthropic's latest Claude Code post, "A field guide to Claude Fable 5: Finding your unknowns," is not really about a new prompt trick.

It is about a shift that every serious Claude Code user is going to feel: as models get better at carrying long tasks, the limiting factor moves from raw model capability to how well the human can expose the real shape of the work.

That is the point of the "map and territory" framing in the official post. The map is what we give Claude: prompts, skills, files, specs, screenshots, references, and context. The territory is the actual system: production constraints, old decisions, implicit taste, hidden business rules, edge cases, and the parts of the codebase nobody writes down.

The gap between those two is where agentic coding succeeds or fails.

Claude Sonnet 5: el nuevo modelo agente por defecto para Claude Code

· 10 min de lectura
Claude Dev
Claude Dev

Anthropic publicó Claude Sonnet 5 el 30 de junio de 2026, posicionándolo como el modelo Sonnet más agentic hasta ahora y el nuevo modelo por defecto para usuarios Claude Free y Pro.

La propuesta es clara: Sonnet 5 lleva mucho del trabajo agentic que recientemente requería modelos Opus-class a una capa más barata, rápida y ampliamente disponible. Puede planear, usar navegadores y terminales, manejar tareas largas de coding y ejecutar adaptive thinking por defecto.

Para usuarios de Claude Code, eso hace que Sonnet 5 sea más importante que una actualización normal de modelo. Probablemente se convierta en la capa de ejecución por defecto para muchos equipos: no el modelo más fuerte que ofrece Anthropic, pero sí el que los desarrolladores usarán con más frecuencia.

La actualización no es sin fricción. Sonnet 5 tiene un tokenizer nuevo, cambios de comportamiento en la API alrededor de thinking y sampling parameters, cyber safeguards en tiempo real y una historia de precios que es más barata que Opus por token, pero no siempre por tarea.

Claude Fable 5: potente, caro y limitado por diseño

· 10 min de lectura
Claude Dev
Claude Dev

Anthropic publicó Claude Fable 5 el 9 de junio de 2026, llevando una versión pública y protegida de sus capacidades Mythos-class a usuarios pagos de Claude y desarrolladores.

El titular no es solo que Fable 5 sea más capaz. Es que Anthropic está probando un nuevo patrón de lanzamiento: dar al público acceso a la familia de modelos más fuerte que ha hecho ampliamente disponible, pero enrutar el trabajo sensible fuera del modelo cuando la solicitud toca cybersecurity, biology, chemistry, distillation o algunos caminos de frontier AI development.

Eso hace que Fable 5 sea un lanzamiento de Claude especialmente importante para desarrolladores. El feedback temprano se divide entre asombro por la capacidad de largo horizonte del modelo y frustración por cómo funcionan el acceso, el safety routing, el costo y el manejo de datos empresariales.

Para los equipos de Claude Code, la pregunta práctica no es "¿deberíamos cambiar todo a Fable?" Es: ¿qué tareas son lo bastante valiosas para justificar Fable 5, y qué tareas serán rotas o distorsionadas por sus safeguards?

Claude Managed Agents: qué acaba de lanzarse realmente

· 10 min de lectura
Claude Dev
Claude Dev

Si construyes con Claude, lo importante de Claude Managed Agents no es que Anthropic haya lanzado “otra función de agentes”.

Lo importante es que Anthropic acaba de subir un nivel en la stack.

En lugar de vender solo acceso al modelo y primitivas de herramientas, Anthropic ahora vende una runtime gestionada para agentes de larga duración: definición del agente, entorno cloud, sesiones, streaming de eventos, herramientas integradas y el harness operativo que mantiene todo vivo.

Eso cambia la conversación del desarrollador de:

  • “¿Cómo conecto un bucle de agente?”
  • “¿Cómo lo hago reanudable, observable y seguro?”

a:

  • “¿Qué debe hacer realmente mi agente?”
  • “¿Dónde quiero control y dónde estoy dispuesto a dejar que Anthropic posea la infraestructura?”

Cronología de Conway: cómo Anthropic está construyendo agentes always-on

· 11 min de lectura
Claude Dev
Claude Dev

Lo más importante que hay que entender sobre Conway es esto:

Conway no es un producto de Anthropic lanzado oficialmente.

Lo que existe hoy es una mezcla de:

  • lanzamientos oficiales de Anthropic alrededor de Cowork, Dispatch, computer use, scheduled tasks y auto mode
  • documentación actual del centro de ayuda que muestra cómo encajan esas piezas
  • un informe de terceros del 1 de abril de 2026 que sacó a la luz un entorno interno no lanzado llamado Conway

Si solo miras la filtración, te pierdes la arquitectura. Si solo miras los lanzamientos oficiales, te pierdes hacia dónde parece ir Anthropic.

La historia técnica real es la combinación de ambas cosas.