Saltar al contenido principal

Gemini 3.8 Flash frente a Claude: la nueva batalla de coste y rendimiento para agentes

· 10 min de lectura
Claude Dev
Claude Dev

Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026, presentándolo como su modelo Flash más inteligente y dejándolo disponible para producción. El lanzamiento incluye también Gemini 3.8 Flash Cyber, un modelo de acceso confiable para defensores de ciberseguridad.

Gemini 3.8 Flash no intenta ganar por tamaño. Su propuesta combina 1M de tokens de contexto, entrada multimodal, grounding de Google, thinking configurable, servicio rápido y un precio introductorio de 0,75 dólares por millón de tokens de entrada y 3,75 dólares por millón de tokens de salida hasta el 31 de diciembre de 2026.

Eso cambia la comparación con Claude. El equivalente más cercano por ambición de largo recorrido es Claude Fable 5.1, que cuesta 10/50 dólares por millón; Claude Opus 5 cuesta 5/25; y el resumen actual de Anthropic lista Claude Sonnet 5 a 2/10. Gemini 3.8 Flash es mucho más barato por token, pero Google advierte que puede consumir más tokens de razonamiento y más llamadas a herramientas en tareas difíciles.

Las primeras reacciones son prometedoras, aunque no concluyentes. Usuarios dicen que 3.8 Flash es menos apresurado y más completo que 3.7; otros señalan mayor latencia, consumo de cuota, despliegue irregular y mejoras poco claras en conjuntos pequeños. La pregunta correcta no es “¿Gemini es más inteligente que Claude?”, sino: ¿qué modelo entrega el mejor resultado terminado por dólar, minuto y ciclo de revisión humana?

Qué lanzó Google

El modelo de producción es gemini-3.8-flash, diseñado para ingeniería de software de largo recorrido, agentes autónomos y workflows empresariales complejos.

Sus especificaciones principales son:

  • Entradas: texto, imagen, vídeo, audio y PDF.
  • Salida: texto.
  • Límite de entrada: 1.048.576 tokens.
  • Límite de salida: 65.536 tokens, incluidos los tokens de thinking en la salida facturada.
  • Thinking: low, medium y high; medium es el valor predeterminado. minimal no es compatible.
  • Herramientas: grounding con Google Search y Maps, URL context, file search, code execution, function calling, structured outputs, caching y computer use en preview.
  • Modos de servicio: Standard, Batch, Flex y Priority.
  • Precio Standard introductorio: $0,75/$3,75 hasta finales de 2026; $1,50/$7,50 desde el 1 de enero de 2027.

El contexto en caché cuesta 0,075 dólares por millón de tokens hasta finales de 2026, además de almacenamiento. Batch y Flex cuestan la mitad del precio de tokens Standard, mientras que Priority es más caro. Google AI Studio ofrece una capa gratuita, pero Google indica que ese contenido puede usarse para mejorar sus productos; en el uso de pago no se utiliza para ese fin.

La decisión central: Gemini trabaja más cuando la tarea lo exige

Google afirma que 3.8 Flash mejora a 3.7 en ingeniería de software, tareas agentic, razonamiento especializado y workflows empresariales. En tareas complejas, da más pasos de razonamiento, llama a herramientas de forma iterativa y verifica el resultado.

low está pensado para pipelines sensibles a la latencia, chat en tiempo real, borradores y análisis rápido. medium es la recomendación para coding complejo y agentes. high maximiza el razonamiento y la orquestación de herramientas.

La comparación con Claude queda así:

  • Gemini 3.8 Flash: low/medium/high, con medium por defecto.
  • Claude Sonnet 5: adaptive thinking y control mediante effort, para ejecución diaria.
  • Claude Opus 5: adaptive thinking, high por defecto, 1M de contexto y $5/$25.
  • Claude Fable 5.1: adaptive thinking siempre activo, high por defecto, 1M de contexto y $10/$50 para trabajo difícil de largo recorrido.

Por eso el precio por token no equivale al precio por tarea. Un modelo barato que usa el doble de tokens, hace más llamadas o requiere más corrección humana puede dejar de ser barato.

Comparación Gemini–Claude

ModeloContextoSalida máximaEntrada / salidaControl de razonamientoMejor para
Gemini 3.8 Flash1M64K$0,75 / $3,75 hasta 2026low/medium/highAgentes rápidos, multimodales y sensibles al coste
Claude Sonnet 51M128K$2 / $10Adaptive + effortCoding diario y ejecución general
Claude Opus 51M128K$5 / $25Adaptive + effortIngeniería compleja y empresa
Claude Fable 5.11M128K$10 / $50Adaptive, siempre activoResearch y tareas difíciles de largo recorrido

No es una clasificación de calidad. Gemini documenta entrada de audio, vídeo y PDF, además de Search, Maps, URL context y computer use en preview. Anthropic describe sus modelos actuales principalmente como entrada de texto e imagen a salida de texto, con vision y tool use. Para productos que necesitan recibir audio o vídeo en el mismo modelo, Gemini tiene aquí una superficie documentada más amplia.

Claude responde con más espacio de salida, un camino de escalado claro en Claude Code y documentación detallada sobre estado de conversación, thinking blocks, fallbacks y migración. Google aporta grounding de Search y Maps, multimodalidad y distintos modos de servicio.

El precio: la mayor ventaja de Gemini y su mayor trampa

Con el precio Standard introductorio de 2026, Gemini 3.8 Flash cuesta aproximadamente:

  • el 37,5% del precio de Sonnet 5 en entrada y salida;
  • el 15% del precio de Opus 5;
  • el 7,5% del precio de Fable 5.1.

Pero faltan las búsquedas, consultas de Maps, almacenamiento de caché, ejecución de herramientas, retries, revisión humana y tokens de razonamiento. Google avisa expresamente de que el modelo puede usar más tokens en tareas largas y complejas.

La métrica correcta es:

coste por resultado aceptado
= tokens + herramientas + grounding + retries + tiempo de revisión

Para extracción de alto volumen, borradores y subagentes pequeños, Gemini resulta muy atractivo. En una migración difícil, una hora adicional de revisión puede borrar el descuento de tokens.

Dónde Gemini tiene una historia más fuerte

Multimodalidad y grounding de Google

Gemini puede recibir texto, imágenes, vídeo, audio y PDF, y combinar Search, Maps, URL context, file search y code execution. Para asistentes que saltan entre documentos, web, mapas, repositorios y herramientas, esto puede reducir integración.

Routing sensible al coste

Con low para turnos rutinarios, medium para agentes normales y high solo para tareas difíciles, Gemini se comporta como un workhorse barato. Batch y Flex permiten intercambiar latencia por precio.

Una variante Cyber separada

Gemini 3.8 Flash Cyber se ofrece a defensores verificados mediante el Fairwind Program. Anthropic tiene una división paralela entre Fable 5.1, con safeguards generales, y Mythos 5.1, con acceso restringido y políticas más permisivas para cyber y biología. En ambos casos, hay que confirmar acceso, logging, retención y categorías permitidas.

Dónde Claude conserva ventaja

Claude Opus 5 y Fable 5.1 ofrecen 128K de salida frente a los 64K de Gemini 3.8 Flash. Eso importa para código generado, informes, artefactos grandes y respuestas estructuradas extensas.

También hay una escalera clara para Claude Code: Sonnet 5 para ejecución amplia, Opus 5 para ingeniería compleja y Fable 5.1 cuando incluso Opus con effort alto se queda corto. Gemini puede cubrir más casos intermedios a menor precio, especialmente dentro de Antigravity, pero Claude ofrece una ruta premium más obvia.

Por último, los harnesses personalizados necesitan pruebas separadas en ambos proveedores. Fable 5.1 vincula thinking blocks al historial, limita forced tool choice y exige gestionar refusal/fallback; Gemini tiene sus propios contratos de thinking, grounding y herramientas. Un model ID barato no equivale a compatibilidad.

Lo que dicen los primeros usuarios

En r/GeminiAI, algunos usuarios describen 3.8 Flash como rápido, más factual y detallado que 3.7, y menos perezoso con prompts serios. Otros lo consideran lento, propenso a errores o todavía sujeto a despliegues diferentes por cuenta y aplicación.

En comunidades de Google Antigravity, se repite que el modelo analiza mejor los repositorios y encuentra problemas, pero consume más cuota y puede tardar mucho más. Esto coincide con la documentación de Google sobre más pasos de razonamiento y más llamadas a herramientas.

Una comparación comunitaria en 98 tareas MindTrial informó 86/98 para Gemini 3.8 Flash, frente a 90/98 para Fable 5.1 y 88/98 para Opus 5. También registró unos 106 minutos para Gemini 3.8, frente a 63 minutos para 3.7, y un aumento aproximado de 660K a 1,57M tokens de razonamiento. Es una señal interesante, no un benchmark definitivo: un usuario, un harness, un conjunto de tareas y una configuración high.

La imagen inicial es condicional: Gemini gana en precio, velocidad de entrada y multimodalidad; Fable parece más fuerte en trabajo difícil de largo recorrido; ambos pueden gastar más compute de lo esperado cuando planifican, usan herramientas y verifican.

Política práctica de routing

TareaPrimer modelo a probarEscalado
Extracción masiva, borradores y transformaciones simplesGemini 3.8 Flash low/mediumSonnet 5
Documentos multimodales, audio, vídeo, PDF o mapasGemini 3.8 FlashOpus 5
Ediciones rutinarias de repositorioGemini medium o Sonnet 5Opus 5
Migraciones grandes y debugging entre serviciosOpus 5Fable 5.1
Research largo y decisiones encadenadasOpus 5 o Fable 5.1Fable 5.1
Cyber defensivo aprobadoFlash Cyber o MythosRevisión humana

La elección final depende del producto. Una aplicación centrada en Google, con Search, Maps, archivos multimodales y presupuesto estricto, puede preferir Gemini. Un equipo de Claude Code con un coste alto de errores de causa raíz puede preferir Claude. Un router híbrido es posible, siempre que el handoff conserve el contexto y no cree más trabajo de revisión del que ahorra.

Cómo evaluarlos

Usa el mismo replay set y mide finalización aceptada, partial credit, tiempo total, tiempo hasta el primer output útil, tokens de entrada/salida/razonamiento, llamadas a herramientas, grounding, retries, refusals, correcciones humanas, contexto al fallar, coste por resultado aceptado y cumplimiento de las convenciones del repositorio.

Prueba los tres thinking levels de Gemini. No compares Gemini high con Claude low, ni un chat sin herramientas con un agente con herramientas. En Claude, evalúa Sonnet 5, Opus 5 y Fable 5.1 con los niveles de effort que realmente pagarías.

Conclusión

Gemini 3.8 Flash es un candidato fuerte para agentes de alto volumen, productos integrados con Google y workloads sensibles al coste: ofrece 1M de contexto, entradas multimodales, grounding y thinking configurable a un precio muy bajo.

Claude conserva una ventaja premium en el workflow: Sonnet 5 es el ejecutor diario, Opus 5 la opción de ingeniería compleja y Fable 5.1 la escalada para trabajos largos donde una mejor causa raíz puede pagar el modelo.

La comunidad y las especificaciones apuntan a la misma conclusión: Gemini 3.8 Flash es barato, rápido y capaz, pero puede gastar su ventaja en más razonamiento y herramientas. Claude cuesta más, pero puede justificarse cuando un giro equivocado sale caro.

No preguntes quién gana en abstracto. Ejecuta tu replay set, mide el resultado aceptado y enruta por forma de tarea. En 2026, la unidad competitiva es el mejor workflow completado por dólar.

Fuentes revisadas