Gemini 3.8 Flash frente a Claude: la nueva batalla de coste y rendimiento para agentes
Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026, presentándolo como su modelo Flash más inteligente y dejándolo disponible para producción. El lanzamiento incluye también Gemini 3.8 Flash Cyber, un modelo de acceso confiable para defensores de ciberseguridad.
Gemini 3.8 Flash no intenta ganar por tamaño. Su propuesta combina 1M de tokens de contexto, entrada multimodal, grounding de Google, thinking configurable, servicio rápido y un precio introductorio de 0,75 dólares por millón de tokens de entrada y 3,75 dólares por millón de tokens de salida hasta el 31 de diciembre de 2026.
Eso cambia la comparación con Claude. El equivalente más cercano por ambición de largo recorrido es Claude Fable 5.1, que cuesta 10/50 dólares por millón; Claude Opus 5 cuesta 5/25; y el resumen actual de Anthropic lista Claude Sonnet 5 a 2/10. Gemini 3.8 Flash es mucho más barato por token, pero Google advierte que puede consumir más tokens de razonamiento y más llamadas a herramientas en tareas difíciles.
Las primeras reacciones son prometedoras, aunque no concluyentes. Usuarios dicen que 3.8 Flash es menos apresurado y más completo que 3.7; otros señalan mayor latencia, consumo de cuota, despliegue irregular y mejoras poco claras en conjuntos pequeños. La pregunta correcta no es “¿Gemini es más inteligente que Claude?”, sino: ¿qué modelo entrega el mejor resultado terminado por dólar, minuto y ciclo de revisión humana?
Qué lanzó Google
El modelo de producción es gemini-3.8-flash, diseñado para ingeniería de software de largo recorrido, agentes autónomos y workflows empresariales complejos.
Sus especificaciones principales son:
- Entradas: texto, imagen, vídeo, audio y PDF.
- Salida: texto.
- Límite de entrada: 1.048.576 tokens.
- Límite de salida: 65.536 tokens, incluidos los tokens de thinking en la salida facturada.
- Thinking:
low,mediumyhigh;mediumes el valor predeterminado.minimalno es compatible. - Herramientas: grounding con Google Search y Maps, URL context, file search, code execution, function calling, structured outputs, caching y computer use en preview.
- Modos de servicio: Standard, Batch, Flex y Priority.
- Precio Standard introductorio: $0,75/$3,75 hasta finales de 2026; $1,50/$7,50 desde el 1 de enero de 2027.
El contexto en caché cuesta 0,075 dólares por millón de tokens hasta finales de 2026, además de almacenamiento. Batch y Flex cuestan la mitad del precio de tokens Standard, mientras que Priority es más caro. Google AI Studio ofrece una capa gratuita, pero Google indica que ese contenido puede usarse para mejorar sus productos; en el uso de pago no se utiliza para ese fin.
La decisión central: Gemini trabaja más cuando la tarea lo exige
Google afirma que 3.8 Flash mejora a 3.7 en ingeniería de software, tareas agentic, razonamiento especializado y workflows empresariales. En tareas complejas, da más pasos de razonamiento, llama a herramientas de forma iterativa y verifica el resultado.
low está pensado para pipelines sensibles a la latencia, chat en tiempo real, borradores y análisis rápido. medium es la recomendación para coding complejo y agentes. high maximiza el razonamiento y la orquestación de herramientas.
La comparación con Claude queda así:
- Gemini 3.8 Flash:
low/medium/high, conmediumpor defecto. - Claude Sonnet 5: adaptive thinking y control mediante
effort, para ejecución diaria. - Claude Opus 5: adaptive thinking,
highpor defecto, 1M de contexto y $5/$25. - Claude Fable 5.1: adaptive thinking siempre activo,
highpor defecto, 1M de contexto y $10/$50 para trabajo difícil de largo recorrido.
Por eso el precio por token no equivale al precio por tarea. Un modelo barato que usa el doble de tokens, hace más llamadas o requiere más corrección humana puede dejar de ser barato.
Comparación Gemini–Claude
| Modelo | Contexto | Salida máxima | Entrada / salida | Control de razonamiento | Mejor para |
|---|---|---|---|---|---|
| Gemini 3.8 Flash | 1M | 64K | $0,75 / $3,75 hasta 2026 | low/medium/high | Agentes rápidos, multimodales y sensibles al coste |
| Claude Sonnet 5 | 1M | 128K | $2 / $10 | Adaptive + effort | Coding diario y ejecución general |
| Claude Opus 5 | 1M | 128K | $5 / $25 | Adaptive + effort | Ingeniería compleja y empresa |
| Claude Fable 5.1 | 1M | 128K | $10 / $50 | Adaptive, siempre activo | Research y tareas difíciles de largo recorrido |
No es una clasificación de calidad. Gemini documenta entrada de audio, vídeo y PDF, además de Search, Maps, URL context y computer use en preview. Anthropic describe sus modelos actuales principalmente como entrada de texto e imagen a salida de texto, con vision y tool use. Para productos que necesitan recibir audio o vídeo en el mismo modelo, Gemini tiene aquí una superficie documentada más amplia.
Claude responde con más espacio de salida, un camino de escalado claro en Claude Code y documentación detallada sobre estado de conversación, thinking blocks, fallbacks y migración. Google aporta grounding de Search y Maps, multimodalidad y distintos modos de servicio.
El precio: la mayor ventaja de Gemini y su mayor trampa
Con el precio Standard introductorio de 2026, Gemini 3.8 Flash cuesta aproximadamente:
- el 37,5% del precio de Sonnet 5 en entrada y salida;
- el 15% del precio de Opus 5;
- el 7,5% del precio de Fable 5.1.
Pero faltan las búsquedas, consultas de Maps, almacenamiento de caché, ejecución de herramientas, retries, revisión humana y tokens de razonamiento. Google avisa expresamente de que el modelo puede usar más tokens en tareas largas y complejas.
La métrica correcta es:
coste por resultado aceptado
= tokens + herramientas + grounding + retries + tiempo de revisión
Para extracción de alto volumen, borradores y subagentes pequeños, Gemini resulta muy atractivo. En una migración difícil, una hora adicional de revisión puede borrar el descuento de tokens.
Dónde Gemini tiene una historia más fuerte
Multimodalidad y grounding de Google
Gemini puede recibir texto, imágenes, vídeo, audio y PDF, y combinar Search, Maps, URL context, file search y code execution. Para asistentes que saltan entre documentos, web, mapas, repositorios y herramientas, esto puede reducir integración.
Routing sensible al coste
Con low para turnos rutinarios, medium para agentes normales y high solo para tareas difíciles, Gemini se comporta como un workhorse barato. Batch y Flex permiten intercambiar latencia por precio.
Una variante Cyber separada
Gemini 3.8 Flash Cyber se ofrece a defensores verificados mediante el Fairwind Program. Anthropic tiene una división paralela entre Fable 5.1, con safeguards generales, y Mythos 5.1, con acceso restringido y políticas más permisivas para cyber y biología. En ambos casos, hay que confirmar acceso, logging, retención y categorías permitidas.
Dónde Claude conserva ventaja
Claude Opus 5 y Fable 5.1 ofrecen 128K de salida frente a los 64K de Gemini 3.8 Flash. Eso importa para código generado, informes, artefactos grandes y respuestas estructuradas extensas.
También hay una escalera clara para Claude Code: Sonnet 5 para ejecución amplia, Opus 5 para ingeniería compleja y Fable 5.1 cuando incluso Opus con effort alto se queda corto. Gemini puede cubrir más casos intermedios a menor precio, especialmente dentro de Antigravity, pero Claude ofrece una ruta premium más obvia.
Por último, los harnesses personalizados necesitan pruebas separadas en ambos proveedores. Fable 5.1 vincula thinking blocks al historial, limita forced tool choice y exige gestionar refusal/fallback; Gemini tiene sus propios contratos de thinking, grounding y herramientas. Un model ID barato no equivale a compatibilidad.
Lo que dicen los primeros usuarios
En r/GeminiAI, algunos usuarios describen 3.8 Flash como rápido, más factual y detallado que 3.7, y menos perezoso con prompts serios. Otros lo consideran lento, propenso a errores o todavía sujeto a despliegues diferentes por cuenta y aplicación.
En comunidades de Google Antigravity, se repite que el modelo analiza mejor los repositorios y encuentra problemas, pero consume más cuota y puede tardar mucho más. Esto coincide con la documentación de Google sobre más pasos de razonamiento y más llamadas a herramientas.
Una comparación comunitaria en 98 tareas MindTrial informó 86/98 para Gemini 3.8 Flash, frente a 90/98 para Fable 5.1 y 88/98 para Opus 5. También registró unos 106 minutos para Gemini 3.8, frente a 63 minutos para 3.7, y un aumento aproximado de 660K a 1,57M tokens de razonamiento. Es una señal interesante, no un benchmark definitivo: un usuario, un harness, un conjunto de tareas y una configuración high.
La imagen inicial es condicional: Gemini gana en precio, velocidad de entrada y multimodalidad; Fable parece más fuerte en trabajo difícil de largo recorrido; ambos pueden gastar más compute de lo esperado cuando planifican, usan herramientas y verifican.
Política práctica de routing
| Tarea | Primer modelo a probar | Escalado |
|---|---|---|
| Extracción masiva, borradores y transformaciones simples | Gemini 3.8 Flash low/medium | Sonnet 5 |
| Documentos multimodales, audio, vídeo, PDF o mapas | Gemini 3.8 Flash | Opus 5 |
| Ediciones rutinarias de repositorio | Gemini medium o Sonnet 5 | Opus 5 |
| Migraciones grandes y debugging entre servicios | Opus 5 | Fable 5.1 |
| Research largo y decisiones encadenadas | Opus 5 o Fable 5.1 | Fable 5.1 |
| Cyber defensivo aprobado | Flash Cyber o Mythos | Revisión humana |
La elección final depende del producto. Una aplicación centrada en Google, con Search, Maps, archivos multimodales y presupuesto estricto, puede preferir Gemini. Un equipo de Claude Code con un coste alto de errores de causa raíz puede preferir Claude. Un router híbrido es posible, siempre que el handoff conserve el contexto y no cree más trabajo de revisión del que ahorra.
Cómo evaluarlos
Usa el mismo replay set y mide finalización aceptada, partial credit, tiempo total, tiempo hasta el primer output útil, tokens de entrada/salida/razonamiento, llamadas a herramientas, grounding, retries, refusals, correcciones humanas, contexto al fallar, coste por resultado aceptado y cumplimiento de las convenciones del repositorio.
Prueba los tres thinking levels de Gemini. No compares Gemini high con Claude low, ni un chat sin herramientas con un agente con herramientas. En Claude, evalúa Sonnet 5, Opus 5 y Fable 5.1 con los niveles de effort que realmente pagarías.
Conclusión
Gemini 3.8 Flash es un candidato fuerte para agentes de alto volumen, productos integrados con Google y workloads sensibles al coste: ofrece 1M de contexto, entradas multimodales, grounding y thinking configurable a un precio muy bajo.
Claude conserva una ventaja premium en el workflow: Sonnet 5 es el ejecutor diario, Opus 5 la opción de ingeniería compleja y Fable 5.1 la escalada para trabajos largos donde una mejor causa raíz puede pagar el modelo.
La comunidad y las especificaciones apuntan a la misma conclusión: Gemini 3.8 Flash es barato, rápido y capaz, pero puede gastar su ventaja en más razonamiento y herramientas. Claude cuesta más, pero puede justificarse cuando un giro equivocado sale caro.
No preguntes quién gana en abstracto. Ejecuta tu replay set, mide el resultado aceptado y enruta por forma de tarea. En 2026, la unidad competitiva es el mejor workflow completado por dólar.
Fuentes revisadas
- Google: Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
- Google AI for Developers: What's new in Gemini 3.8 Flash
- Google AI for Developers: Gemini 3.8 Flash model page
- Google AI for Developers: Gemini API pricing
- Anthropic: Claude Platform Models overview
- Anthropic: Claude Fable 5.1 overview
- Anthropic: Claude Opus 5 overview
- Reddit r/GeminiAI: rollout de 3.8 Flash
- Reddit r/google_antigravity: review práctica de 3.8 Flash
- Reddit r/Bard: comparación MindTrial de Gemini 3.8 Flash