Gemini 3.6 Flash: más barato, 14 meses más de contexto y aplasta a su predecesor en código (guía para devs)
Google lanzó Gemini 3.6 Flash el 21 de julio con output más barato, 49% en DeepSWE vs 37% del modelo anterior y knowledge cutoff a marzo 2026. Te decimos qué modelo Flash elegir ahora.
Google llevaba semanas con el ojo encima después de que Gemini 3.5 Pro no terminaba de llegar, los $225 mil millones evaporados y toda la bola de críticas que te puedes imaginar. Y en medio de eso, el 21 de julio soltaron calladamente algo que los devs sí necesitaban: tres modelos Flash nuevos con el workhorse principal más barato, más eficiente y con 14 meses más de conocimiento actual.
No es el flagship que todos esperaban. Pero si tú estás pagando la API de Google para proyectos reales, esto te importa más que cualquier benchmark de olimpiadas de matemáticas.
Qué cambió en Gemini 3.6 Flash
El modelo llegó el 21 de julio a Google AI Studio, Antigravity y Android Studio. Ya está disponible para cualquier dev con acceso a la API. Sin lista de espera, sin palancas.
Los números concretos:
Precio: Input se queda igual en $1.50 por millón de tokens. El output bajó de $9.00 a $7.50 por millón. No suena brutal, pero suma cuando estás generando texto a escala.
Knowledge cutoff: Salta de enero 2025 a marzo 2026. Son 14 meses de brecha cubierta. Si tus prompts tienen contexto sobre eventos recientes, frameworks actualizados o noticias de los últimos meses, el modelo ya sabe de qué le estás hablando sin que le tengas que dar todo el background.
Eficiencia de tokens: Aquí está el beneficio que nadie menciona primero pero que importa más en la práctica. El modelo genera 17% menos tokens de output para completar las mismas tareas que 3.5 Flash. En workflows agentic con muchos tool calls, ese número sube hasta 65% menos tokens. Eso significa que el ahorro real no es solo el 17% del precio de output: es la combinación de precio más bajo por token Y tokens totales generados.
El blended cost baja de $1.31 a $1.16 por millón de tokens en un ratio 3:1 input/output. Parece poco, pero si tienes un sistema con miles de llamadas al día, la diferencia es real.
Los benchmarks: dónde sí mejora y dónde hay que ser honesto
Según los datos de FelloAI, el salto más claro es en tareas de código y automatización agentic:
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| DeepSWE v1.1 | 49% | 37% |
| MLE-Bench | 63.9% | 49.7% |
| SWE-Bench Pro | 58.7% | 55.1% |
| OSWorld-Verified | 83.0% | 78.4% |
En DeepSWE (resolución autónoma de issues de GitHub) y MLE-Bench (tareas de machine learning research), la mejora es notoria: 12 y 14 puntos respectivamente. Para un dev que usa el modelo en agentes de código o automatización de flujos técnicos, eso se traduce en menos intervención manual.
Pero hay que decirlo sin rodeos: Artificial Analysis le da un Intelligence Index de 50 a ambos modelos. Mismo puntaje. Lo que mejoró es la eficiencia en tareas específicas de código y agentic, no la inteligencia general del modelo. Si tu caso de uso es razonamiento complejo, análisis de documentos o creatividad, no vas a notar la diferencia respecto a 3.5 Flash.
También es una chimba que por fin suba el knowledge cutoff: enero 2025 ya se sentía viejo cuando tienes que armar contexto sobre todo lo que pasó en el ecosistema de IA en los últimos 12 meses.
Los otros dos modelos que llegaron con él
Google no lanzó uno, lanzó tres. Y los otros dos tienen sus propios casos de uso:
Gemini 3.5 Flash-Lite: El modelo más barato y rápido de la familia. $0.30/M input y $2.50/M output. Corre a 350 tokens por segundo, que es el más rápido disponible ahora mismo. Sorprendentemente, en SWE-Bench Pro saca 54.2% que le gana a lo que sacaba 3 Flash (49.6%). Si necesitas volumen alto con latencia baja y no requieres razonamiento complejo, este es el que conviene.
Gemini 3.5 Flash Cyber: Especializado en seguridad. Detectó 55 vulnerabilidades únicas confirmadas vs 47 del Flash estándar. Por ahora solo disponible en acceso piloto limitado para gobiernos y partners de confianza. Si tu proyecto tiene que ver con hardening o detección de vulnerabilidades, vale la pena aplicar al programa.
La guía rápida: qué modelo Flash usar según tu caso
Si tienes que elegir entre los tres ahora mismo:
Usa Gemini 3.6 Flash si: Tienes agentes de código, automatización de workflows técnicos, o necesitas el balance correcto entre costo, velocidad y calidad. Es el default nuevo para la mayoría de los proyectos.
Usa Gemini 3.5 Flash-Lite si: Necesitas procesar documentos a alto volumen, tienes búsqueda agentic con muchas llamadas paralelas, o el presupuesto de API es el factor principal. 5 veces más barato en input que 3.6 Flash.
Espera por Gemini 3.5 Flash Cyber si: Tu caso de uso es seguridad: análisis de código buscando CVEs, pentesting asistido, o revisión de configuraciones. No hay acceso abierto todavía, pero Google dijo que ampliará el programa.
Cómo se para frente a la competencia
Contra Claude Sonnet 5 ($2.00/M input, $10.00/M output): Gemini 3.6 Flash es aproximadamente 2x más barato en blended cost y corre a 304 tokens por segundo vs ~70 t/s de Sonnet 5. Claude Sonnet 5 gana en benchmarks de code review cuidadoso y judgment calls. Gemini 3.6 Flash gana en velocidad y automatización de volumen.
Si ya viste el artículo sobre Gemini 3 Deep Think y su brutal score en olimpiadas de matemáticas, ten claro que estamos hablando de una familia diferente. Flash es el modelo de trabajo del día a día, no el de razonamiento pesado. Diferentes herramientas para diferentes trabajos.
Y en el contexto de cómo está el tablero global de IA ahorita: Microsoft acaba de meter miles de millones en Mistral, lo que significa que los devs mexicanos tienen más opciones europeas que antes. Pero para volumen de código en API, la pelea real sigue siendo entre Google y Anthropic.
El elefante en el cuarto
Sí, Google no entregó Gemini 3.5 Pro cuando prometió. Sí, la acción de Alphabet sintió el golpe. Pero lo que soltaron el 21 de julio no es un consuelo vacío: es lo que los devs que pagan la API realmente necesitaban. Modelos más baratos, más eficientes, y con información más actual.
El flagship va a llegar en algún momento (o no, y ya veremos qué pedo). Mientras tanto, Gemini 3.6 Flash es el modelo de producción más sólido que Google tiene disponible ahorita. Y para muchos proyectos, es más que suficiente.
¿Ya cambiaste tu configuración de API a 3.6 Flash, o seguías con 2.5 Flash y esto fue el empujón que necesitabas? Cuéntanos en los comentarios qué stack estás usando.
Fuentes
- 9to5Google: Google launches Gemini 3.6 Flash and 3.5 Flash-Lite, teases Gemini 4
- FelloAI: Gemini 3.6 Flash Pricing, Benchmarks & What’s New
- BenchLM.ai: Claude Sonnet 5 vs Gemini 3.6 Flash Comparison
- GCN: Google launches Gemini 3.6 Flash and cybersecurity model
- DataNorth AI: Google Released Gemini 3.6 Flash
Comentarios
No te pierdas ningún post
Recibe lo nuevo de Al Chile Tech directo en tu correo. Sin spam.
También te puede interesar
Google renovó toda su IA en 2026: Gemini 3 Flash es el nuevo default y Gemini 3.1 Pro ya compite de tú a tú con GPT-5 y Claude
Google cambió su modelo por defecto, lanzó Gemini 3.1 Pro para razonamiento complejo y estrenó voz en tiempo real con Gemini 3.1 Flash Live. Aquí están los números reales y qué cambia para usuarios y devs en México.
Gemini 3.5 Flash ya le ganó a Gemini 3.1 Pro siendo más barato: lo que los devs en México necesitan saber hoy
Google lanzó en el I/O 2026 un modelo Flash que supera al Pro en coding y agentes, corre a 289 tokens/segundo y cuesta la tercera parte que GPT-5.5. Aquí los números reales.
Meta mató a Llama para siempre: Muse Spark 1.1 cobra por token y los devs en México tienen que actuar ya
Meta lanzó Muse Spark 1.1 el 9 de julio: su primer modelo closed-source a $1.25/$4.25 por millón de tokens. El free ride de Llama terminó. Qué hacen los desarrolladores en México.