Google lanzó Gemini 3.8 Flash el martes, su nuevo modelo de caballo de batalla posicionado como el mejor sistema de razonamiento y codificación de la compañía pero al mismo precio que su predecesor, junto con una variante especializada llamada Gemini 3.8 Flash Cyber construida para trabajos de ciberseguridad defensiva. El anuncio, publicado en el blog oficial de Google por Tulsee Doshi, director senior de gestión de productos, y Raluca Ada Popa, líder de seguridad Gemini en Google DeepMind, marca el tercer lanzamiento de Flash de Google en sólo seis semanas.
El lanzamiento se produce en medio de una temporada de lanzamientos inusualmente concurrida y es una respuesta directa a la presión de precios y rendimiento que los rivales han ejercido sobre la línea de modelos de Google. Para obtener una visión más amplia de cómo los laboratorios fronterizos están intercambiando golpes, el equipo de últimas noticias sobre IA rastrea cada lanzamiento de modelo importante a medida que ocurre.
Dos variantes, una base
Gemini 3.8 viene en dos versiones basadas en la misma inteligencia fundamental. Gemini 3.8 Flash es el caballo de batalla de propósito general: Google dice que ofrece mejoras significativas sobre 3.7 Flash en ingeniería de software, tareas de agente y razonamiento de múltiples pasos en dominios especializados, al mismo precio de lanzamiento de $0,75 por millón de tokens de entrada y $3,75 por millón de tokens de salida.
Gemini 3.8 Flash Cyber se describe como el modelo de ciberseguridad más capaz de Google, con lo que la compañía llama rendimiento de nivel de frontera en detección de vulnerabilidades y parches automatizados. A diferencia del modelo Flash estándar, no está ampliamente disponible: Google lo está distribuyendo a un conjunto de defensores confiables a través de un nuevo programa llamado Fairwind.
Según la publicación del blog, los avances en codificación y razonamiento en el núcleo compartido fueron impulsados en parte por una capacitación rigurosa en el exigente dominio de la ciberseguridad, y ambos modelos fueron acelerados por bucles agentes de larga duración diseñados para evaluar y refinar de forma recursiva los modelos subyacentes.
Puntos de referencia: trabajar más duro, no sólo crecer
Las afirmaciones de referencia de Google se centran en una filosofía de diseño que la compañía resume claramente: 3.8 Flash "trabaja más duro". En tareas complejas, el modelo ejecuta pasos de razonamiento adicionales y llama a herramientas de forma iterativa, consumiendo a veces más tokens para maximizar el rendimiento en niveles de esfuerzo más altos. Los desarrolladores pueden reducir el esfuerzo para reducir la sobrecarga de tokens o permanecer en Gemini 3.7 Flash, que sigue siendo totalmente compatible con cargas de trabajo que priorizan la eficiencia.
Los resultados del titular que Google cita:
- DeepSWE v1.1 (ingeniería de software a largo plazo): 3.8 Flash supera a la mayoría de los modelos de frontera más grandes en la resolución autónoma de problemas de ingeniería complejos de extremo a extremo, a lo que Google describe como una fracción del costo.
- Vals Finance Agent V2 y Harvey's Legal Agent Benchmark: 3.8 Flash supera a 3.7 Flash y otros modelos de vanguardia en campos cuantitativos y profesionales que requieren análisis e informes avanzados.
- Verificado por HLE: 3.8 Flash logra un 54,9%, lo que Google presenta como evidencia de razonamiento de varios pasos en STEM, humanidades y campos profesionales.
Flash Cyber: Defensa sobre la ofensiva
La variante Cyber es la versión más inusual. Google dice que priorizó deliberadamente la reparación de vulnerabilidades sobre capacidades ofensivas como la explotación. En CWE-Bench, un punto de referencia de parcheo externo dirigido por Collinear, Gemini 3.8 Flash Cyber obtuvo un aprobado@1 del 47,2%, justo detrás de un modelo de frontera líder con un 47,8%, según Google, pero a un costo significativamente menor, lo que lo coloca en la frontera de Pareto del punto de referencia.
En CyberGym, un punto de referencia estándar de la industria para encontrar vulnerabilidades, Google dice que el modelo Cyber demuestra un descubrimiento autónomo de vulnerabilidades a nivel de frontera, superando a su predecesor 3.5 Flash Cyber, así como a modelos de frontera significativamente más grandes. En el punto de referencia interno de Google que abarca bases de código complejas en 20 lenguajes de programación, el modelo alcanzó una tasa de éxito superior al 70%.
Ya estamos asegurando el código propio de Google
Google dice que el modelo Cyber ya está implementado internamente y los ejemplos que proporciona son específicos:
- El equipo de seguridad de Chrome descubrió que 3.8 Flash Cyber produjo 2,6 veces más parches correctos para las vulnerabilidades de Chrome que los mejores modelos comerciales, que son mucho más grandes.
- En la firma de seguridad Wiz, el modelo logró entre 7,5 y 9,7 puntos porcentuales más de recuperación en un punto de referencia de prueba de penetración interna a un costo de 2,3 a 5,2 veces menor en comparación con otros modelos de frontera líderes.
- El equipo de investigación de vulnerabilidades en la nube de Google utilizó el modelo para encontrar una vulnerabilidad fundamental crítica en menos de dos horas, una clase de vulnerabilidad cuya investigación y descubrimiento, señala Google, suele llevar meses.
Qué significa para los desarrolladores y el mercado
Para los desarrolladores, la conclusión práctica es la estabilidad de precios en el extremo inferior de la frontera. Mantener 3.8 Flash al precio de lanzamiento de 3.7 mantiene el costo de un modelo competitivo de codificación y agente en $0.75/$3.75 por millón de tokens, un segmento donde los retadores de peso abierto y los laboratorios rivales han estado subcotizando a los titulares durante todo el año. El mensaje de Google es que los compradores ya no necesitan elegir entre costo y capacidad en el nivel del caballo de batalla.
El modelo de distribución del Programa Fairwind para Flash Cyber es igualmente revelador. Los laboratorios de primer nivel están tratando cada vez más la capacidad de ciberseguridad de élite como algo que debe ser controlado en lugar de distribuirse ampliamente, proporcionando herramientas defensivas de última generación a los defensores examinados y limitando al mismo tiempo el potencial de uso indebido ofensivo. La decisión de Google de priorizar los puntos de referencia de parches sobre las capacidades de explotación en el entrenamiento del modelo sigue la misma lógica.
La cadencia también es notable. Tres lanzamientos de Flash en seis semanas (3.7 Flash hace tres semanas, ahora 3.8) muestran a Google iterando su línea de nivel medio mucho más rápido que los ciclos de lanzamiento de estilo anual de hace dos años. La presión competitiva del lanzamiento de GPT-6 de OpenAI y una ola de modelos de peso abierto de rápido movimiento procedentes de China han comprimido los cronogramas de todos, y Google claramente está eligiendo la velocidad en el nivel de caballo de batalla, mientras que sus modelos de frontera llevan la bandera de la investigación.
Si el enfoque de "trabajar más duro" de 3.8 Flash (gastar más tokens en un razonamiento diligente de varios pasos) resulta más eficiente en la práctica que la escala del modelo en bruto aparecerá en las facturas de los desarrolladores en los próximos meses. Los propios puntos de referencia de Google sugieren que el comercio puede favorecer la diligencia; el mercado emitirá su veredicto una factura API a la vez.
Manténgase por delante de la IA
Cada lanzamiento de modelo, punto de referencia y cambio de precio, seguido a medida que ocurre - leer más noticias sobre IA →
