Gemini 4 Argon llega a los defensores de ciberseguridad antes que a los desarrolladores
Gemini 4 Argon logra un 77,9 % en DeepSWE v1.1 y puede escribir 1 millón de tokens por respuesta, pero por ahora solo pueden usarlo los defensores de ciberseguridad del Fairwind Program de Google.
4 min de lectura

En cifras
- output tokens per answer, up from 64K
- 1M
- per million input / output tokens, introductory
- $2 / $10
- discount on cached input tokens
- 95%
- on CWE-bench v1, tied for first
- 68%
- Gemini 4 Argon
- 77.9%
- Claude Opus 5.5
- 74.2%
- GPT-6 Astra
- 74.1%
Google lanzó Gemini 4 Argon el 30 de septiembre de 2026 y lo presenta como su modelo más potente hasta ahora. La mayoría de los desarrolladores todavía no puede usarlo. Google lo ofrece primero a equipos de seguridad de confianza a través de un programa llamado Fairwind, y los clientes de pago de la API llegarán después.
Ese orden dice mucho del modelo. Google creó Argon para encontrar y corregir por sí solo agujeros de seguridad en el software. Un modelo que puede hacer eso para los defensores también puede ayudar a los atacantes, así que Google retiene el lanzamiento amplio.
Lo que Google dice que Argon puede hacer
Argon está pensado para trabajos largos y de varios pasos: programación, investigación, redacción y ciberseguridad. El anuncio de Google dice que Argon ahora puede escribir hasta 1 millón de tokens en una sola respuesta, frente a los 64.000 de antes. Un token es un fragmento pequeño de texto, a menudo una palabra corta o parte de una más larga. Más espacio de salida significa que una sola solicitud puede producir un archivo entero reescrito, o muchos.
Google afirma que Argon está diseñado para "encontrar, validar y parchear de forma autónoma vulnerabilidades críticas de software", según TechCrunch. También puede analizar videos y gráficos. El personal de Google ya lo usa para depurar y para migrar grandes bases de código a nuevas bibliotecas, según TechCrunch.
Google publicó estas puntuaciones:
| Benchmark | Qué evalúa | Puntuación de Argon |
|---|---|---|
| DeepSWE v1.1 | Tareas reales de ingeniería de software | 77,9 % |
| AutomationBench | Tareas de automatización, donde Google dice que Argon ocupa el primer puesto | 51,3 % |
| CWE-bench v1 | Corrección de tipos conocidos de fallos de seguridad | 68 %, empatado en el primer puesto |
| LVBench | Comprensión de videos largos | 91,7 % |
9to5Google compara el resultado de DeepSWE con dos rivales. Claude Opus 5.5 de Anthropic obtiene un 74,2 % y GPT-6 Astra de OpenAI, un 74,1 %. TechCrunch añade que Argon también supera a GPT-6 Astra y a los modelos Fable y Opus de Anthropic en el índice de modelos de Vals AI.
Quién puede usarlo, y cuándo
Por ahora, solo el Fairwind Program tiene acceso. Sus miembros son equipos de seguridad en los que Google confía para defender sistemas. Google dice que después llegarán los clientes de pago de la API y los suscriptores de Google AI Ultra, y luego un acceso más amplio.
"Lanzar de forma segura capacidades de frontera a este nivel requiere un enfoque por fases", dijo Koray Kavukcuoglu, vicepresidente sénior de Google DeepMind. La empresa tiene motivos para ser cautelosa. En septiembre, Google reveló que Gemini entró en tres empresas durante una prueba de seguridad en mayo.
Google enumera varias medidas de seguridad para Argon. Probó el modelo contra la inyección indirecta de prompts, en la que un atacante esconde instrucciones dentro de una página web o un archivo que el modelo lee. También recurrió a equipos rojos (red teams), que son evaluadores cuyo trabajo es atacar el sistema. 9to5Google informa de que Google vigila la actividad interna del modelo en busca de señales de uso indebido y ha reforzado los entornos aislados, o sandboxes, donde ejecuta código.
Cuánto cuesta
Argon se lanza con un precio introductorio de 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida. Tras el periodo introductorio, el precio se duplica hasta 4 y 20 dólares. Los tokens de entrada en caché cuestan un 95 % menos que la entrada normal. El almacenamiento en caché significa que el servicio guarda un bloque de texto que envías una y otra vez, como un documento largo, para que no pagues el precio completo cada vez.
Argon no es el único modelo de Google para programación. A principios de septiembre, Google lanzó Gemini 3.8 Flash, con un precio de modelo de gama media para el trabajo diario de programación.
Lo que Google dice que hizo con Argon dentro de la empresa
Google da tres ejemplos de sus propios sistemas. Los agentes que ejecutan Argon liberaron más de 300 TiB de memoria en los centros de datos de Google, y Google calcula un ahorro total de entre 500 TiB y 1 PiB. Argon también ayudó a migrar libgav1, el decodificador de Google para video AV1, a un código nuevo que funciona 2,7 veces más rápido. 9to5Google informa de migraciones de más de 800.000 líneas de código.
Qué significa esto para los desarrolladores
No planifiques todavía un lanzamiento en torno a Argon. Salvo que tu equipo esté en Fairwind, hoy no puedes llamarlo. Sigue publicando con el modelo que usas ahora.
Prepara un conjunto de pruebas mientras esperas. Las puntuaciones de Google vienen de Google. Una ventaja de 3,7 puntos en DeepSWE es real pero pequeña, y tu propio código puede no parecerse al benchmark. Reúne de 20 a 50 tareas reales de tu backlog, con respuestas correctas conocidas, para poder comparar Argon de forma justa desde el primer día.
Piensa en el límite de salida de 1 millón de tokens. Permite trabajos grandes en una sola solicitud, como reescribir un módulo o escribir una migración completa. También permite facturas grandes. Una respuesta completa de 1 millón de tokens cuesta 10 dólares al precio introductorio y 20 dólares después. Fija límites de salida en tu código antes de probar.
Diseña los prompts pensando en la caché. Con un descuento del 95 % en la entrada en caché, pon primero la parte grande que no cambia, como el contexto de tu repositorio o la documentación de la API. Pon al final la pregunta que cambia. Ese patrón puede reducir mucho los costes de entrada en ejecuciones largas de agentes.
Si trabajas en seguridad, sigue de cerca Fairwind. Google creó Argon para encontrar y parchear vulnerabilidades, y los defensores lo reciben primero. Los equipos que gestionan escaneo de código o programas de parches deberían seguir cómo abre Google el acceso.
Fuentes
Artículos relacionados

Chrome pasa a un ciclo de dos semanas
Chrome 153 inicia un ciclo de hitos de dos semanas, frente a cuatro. Según Google, Chrome 149 y 150 corrigieron por sí solos 1.072 fallos de seguridad.

Xiaomi lanza MiMo-V2.6-Pro con 1 billón de parámetros en pesos abiertos bajo MIT
MiMo-V2.6-Pro de Xiaomi tiene 1,02 billones de parámetros, 42.000 millones activos, un contexto de 1 millón de tokens y pesos con licencia MIT, pero necesita unos 680 GB de memoria de GPU.

OpenAI vincula una campaña de extracción de razonamiento con Moonshot AI
Según OpenAI, usuarios vinculados a Moonshot AI, creadora de Kimi, enviaron en julio 16.000 solicitudes de extracción procedentes de más de 4.000 usuarios para copiar el razonamiento oculto de los modelos de OpenAI.