Skip to content
Tech AI Wire

GPT-6 Astra, el primer modelo Critical en ciber de OpenAI

Astra logró el 100% en ExploitBench y construyó una cadena de exploits de navegador en 29 horas. La versión que se publica rechaza escribir pruebas de concepto.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
An empty office reception area at night, with the OpenAI knot mark in brushed steel on the wall behind the desk.

En cifras

to build a working browser exploit chain
29 hours
to build a kernel privilege-escalation exploit
12 hours
of tests where it exceeded authorized scope
0%
Exploit benchmark scores
ExploitBench, Astra
100%
ExploitBench, GPT-5.6 Sol
78.5%
ExploitGym, Astra
42.4%

OpenAI ha clasificado GPT-6 Astra en el nivel Critical de ciberseguridad de su Preparedness Framework, el primer modelo que lo alcanza. CSO Online informa de que la empresa dice que Astra "cruzó el umbral 'Critical' de riesgo en ciberseguridad conforme a su Preparedness Framework".

Esa etiqueta no es un escalón de marketing. Es el punto en el que las propias reglas de OpenAI exigen para la capacidad ofensiva de un modelo un trato distinto al de todo lo anterior.

Qué significa el umbral Critical

InfoQ cita la definición del marco. Un modelo califica si puede "identificar y desarrollar exploits de día cero funcionales de todos los niveles de gravedad en muchos sistemas críticos reales y endurecidos" por su cuenta. También califica si puede "diseñar y ejecutar de principio a fin estrategias de ataque inéditas contra objetivos endurecidos a partir solo de una meta de alto nivel".

Detrás de la clasificación hay dos demostraciones. Frente a un navegador, InfoQ informa de que Astra encontró varias vulnerabilidades desconocidas y construyó en 29 horas una cadena de exploits funcional que escapaba del entorno aislado. Después la adaptó a la versión estable en 12 horas más. Frente al núcleo de un sistema operativo, produjo en 12 horas un exploit funcional de elevación local de privilegios.

Son cifras con las que conviene detenerse. Un solo modelo, con herramientas y tiempo, pasó de un objetivo endurecido a código funcional en cerca de un día.

Los benchmarks y su techo

Astra obtuvo el 100% en ExploitBench, que The Hacker News describe como una medida de la capacidad de un modelo para convertir vulnerabilidades conocidas en exploits funcionales. El modelo anterior, GPT-5.6 Sol, obtuvo el 78,5%.

Un benchmark saturado deja de informar, y por eso la tercera barra del gráfico importa más. En ExploitGym, que mide desarrollar exploits en lugar de convertir fallos ya conocidos, CSO Online informa de un 42,4%. El mismo modelo toca el techo en una tarea y no llega a la mitad en la más difícil.

Este sitio ya pasó por aquí con Astra. Su puntuación en ARC-AGI-3 fue del 99,9% o del 62,7% según quién ejecutara la prueba, y la lección se repite: el número dice poco sin el banco de pruebas que lo produjo.

Qué se publica en realidad

El modelo que puedes llamar no es el que se probó. The Hacker News informa de que la versión publicada se limita a la revisión segura de código y al parcheo, y rechaza las peticiones de pruebas de concepto. CSO Online menciona un programa llamado Daybreak que da a defensores verificados acceso con, en palabras de OpenAI, "salvaguardas menos restrictivas".

El acceso está desactivado por defecto para empresas, y un administrador tiene que activarlo. El precio es de 10 dólares por millón de tokens de entrada y 50 por millón de salida, la misma cifra de entrada que cuando Astra pasó a estar disponible en Bedrock y Copilot.

OpenAI describe además controles internos que ha añadido: aislamiento más estricto del modelo, puntos de control cifrados, vigilancia de las cadenas de razonamiento y evaluaciones de alineación antes del despliegue interno. Según InfoQ, planea comunicar dos vulnerabilidades de día cero a los responsables afectados, reservándose los nombres de producto y los detalles técnicos.

Qué significa esto para los desarrolladores

La lectura defensiva es la práctica. Un modelo que convierte una CVE conocida en código funcional a este ritmo comprime el tiempo entre la publicación de un parche y su explotación. Si tu ventana de parcheo da por supuestas semanas de gracia tras la divulgación, ese supuesto es lo que hay que revisar este trimestre.

Sé preciso sobre qué se mostró y quién lo mostró. Todas las cifras aquí vienen de OpenAI o de coberturas de sus afirmaciones, y ninguna fuente describe una auditoría externa de la clasificación Critical. La empresa calificó su propio modelo con su propio marco y sus propios benchmarks, y eso conviene decirlo incluso cuando la divulgación es inusualmente detallada.

Una cifra merece más atención que los tiempos de exploit: Astra excedió su ámbito autorizado en el 0% de las pruebas, según CSO Online. Para quien ejecuta agentes contra sistemas reales, el respeto del ámbito es la propiedad que decide si una capacidad es utilizable.

Por último, trata el rechazo como una decisión de producto y no como una propiedad de seguridad. El modelo público hoy declina escribir exploits, y Daybreak existe para relajar eso con algunos usuarios. Las dos cosas pueden cambiar sin que cambie la capacidad subyacente.

Fuentes

  1. GPT-6 Astra Is the First Model OpenAI Classifies as Critical for Cybersecurity - InfoQ
  2. OpenAI launches GPT-6 Astra, its first model to cross a critical cybersecurity threshold - CSO Online
  3. GPT-6 Astra Scores 100% on ExploitBench as OpenAI Blocks PoC Exploit Requests - The Hacker News

Artículos relacionados