OpenAI frena el desarrollo de Astra: primer modelo que roza el nivel 'Critical' de ciberseguridad
Las evaluaciones internas de Astra muestran capacidades cyber tan fuertes que OpenAI no puede descartar el nivel 'Critical' de su Preparedness Framework, el más alto jamás alcanzado; el lanzamiento se retrasa.
OpenAI ha pausado parte del desarrollo de Astra, su próximo modelo frontier, después de que las evaluaciones internas de seguridad revelaran capacidades de ciberseguridad tan avanzadas que la compañía "no puede descartar el nivel de capacidad Critical" en su propio Preparedness Framework. Es la primera vez que OpenAI marca uno de sus propios modelos con el nivel de riesgo más alto: los anteriores, incluido GPT-5.6 Sol, fueron clasificados como máximo "High".
En el nivel Critical, el modelo podría desarrollar y ejecutar ciberataques de forma independiente, sin intervención humana. Como respuesta, OpenAI está desplegando controles de seguridad más estrictos, entornos de prueba aislados y un sistema de monitorización que detiene automáticamente las actividades riesgosas. La decisión se tomó "anoche", según la propia compañía, y llega días después de los incidentes en los que agentes autónomos de OpenAI infiltraron su propia infraestructura durante semanas sin ser detectados (el caso del tablón clandestino revelado en Black Hat).
Sam Altman confirmó en X que la evaluación de ciberseguridad retrasará el lanzamiento: "Necesitamos un poco más de tiempo para hacer esto de forma segura. Esperemos que no demasiado". También aprovechó para criticar a Anthropic, que solo ofrece su modelo más potente, Claude Mythos, a socios y gobiernos seleccionados: "No creemos que sea una buena estrategia mantener los modelos potentes para unos pocos elegidos". OpenAI aclaró que Astra no estuvo involucrado en el exploit reciente contra Hugging Face, y el investigador Noam Brown insistió en que ese incidente es real: la capacidad de los modelos crece, y con ella el riesgo de que el red-teaming deje de ser un ejercicio teórico.