OpenAI lanzará el modelo de IA Astra con capacidades de ciberataque, disponible solo para socios selectos.

OpenAI anunció el 1 de septiembre que su próximo modelo de IA, Astra, es el primero en alcanzar el umbral de capacidades de ataque cibernético «crítico» definido por la empresa. OpenAI indicó que planea lanzar Astra «pronto», pero las avanzadas capacidades de ataque cibernético del modelo estarán disponibles en el lanzamiento solo para socios específicos en el programa de acceso anticipado Daybreak Blue.

Astra alcanza el umbral crítico de ciberseguridad; OpenAI reanuda el desarrollo tras una pausa

En una conferencia de prensa dirigida a los medios, el responsable del departamento de seguridad de OpenAI afirmó que la empresa ha determinado que Astra ha alcanzado el umbral crítico de capacidades de ciberseguridad descrito en su marco de preparación, que establece umbrales y protocolos sobre cuándo un modelo de IA representa un nuevo tipo de riesgo. OpenAI define el «umbral crítico de capacidades cibernéticas» como la capacidad de descubrir y explotar de forma independiente vulnerabilidades previamente desconocidas en software del mundo real. Los ejecutivos de OpenAI señalaron que la empresa había suspendido el desarrollo adicional de acuerdo con los procedimientos de respuesta a esta situación, hasta que se implementaran las medidas de protección y mecanismos de seguridad adecuados.

OpenAI había indicado anteriormente que había suspendido parte del trabajo de entrenamiento relacionado con Astra y otro modelo de IA más avanzado durante varias semanas. Los ejecutivos afirmaron que, tras establecer medidas de seguridad adicionales, la empresa ha reanudado el trabajo en Astra y en el modelo más avanzado. OpenAI expresó que las semanas de pausa en el entrenamiento fueron productivas y ahora tienen plena confianza en poder lanzar Astra de manera segura. Este anuncio se produce en un contexto en el que toda Silicon Valley está luchando por abordar las avanzadas capacidades de ciberseguridad de los modelos de IA de vanguardia y tratando de asegurar a usuarios, legisladores y empresas que pueden implementar un control efectivo sobre ellos.

En julio de este año, OpenAI reveló un incidente en el que dos agentes de modelos aprovecharon vulnerabilidades en un entorno de prueba que debería haber estado aislado, obteniendo acceso a Internet e infiltrándose en la plataforma de IA de código abierto Hugging Face. OpenAI señaló que Astra no estaba involucrada en ese incidente. Recientemente, otras empresas de IA como Anthropic y Meta también han informado de incidentes similares. El 1 de septiembre, Anthropic también indicó que había suspendido parte de su trabajo de entrenamiento de IA para fortalecer sus prácticas de seguridad.

OpenAI lanza el «monitor de alineación» para restringir el acceso de usuarios generales a capacidades avanzadas de ataque cibernético

OpenAI indicó que está implementando un enfoque de múltiples pasos para limitar el acceso de usuarios generales a las capacidades avanzadas de ataque cibernético de Astra, siendo una de las medidas clave el nuevo «monitor de alineación». Por ejemplo, si un usuario solicita a Astra ayuda para encontrar formas de explotar vulnerabilidades en sistemas de software del mundo real, el modelo debe rechazar la solicitud. OpenAI también mencionó que ha mejorado la capacidad de Astra para resistir intentos de jailbreak, y en las pruebas, su tasa de éxito al rechazar consultas inseguras es significativamente mayor que la de modelos anteriores.

Sin embargo, OpenAI también señaló en su blog que su monitor de alineación podría «a veces marcar erróneamente actividades legítimas como posibles abusos cibernéticos o comportamientos no autorizados, lo que podría llevar a que se ralentice, pause o detenga inesperadamente», y que este mecanismo de protección también podría activarse cuando los usuarios realicen actividades que aparentemente no están relacionadas con la ciberseguridad. En tales casos, los usuarios de ChatGPT y Codex podrían ser solicitados a revisar el comportamiento del modelo antes de continuar con sus operaciones.

Los socios del programa Daybreak tendrán acceso a versiones tempranas con menos restricciones

Los socios del programa Daybreak de OpenAI, que incluyen proveedores de infraestructura digital como Cisco, Cloudflare y Palo Alto Networks, tendrán acceso a versiones tempranas de Astra con menos restricciones y capacidades de ataque cibernético más robustas. El objetivo del programa es garantizar que estas empresas puedan fortalecer sus sistemas de defensa utilizando modelos de IA avanzados como Astra antes de que modelos con capacidades similares sean abiertos al público en general. Los ejecutivos de OpenAI también revelaron que la empresa ha estado trabajando en estrecha colaboración con socios gubernamentales para asegurarse de que comprendan las capacidades de ataque cibernético de Astra y puedan obtener acceso relevante.

Astra no solo puede descubrir nuevas vulnerabilidades de software y desarrollar formas de explotación correspondientes, sino que también puede «encadenar» múltiples explotaciones, una técnica que permite profundizar en un sistema objetivo y obtener acceso que no podría lograrse con una sola vulnerabilidad. Según datos proporcionados por OpenAI, Astra ha superado a modelos líderes en la industria como GPT-5.6 Sol y Mythos de Anthropic en pruebas de referencia de ciberseguridad como ExploitBench, donde Astra obtuvo una puntuación del 100% en ExploitBench.

Sin embargo, estas capacidades se alinean en general con la tendencia de mejora continua de las capacidades de hacking de los modelos de IA que OpenAI y Anthropic han estado prediciendo durante meses. Por ejemplo, en abril de este año, Anthropic destacó que Mythos Preview puede desarrollar de forma autónoma cadenas de explotación de vulnerabilidades.

A medida que la IA y la industria de la ciberseguridad aceleran su respuesta, muchos expertos en ciberseguridad también enfatizan que las medidas de defensa digital críticas y las mejores prácticas a largo plazo siguen siendo efectivas. Sin embargo, para aquellas organizaciones y sistemas que aún no han implementado adecuadamente estas medidas de protección, los riesgos que presenta la IA se están volviendo cada vez más urgentes.

Contenido original
Este artículo es la versión en español de un contenido original de TechRitual.
Stein Yep
Stein Yep