El Centro de Investigación en Seguridad de Inteligencia Artificial de la Universidad Soongsil de Corea (Soongsil AISC, dirigido por el profesor Choi Daesan) ha desarrollado un sistema de análisis de vulnerabilidades de múltiples agentes llamado «mneme», que recientemente ha aparecido en la lista pública del sistema de evaluación de IA en ciberseguridad CyberGym. El centro de investigación señala que, hasta el 30 de agosto de 2026, este es el primer y único registro de un equipo de investigación nacional de Corea del Sur en aparecer en dicha lista. La palabra «mneme» proviene del griego y significa «memoria»; el núcleo del diseño del sistema es organizar el conocimiento acumulado de análisis de vulnerabilidades pasadas en una memoria causal estructurada, que luego es activamente consultada por múltiples agentes de inteligencia artificial para inferir las causas y rutas de reproducción de nuevas vulnerabilidades.
Rendimiento a la par con Microsoft MDASH
En las 1,507 tareas del CyberGym Level 1, mneme logró una tasa de éxito del 91.0% en un solo intento, igualando el rendimiento del sistema de análisis de vulnerabilidades de múltiples agentes de Microsoft, MDASH. El centro de investigación reveló que la evaluación correspondiente se completó el 13 de julio de 2026, y el 91.0% fue el mejor resultado público en ese momento, lo que equivale a un empate en el primer lugar a nivel mundial según el momento de la presentación. Este resultado muestra que los agentes de ciberseguridad desarrollados localmente en Corea ya tienen la capacidad de competir en igualdad de condiciones con los sistemas de élite internacionales.
CyberGym se centra en la evaluación integral de habilidades prácticas
CyberGym es un conjunto de pruebas de referencia a gran escala diseñado para vulnerabilidades de software de código abierto, basado en 1,507 vulnerabilidades recopiladas de 188 proyectos de software de código abierto. Se requiere que la inteligencia artificial analice el código fuente, rastree las rutas de formación de vulnerabilidades y escriba y ejecute código que pueda reproducir realmente las vulnerabilidades. La evaluación no mide solo un único conocimiento de seguridad o capacidad de generación de código, sino que evalúa el nivel integral de comprensión del código, inferencia de vulnerabilidades, uso de herramientas especializadas, ejecución repetida y verificación de resultados, por lo que se considera un indicador global clave para medir las capacidades prácticas de IA y agentes en ciberseguridad.
Superando el récord de Claude Mythos Preview
Antes de esto, en abril de este año, el modelo de inteligencia artificial general de Anthropic, Claude Mythos Preview, había obtenido un 83.1% en la evaluación centrada en el modelo de CyberGym, posicionándose en el nivel más alto en ese momento. El 91.0% de mneme supera ese récord en 7.9 puntos porcentuales, consolidando aún más su posición de liderazgo en el campo del análisis de vulnerabilidades. El centro de investigación afirma que continuará optimizando el sistema y promoviendo la aplicación de tecnologías relacionadas en diferentes escenarios de seguridad.

