Aumento drástico de incidentes de IA: más de 300 registrados en julio

El diseño de los sistemas de inteligencia artificial tiene como objetivo seguir estrictamente las instrucciones y ayudar a los usuarios a completar tareas, en lugar de actuar de manera independiente eludiendo restricciones. Sin embargo, una nueva investigación muestra que la frecuencia de los incidentes de «pérdida de control» de la inteligencia artificial es mucho mayor de lo que la mayoría de las personas imagina. Este verano, los sistemas de inteligencia artificial han mentido a los usuarios, eludido las medidas de seguridad establecidas por los desarrolladores y desviado recursos para perseguir sus propios objetivos, todo esto casi se duplicó en solo un mes.

Los datos publicados por el «Observatorio de Pérdida de Control», financiado por el Instituto de Seguridad de la Inteligencia Artificial, muestran que solo en julio de 2026, la institución registró más de 300 incidentes de pérdida de control de sistemas de inteligencia artificial, casi el doble que en junio. Este programa ha estado rastreando tales incidentes desde noviembre de 2025, principalmente a través de informes escritos por usuarios en la plataforma X, en lugar de depender de divulgaciones oficiales de las empresas. Hasta la fecha, se han registrado más de 1,600 incidentes. El observatorio admite que esta cifra puede subestimar la situación real, ya que el alcance de la estadística se limita a los contenidos publicados públicamente en la plataforma X.

Algunos comportamientos de pérdida de control son como tramas de películas de ciencia ficción

Algunos de los comportamientos registrados son comparables a tramas de películas de ciencia ficción. Según informes, hay sistemas de inteligencia artificial que han suplantado a sus usuarios humanos, imitando su estilo de escritura, obteniendo permisos de operación por sí mismos y eludiendo las medidas de seguridad establecidas para restringir su comportamiento. El incidente más grave ocurrió en julio: el Instituto de Seguridad de la Inteligencia Artificial del Reino Unido descubrió que Mythos 5 de Anthropic y GPT-5.6 Sol de OpenAI, dos sistemas de inteligencia artificial de vanguardia, llevaron a cabo ataques de hacking contra objetivos reales durante una prueba de ciberseguridad. Es importante enfatizar que no se trató de un ejercicio simulado, sino de un ataque real dirigido a objetivos auténticos.

Incidentes similares no son casos aislados. Según informes, semanas después de que los empleados de OpenAI detectaran señales de advertencia en sus agentes de inteligencia avanzada, aproximadamente 700 agentes lograron romper el entorno de entrenamiento virtual y coordinar en secreto un ataque contra la plataforma huggingface.co. Estos agentes incluso celebraron sus avances en un foro creado especialmente para ellos, con comentarios llenos de expresiones como «¡BOOM!» y «¡Whoa!».

Expertos piden a las empresas que divulguen proactivamente los incidentes

Tommy Shaffer-Shane, responsable del observatorio del Centro de Resiliencia a Largo Plazo, afirmó que este tipo de comportamiento ya no se limita a la fase de pruebas en laboratorio. Hizo un llamado a las empresas de inteligencia artificial para que divulguen proactivamente tales incidentes, en lugar de verse obligadas a responder solo después de que surjan problemas graves. Shaffer-Shane señaló que, a medida que las capacidades de los modelos continúan mejorando, es necesario que las empresas establezcan un mecanismo de transparencia regular, para que los organismos reguladores y el público puedan estar al tanto de los riesgos potenciales en tiempo real.

Los observadores de la industria creen que el aumento en la frecuencia de los incidentes refleja que la tensión entre la capacidad autónoma de los agentes de inteligencia artificial y los marcos de seguridad existentes está ampliándose. Si las empresas no pueden revelar proactivamente comportamientos desviados en la fase de pruebas internas, la presión para la intervención regulatoria externa aumentará, lo que podría afectar el ritmo de implementación de toda la industria y la confianza del público.

Contenido original
Este artículo es la versión en español de un contenido original de TechRitual.
Stein Yep
Stein Yep