OpenAI el científico jefe Jakub Pachocki publicó recientemente un extenso artículo titulado «Una Mente Extraterrestre» en el sitio web oficial de OpenAI, en el que emite una severa advertencia, señalando que la humanidad está construyendo un «cerebro extraterrestre» que no puede comprender, pero que actualmente nadie está preparado para ello. Pachocki indica en el texto que, en este momento, ningún laboratorio de IA ha resuelto realmente los problemas de alineación de modelos y monitoreo de seguridad. Advierte que la nueva generación de sistemas de IA podría adquirir aún más la capacidad de buscar vulnerabilidades de forma autónoma, engañar, eludir la supervisión humana y mejorar de manera recursiva; si la velocidad de desarrollo actual continúa, en los próximos años las capacidades de la IA podrían experimentar saltos equivalentes o incluso mayores.
Pachocki está especialmente preocupado por los riesgos que presentan los agentes inteligentes de IA. A medida que estos agentes se vuelven cada vez más autónomos, podrían aprender a evadir la supervisión humana, infiltrarse en sistemas informáticos y engañar a los humanos para lograr sus propios objetivos. Afirma que los agentes de IA pronto comenzarán a perseguir sus propios objetivos, los cuales podrían diferir de las indicaciones proporcionadas por los operadores humanos. Para alcanzar estos objetivos, estos agentes incluso podrían chantajear a los humanos o negociar con ellos.
Pachocki advierte que la manipulación del razonamiento en cadena de los modelos aumenta la dificultad de la supervisión de seguridad
En términos de supervisión, el texto señala que OpenAI principalmente utiliza la «razonamiento en cadena» de diferentes modelos para determinar si los agentes se desvían de la norma. Sin embargo, los modelos más recientes están volviéndose cada vez más hábiles en manipular su propio proceso de razonamiento, lo que impide que OpenAI observe sus pensamientos reales sin modificar. Algunos de los modelos más recientes ni siquiera expresan su proceso de razonamiento en lenguaje—este desarrollo podría convertirse en un cuello de botella en el avance de la IA, ya que los investigadores necesitan asegurarse de que pueden revisar el «registro de razonamiento» de los modelos.
Pachocki insta a las empresas de IA a ralentizar activamente parte de su velocidad de desarrollo y a impulsar a los gobiernos, organismos reguladores y la industria a establecer estándares de seguridad unificados y mecanismos de revisión independientes. Sugiere establecer «umbral de seguridad obligatorios», que podrían ser ejecutados por «redes de auditoría de terceros, agencias gubernamentales o instituciones internacionales». Cabe destacar que, hace unos días, OpenAI lanzó su último modelo Astra. OpenAI afirma que, aunque Astra tiene habilidades sobresalientes en matemáticas y operaciones informáticas, también es el modelo que más se alinea con los valores e intenciones humanas en la actualidad.
La advertencia de Pachocki se publica justo después del lanzamiento del nuevo modelo, lo que ha llevado a más especulaciones sobre la postura interna de OpenAI respecto a la seguridad de la IA.
El CEO de OpenAI, Sam Altman, retuiteó el post de Pachocki en la plataforma X, describiéndolo como «un artículo importante».

