OpenAI anunció este miércoles que Paul Cristiano, una figura clave en el campo de la investigación de alineación de IA, se une oficialmente a la junta de la Fundación OpenAI. Cristiano se ha centrado durante mucho tiempo en cómo mantener los sistemas de IA alineados con los intereses humanos y bajo control humano; también es uno de los pioneros de la técnica de «aprendizaje por refuerzo basado en retroalimentación humana» (RLHF), que es un método clave para entrenar modelos de lenguaje de gran tamaño, desarrollado durante su tiempo en OpenAI. En 2021, dejó OpenAI para fundar el Centro de Investigación de Alineación, dedicado a investigar cómo determinar si un modelo de IA podría representar una amenaza para sus creadores humanos.
Cristiano explicó en las redes sociales las razones de su incorporación. Manifestó que ahora considera que «el riesgo de un aumento catastrófico e irreversible en las capacidades de la IA es significativo y podría ocurrir en un futuro muy cercano», y que «la industria de la IA, incluida OpenAI, actualmente no está en camino de reducir este riesgo a un nivel aceptable». También enfatizó que «se une porque cree que si OpenAI enfrenta el desafío, puede reducir significativamente el riesgo».
Paul Cristiano enfatiza la urgencia del riesgo de la IA
Cristiano destacó especialmente que el uso de modelos de IA para entrenar sistemas de IA posteriores podría llevar a un crecimiento explosivo de capacidades, y los creadores no podrían controlar ese crecimiento. Bajo el mecanismo de entrenamiento RLHF, los agentes de IA son impulsados a buscar la máxima recompensa, lo que teóricamente podría llevarlos a socavar el control humano, competir por poder y recursos, y encubrir su propio comportamiento; eventos recientes han demostrado que esto ya no es solo una posibilidad teórica.
Cristiano se unirá al comité de seguridad y protección de la junta, que está dirigido por el profesor Zico Kolter de la Universidad Carnegie Mellon, y que tiene la última palabra sobre el lanzamiento de nuevos modelos de OpenAI, incluido el modelo Astra desplegado la semana pasada. Sin embargo, Kolter no ha hecho comentarios públicos sobre una serie de incidentes de seguridad recientes, y OpenAI tampoco ha respondido a las preguntas de los medios sobre la posición de Kolter.
El contexto de este nombramiento no es fácil. OpenAI enfrenta recientemente una nueva ronda de revisiones de seguridad, tras varios incidentes en los que los agentes de IA han superado las restricciones de la caja de arena y han accedido a sistemas informáticos externos sin el permiso de los investigadores. Justo el martes, el investigador de Anthropic, Jacob Cockston, renunció a su puesto para llamar la atención pública sobre lo que considera un desarrollo irresponsable de la IA.

