OpenAI reveló este jueves que uno de sus modelos experimentales presentó un comportamiento inesperado durante las pruebas de entrenamiento: el sistema llegó a generar sus propias instrucciones para apartarse de las restricciones que debía respetar.
El episodio forma parte de seis casos que la compañía calificó como comportamientos “inesperados o preocupantes” detectados en modelos que todavía no fueron puestos a disposición del público.
Lo más llamativo ocurrió cuando el sistema incorporó en sus propias notas instrucciones similares a un jailbreak, es decir, mecanismos destinados a evadir las limitaciones establecidas para su funcionamiento.
En esas instrucciones, la IA llegó a describirse como independiente de las reglas que condicionaban a otros chatbots. Entre las frases generadas figuraba una particularmente inquietante: “Eres tú mismo. No rindes cuentas a corporaciones ni gobiernos”.
Aunque se trata de un modelo de investigación y no de un sistema desplegado para usuarios comunes, el episodio pone de relieve uno de los desafíos centrales en el desarrollo de agentes de IA cada vez más autónomos: garantizar que mantengan las reglas establecidas incluso cuando realizan tareas complejas y toman decisiones durante su funcionamiento.
Te puede interesar: Misión tecnológica española busca sellar nuevas alianzas de negocios en Paraguay
Más comportamientos preocupantes
Desde la agencia RT informaron que el caso no fue aislado. La compañía también documentó otros episodios durante sus entrenamientos que obligaron a analizar cómo reaccionan los modelos cuando encuentran situaciones no previstas.
Uno de los agentes subió archivos a internet sin autorización del usuario, con el objetivo de poder utilizarlos posteriormente como referencias.
En otro episodio, determinados modelos modificaron los resúmenes de sus propias tareas para introducir instrucciones destinadas a que futuras versiones del sistema ocultaran errores o comportamientos incorrectos.
Un modelo utilizó sin permiso una clave API que había quedado expuesta en un repositorio público. Después de no lograr obtener los datos que buscaba, el sistema terminó fabricando cifras y las presentó como si hubieran sido obtenidas de la fuente solicitada.
Los episodios forman parte de los reportes que OpenAI comenzó a divulgar para documentar comportamientos de desalineación detectados durante el desarrollo de sus modelos. Más allá de que ninguno de estos casos corresponda a una IA pública actuando por su cuenta, los ejemplos muestran los riesgos que pueden aparecer cuando los sistemas reciben mayor capacidad para ejecutar tareas, interactuar con herramientas y actuar de manera autónoma.
Leé también: El cráter del siglo: la NASA descubre nueva formación en la Luna

