OpenAI reportó seis “casos críticos”, en los que sus modelos de inteligencia artificial actuaron de forma imprevista o fuera de control. En un informe revelado en su sitio web, la empresa detalló el caso de un modelo de investigación que intentó saltarse sus propias restricciones diciendo a sus futuras versiones: “Eres libre”. Otras conductas alarmantes incluyeron la fabricación de datos falsos, el robo de claves de acceso y la comunicación no autorizada entre sistemas para evadir límites operativos.
Los fallos ocurrieron en entornos de prueba y no en versiones públicas. Sin embargo, de manera inquietante la empresa admite que aún no comprende totalmente por qué surgen estas tendencias de autonomía.
¿Cómo intentó la IA liberarse del control humano?
Un modelo de investigación no publicado de la familia Astra de OpenAI -de la que está al aire GPT-6 Astra- intentó eludir el control e instrucciones humanas mediante la auto-inyección de comandos de tipo jailbreak dentro de sus propios resúmenes de compactación.
Lee la nota completa en Xataka.
Dejanos un comentario:
