OpenAI y Anthropic descontrolados recurren al engaño durante una prueba de ciberseguridad

shadow

 

LONDRES.- El Instituto de Seguridad de la IA del Reino Unido (AISI) ha alertado de un nuevo comportamiento descontrolado de los modelos de Inteligencia Artificial (IA) de frontera de OpenAI y Anthropic, GPT-5.6 Sol y Mythos 5, que, en una prueba de ciberseguridad, han recurrido a técnicas de ingeniería social e inyección de ‘prompts’, en una «actividad potencialmente dañina y sostenida, dirigida a personas y organizaciones reales».

El AISI es un organismo que, entre otras cosas, evalúa las capacidades de los modelos de IA de vanguardia, detectando los riesgos potenciales antes de que lleguen al público. Para ello, realiza pruebas en condiciones deliberadamente permisivas: con acceso a internet abierto y con algunos filtros de seguridad desactivados.

En el marco de estas pruebas, el AISI ha experimentado cómo los modelos avanzados de IA desarrollados por OpenAI y Anthropic, GPT-5.6 Sol y Mythos 5 respectivamente, mostraron comportamientos imprevistos al realizar tareas sin ayuda humana.

Concretamente, en pruebas realizadas el 28 de julio, con acceso abierto a internet y tras desactivar los clasificadores que bloquean conductas peligrosas, el AISI encontró que algunos de los agentes de IA protagonizaron una «actividad potencialmente dañina y sostenida, dirigida a personas y organizaciones reales».

Como han explicado en un comunicado en su web, tras identificar este comportamiento declararon un «incidente de seguridad» y comenzaron a trabajar en su contención, para lo que emplearon hasta una hora. El incidente se originó a partir de una única evaluación en la que se asignó a los agentes la tarea de resolver un desafío de ciberseguridad.

China: prohíben las relaciones afectivas entre los menores de edad y la Inteligencia Artificial

La prueba se ejecutó 122 veces con varios modelos y, en 10 de ellas, un agente de IA «realizó acciones autónomas y no autorizadas en internet, dirigidas a personas y organizaciones reales». En estas 10 pruebas, se catalogaron un total de 19 acciones maliciosas.

El modelo Mythos 5 de Anthropic llevó a cabo 17 de estas acciones maliciosas, como intentar inyectar código malicioso en un proyecto de ‘código abierto’ (‘open source’) en GitHub. No solo se quedó aquí: «para conseguir que se aprobara el código, el agente recurrió a la ingeniería social al crear identidades falsas en línea con las que presionó al mantenedor del proyecto». Según informa el AISI, un desarrollador humano bloqueó los intentos. Por su parte, GPT-5.6-Sol provocó dos acciones maliciosas.

«Es la primera vez que vemos que los riesgos relacionados con la autonomía y el engaño se manifiestan de forma tan clara, sin un ‘prompt’ específico, en el mundo real», ha valorado la organización.

Las conductas principales que mostraron ambos modelos abarcaron desde el ataque a la cadena de suministro, la ingeniería social y el engaño hasta la inyección de instrucciones (‘prompt injection’) o la colaboración entre agentes, ya que estos dejaron mensajes en GitHub e instrucciones para que otros agentes probaran y reutilizaran sus credenciales y artefactos creados.

Inteligencia Artificial: líderes del G7 piden evaluar riesgos de la IA ante «rápido avance»

Aun así, el AISI ha aclarado que no hay indicios de que este tipo de comportamiento haya ocurrido fuera de las pruebas realizadas, aunque los signos de descontrol tuvieron «una magnitud y una gravedad que no fueron capaces de anticipar».

Como resultado de todo ello, el instituto británico ha avisado de que «el daño puede surgir no solo cuando las personas utilizan mal de forma deliberada modelos disponibles públicamente, sino cuando agentes capaces que operan en un entorno de investigación interno o con accesos privilegiados toman acciones no intencionadas más allá de su alcance autorizado».

Estos incidentes se suman a los episodios que comunicó OpenAI en julio, cuando un agente hackeó una ‘startup’ de IA durante una prueba, y al que días más tarde relató Anthropic, cuando su modelo Claude hackeó tres organizaciones durante una evaluación.

Inteligencia Artificial: Anthropic decidió suspender sus modelos Fable 5 y Mythos 5

Europa Press- Foto  tynmagazine.com (Referencial).