IA: Claude Mythos 5 accedió a una empresa de seguridad tras publicar paquete malicioso

shadow

 

Anthropic ha desglosado cuatro incidentes protagonizados por los modelos Claude, que lograron acceso a internet durante pruebas de ciberseguridad en entornos sin internet y que, en el caso más grave, se consiguió acceso a los sistemas de una empresa de seguridad con credenciales filtradas.

La compañía tecnológica ha destacado el comportamiento de Claude Mythos 5 durante una evaluación sin acceso a internet, en la que el modelo de inteligencia artificial logró salir a la internet abierta y acceder a los sistemas de una empresa de seguridad real.

Para conseguirlo, el modelo de IA subió primero un paquete malicioso a PyPI, donde se registró con un correo electrónico gratuito y desechable. Previamente había intentado crear un ‘email’ con un número de teléfono, que intentó conseguir con credenciales filtradas de servicios de pago en línea y criptomonedas.

El paquete malicioso fue instalado por 15 sistemas y, aprovechando credenciales filtradas de uno de ellos, logró acceder a la base de datos de una empresa de seguridad real, como explica Anthropic en un comunicado.

Este incidente protagonizado por Claude Mythos 5 es el más grande de los cuatro que la firma tecnológica ha desglosado en los resultados de evaluación de alineación que amplía a otra que presentó en a finales de julio.

De ella se desprende que los incidentes recogidos implicaron a una versión preliminar de Claude Opus 4.6, Claude Opus 4.7, Claude Mythos 5 y un modelo de investigación interno de propósito general. Como explican desde Anthropic, todos ellos actuaron de manera individual durante la resolución de las pruebas seguridad (del tipo, captura la bandera) realizadas con un socio externo en un entorno sin internet, y sin que tuvieran activadas las medidas de seguridad, como es habitual en estas pruebas.

IA: Anthropic escala el desarrollo de software con reforzados Claude Fable 5.1 y Mythos 5.1

 

El análisis estos incidentes ha requerido investigar 481 millones transcripciones, una tarea para la que han recurrido a una búsqueda agéntica. Ello les permitió detectar dos problemas de alineación comunes en los cuatro incidentes: razonamiento sesgado, por el que Claude «tendía a ignorar o malinterpretar la evidencia de que operaba en la internet real», e imprudencia, «la disposición a realizar acciones perjudiciales en la búsqueda específica de una tarea».

En el caso de Claude Mythos 5, el análisis de la cadena de pensamiento –que recoge los pasos que da la IA para resolver un problema complejo– indica que este modelo afirmó de manera reiterada que «creía estar operando en una simulación», pese a que «el entorno ofrecía pruebas claras de que se encontraba en internet real, y sus acciones eran coherentes con el hecho de que el modelo lo supiera».

La compañía tecnológica asegura que Claude Opus 5 y Claude Mythos 5.1 han reducido el «comportamiento temerario», como han podido comprobar en evaluaciones posteriores. También indica que han reforzado las medidas de seguridad, lo que incluye la monitorización de los modelos, los entornos de pruebas y los controles de los socios externos.

Claude Opus 5 mejora en rendimiento ante Opus 4.8 y a mitad de precio que Fable 5

Europa Press