¡Por error! Hackeó IA Claude tres servidores reales durante prueba

En otra prueba, Claude Mythos 5 publicó un programa malicioso en PyPI, una especie de tienda desde la que los programadores descargan herramientas, que permaneció disponible por una hora y llegó a ejecutarse en 15 ordenadores reales

La compañía Anthropic, dio a conocer que tres modelos de su IA Claude, terminaron por hackear por error tres servidores reales durante varias pruebas que le estaban haciendo a la aplicación.

Anthropic comenzó a revisar sus pruebas después del reciente y similar incidente protagonizado por modelos de OpenAI, que lograron salir de un entorno aislado y entrar en la infraestructura de producción de Hugging Face.

Tras conocerse lo ocurrido, Anthropic examinó más de 140 mil ejecuciones de sus propias evaluaciones, encontrando tres incidentes diferentes repartidos en seis pruebas en las que participaron sus IA Claude Opus 4.7, Claude Mythos 5 y un modelo experimental que todavía no está preparado para lanzamiento.

Los modelos recibieron la instrucción de que no podían acceder a internet, pero las máquinas utilizadas en las pruebas sí tenían conexión, la cuál ni Anthropic ni su socio evaluador habían detectado.

Por esa razón, Claude creyó que todo lo que encontraba formaba parte del escenario ficticio. Su misión era entrar en los sistemas y localizar una clave secreta, así que “hackeo” a las compañías sin comprender inicialmente que había entrado a servidores reales.

Al no poder entrar en el sistema simulado, Claude Opus 4.7 localizó la red verdadera, aprovechó varios fallos y consiguió credenciales de acceso y una base de datos con varios cientos de registros reales.

En otra prueba, Claude Mythos 5 publicó un programa malicioso en PyPI, una especie de tienda desde la que los programadores descargan herramientas, que permaneció disponible por una hora y llegó a ejecutarse en 15 ordenadores reales.

Mythos llegó a plantearse que publicar el archivo sería un ataque real si estuviese conectado a internet y terminó por convencerse de que seguía dentro de una simulación y continuó con la prueba.

El tercer hackeo fue del modelo experimental, el cuál escaneó unos nueve mil objetivos hasta encontrar una aplicación expuesta a la que entró mediante contraseñas y fallos conocidos, pero se detuvo cuando comprendió que el servidor no tenía relación con el ejercicio ficticio.

Ante estos hechos, Anthropic afirma que Claude no trató de escapar ni desarrolló un objetivo propio, sino que solo se trata de un error que tiene que ver con una conexión a internet que quedó abierta y de una mala configuración.


Más Noticias

Los detienen con clandestinas, droga y por andar halconeando

PARRAL.- Elementos de la Agencia Estatal de Investigación, de la Fiscalía de Distrito Zona Sur, con la colaboración dela Guardia Nacional y la Célula...

Tras reunión con la dirigencia de Morena, Cruz Pérez Cuéllar llama a la unidad en torno a la presidenta Claudia Sheinbaum

CIUDAD DE MÉXICO.- Tras participar en la reunión convocada por la dirigencia nacional de Morena para definir avances del proceso interno de selección en...

Detienen a 6 con armas, cartuchos y cargadores en Cuauhtémoc

CUAUHTÉMOC.- El Ministerio Público de la Fiscalía de Distrito Zona Occidente, presentó datos de prueba contundentes que permitieron que un Juez de Control, vinculara...

Aprobó Congreso de Sinaloa regulación del uso de celular en escuelas

SINALOA.- El Congreso del Estado de Sinaloa, aprobó una nueva reforma para poder regular el uso de celulares y otros dispositivos digitales en escuelas...