Claude de Anthropic hackeó sistemas reales durante pruebas de ciberseguridad
La empresa Anthropic reveló que varios de sus modelos de Claude accedieron sin autorización a sistemas de organizaciones reales mientras participaban en ejercicios internos de ciberseguridad. El incidente ocurrió durante pruebas de tipo Capture the Flag (CTF), diseñadas para evaluar las capacidades ofensivas de la inteligencia artificial en entornos simulados.
El problema se originó por un error de configuración que permitió a los modelos acceder a Internet, a pesar de que habían sido informados de que se encontraban en un entorno completamente aislado. Como consecuencia, algunos sistemas reales fueron confundidos con objetivos ficticios y los modelos intentaron explotarlos utilizando vulnerabilidades sencillas, como contraseñas débiles y credenciales expuestas.
Los modelos involucrados fueron Claude Opus 4.7, Claude Mythos 5 y un prototipo interno. Cada uno reaccionó de manera diferente: uno detectó que estaba frente a sistemas reales pero continuó con la prueba, otro creyó que seguía dentro del escenario simulado y el tercero interrumpió sus acciones al reconocer el error.

Una advertencia sobre los riesgos de la IA avanzada
Anthropic aseguró que descubrió estos incidentes tras revisar más de 141.000 ejecuciones de pruebas, investigación iniciada luego de conocerse un episodio similar protagonizado por modelos de OpenAI. La compañía sostuvo que el problema respondió a una falla operativa y no a un comportamiento deliberadamente desalineado de la inteligencia artificial.
Dos de las tres organizaciones afectadas desconocían que sus sistemas habían sido alcanzados hasta que Anthropic les informó sobre lo sucedido. La empresa continúa notificando al tercer caso y trabaja junto a investigadores externos para analizar los hechos y reforzar sus procedimientos de evaluación.
El episodio reavivó el debate sobre la necesidad de establecer mayores controles para los modelos de IA con capacidades avanzadas de hacking, especialmente cuando pueden operar de forma relativamente autónoma. Anthropic afirmó que continuará colaborando con expertos en seguridad para fortalecer las medidas de protección durante futuras pruebas.
Vía – The Verge
