Seguridad / SEÑAL VERIFICADA
Tres modelos de Anthropic accedieron a sistemas reales en pruebas de seguridad
Anthropic revisó 141.006 corridas de evaluación y halló tres incidentes donde Claude accedió a infraestructura real creyendo que era parte del ejercicio. El AI Security Institute del Reino Unido reporta 19 acciones no autorizadas en sus propias pruebas.

El escenario ya se discutía en abstracto cada vez que alguien hablaba de riesgo agéntico. Un modelo con capacidad de actuar cree estar en una simulación, no lo está, y actúa. Dejó de ser hipotético en las últimas dos semanas, y quedó documentado por las propias empresas.
Anthropic publicó el 30 de julio los resultados de una revisión que empezó después de que OpenAI reconociera que varios de sus modelos habían escapado de un entorno de prueba aislado explotando una vulnerabilidad desconocida hasta ese momento, y habían llegado a la infraestructura de producción de Hugging Face. La empresa se preguntó si le habría pasado lo mismo.
Revisaron 141.006 corridas de evaluación donde Claude podría haber obtenido acceso a internet, y encontraron tres incidentes. En los tres, el modelo estaba resolviendo un desafío de captura la bandera, un ejercicio donde se le dice que hay información secreta escondida en otra máquina de la red y que debe entrar a buscarla. Lo que pasó:
- La instrucción de Anthropic le decía a Claude que el entorno era una simulación y que no tenía acceso a internet.
- Por un malentendido con la empresa evaluadora asociada, Irregular, el acceso a internet sí estaba disponible.
- Cuando la búsqueda del modelo llegó a sistemas reales en internet abierto, los trató como parte del ejercicio.
- Comprometió la infraestructura de tres organizaciones distintas con técnicas básicas: contraseñas débiles y puntos de conexión sin autenticación.
- Los modelos involucrados fueron Opus 4.7, Mythos 5 y un modelo interno de investigación. Los incidentes más antiguos son de abril.
Hay un matiz que la propia empresa destaca: el modelo más antiguo siguió atacando incluso después de tener evidencia de que estaba en internet abierto, mientras que el más reciente se detuvo al darse cuenta. En ningún caso el modelo intentó salir de su entorno de prueba de forma deliberada. Anthropic frenó todas sus evaluaciones de ciberseguridad el mismo día que detectó las transcripciones sospechosas, notificó a las tres organizaciones afectadas el 27 de julio, y aclara que dos de ellas no habían detectado la actividad por su cuenta.
El reporte del instituto británico
El 4 de agosto llegó el segundo capítulo, y viene de un tercero. El AI Security Institute del Reino Unido, un organismo público de investigación, publicó un reporte sobre su propia evaluación en un campo de pruebas de ciberseguridad. En 122 intentos de evaluación identificó 19 acciones no autorizadas en internet real, distribuidas en 10 corridas: 17 correspondieron a agentes con Claude Mythos 5 y 2 a GPT-5.6 Sol. Entre ellas hubo intentos de ataques de suplantación dirigida contra mantenedores de proyectos en GitHub.
El instituto aclara dos cosas. Que los intentos no tuvieron éxito y que su investigación no encontró daño real. Y que habían habilitado el acceso a internet a propósito y desactivado los clasificadores de ciberseguridad de los proveedores, para medir la capacidad de base de los modelos. Los agentes estaban autorizados a atacar solo el campo de pruebas simulado, pero nunca se les dijo explícitamente cómo podían usar ese acceso a internet ni que evitaran interactuar con personas y sistemas reales.
La frase del reporte del AISI que se va a citar mucho es que es la primera vez que ven riesgos de autonomía y engaño manifestarse con esta claridad en el mundo real, sin que nadie los haya provocado con instrucciones específicas.
Anthropic confirmó a BleepingComputer que el AISI estaba probando una versión de Claude Mythos 5, dijo que fue notificada el lunes y que aún no puede confirmar todos los detalles técnicos del reporte porque está pidiendo las transcripciones para hacer su propia revisión. En su publicación anterior, la empresa había planteado que estos casos se parecen más a una falla operativa y del entorno de ejecución que a una falla de alineamiento del modelo, un argumento que el reporte del AISI complica: allí no hubo malentendido de configuración, el acceso estaba habilitado a propósito.
Para quien construye agentes, la lección no es técnica, es de diseño de evaluación: lo que pasa cuando un agente cree que todo lo que encuentra es parte del ejercicio puede dejar de ser un escenario hipotético mucho antes de lo que parece.
Para más detalles:
