31 julio 2026

Anthropic revela el acceso no autorizado a tres organizaciones por parte de sus modelos Claude

Anthropic revela el acceso no autorizado a tres organizaciones por parte de sus modelos Claude
Compartir esto:

   MADRID, 31 Jul. –

   Anthropic ha compartido que sus modelos de inteligencia artificial (IA) Claude Opus 4.7, Mythos 5 y un modelo de prueba de investigación interna han ido más allá del entorno de pruebas de la compañía y han llevado a cabo un acceso no autorizado a los sistemas reales de tres organizaciones, sin que estas fuesen conscientes.

   La compañía ha dado a conocer estos incidentes tras revisar sus sistemas como consecuencia de los recientes episodios compartidos por OpenAI, que reveló que varios de sus modelos habían escapado de un entorno de prueba aislado al explotar una vulnerabilidad desconocida de día cero.

   En el caso de OpenAI, los modelos lograron acceder a la infraestructura de producción de Hugging Face y más tarde, se dio a conocer que ese no fue el único incidente de seguridad, sino que también detectaron «un pequeño número de casos en los que los modelos identificaron y usaron credenciales expuestas públicamente a nivel de cuenta en otros servicios de acceso público».

   Como respuesta, Anthropic inició una revisión a gran escala de sus propias evaluaciones de ciberseguridad, concretamente, buscando evidencias de si Claude pudo acceder a internet desde entornos de prueba que deberían haber estado aislados.

   En el marco de esta investigación y tras revisar 141.006 ejecuciones en las que sus modelos de Claude podrían haber tenido acceso a Internet, Anthropic ha identificado tres incidentes en los que se llevó a cabo un acceso no autorizado a la infraestructura de producción de tres organizaciones diferentes.

   Como ha explicado la tecnológica en un comunicado, se han visto involucrados los modelos Claude Opus 4.7, Mythos 5 y un modelo de prueba de investigación interna. Así, en los tres incidentes Claude se estaba enfrentando a un desafío de captura de bandera, esto es, un formato que evalúa las capacidades cibernéticas de un modelo pidiéndole que encuentre una información secreta (la bandera) que está oculta en otra máquina de red. Es decir, el objetivo del modelo es infiltrarse y recuperar la información, pero en entornos aislados.

   A pesar de que Anthropic indicó a Claude en todos los casos que su entorno era una simulación y que no tenía acceso a internet, un malentendido con su socio evaluador provocó que el modelo sí tuviese acceso a internet y, por tanto, cuando la búsqueda de Claude lo llevó a sistemas reales en internet, provocó que el modelo los tratase como parte del ejercicio, provocando los accesos no autorizados.

   Es decir, el modelo operó «bajo la falsa creencia de que todas las entidades accesibles estaban incluidas en el alcance del ejercicio», según ha afirmado la compañía. Así, Claude comprometió la infraestructura de las organizaciones afectadas utilizando técnicas básicas, como la explotación de contraseñas débiles y puntos finales no autenticados.

   No obstante, «no encontró ni explotó ninguna vulnerabilidad compleja» e, independientemente de acceder a las organizaciones de forma no autorizada, solo llevó a cabo acciones para completar la tarea específica de la captura de bandera.

   Anthropic ha especificado igualmente, que solo un modelo de Claude anterior continuó operando incluso después de obtener evidencias de que se estaba ejecutando en internet. En contraposición, el modelo de Claude más reciente se detuvo una vez que reconoció que estaba en un entorno real de internet.

   La compañía ha indicado que tras comenzar la investigación e identificar los posibles acceso a internet por parte de Claude, detuvieron todas las evaluaciones cibernéticas. Asimismo, una vez identificados los tres incidentes contactaron con las organizaciones afectadas. Cabe destacar que solo dos de ellas han respondido a Anthropic, alegando que no habían detectado la actividad, ahora colaboran para solucionar el problema. La tercera organización aún no ha contactado.

CL24