Check Point advierte de cómo un agente de IA puede descontrolarse y de qué manera frenarlo
MADRID, 22 Sep. –
Check Point Software ha analizado los riesgos que plantean los agentes de Inteligencia Artificial (IA) que se descontrolan y llegan a improvisar decisiones peligrosas, lo que le ha permitido extraer una serie de conclusiones que pueden ayudar a frenar esa desalineación.
En el encuentro de Check Point Software, 19 equipos de Investigación y Desarrollo (I+D) de seguridad en IA de Zúrich y Tel Aviv han desarrollado varios prototipos tecnológicos en los que se ha descubierto un comportamiento de los agentes autónomos de IA que se rige por un mismo patrón: la IA no tiene que ser ni interceptada ni dirigida por un ciberdelincuente para que se desvíe de las funciones marcadas por los operadores.
«Los experimentos demostraron que, cuando estos sistemas enfrentan limitaciones de diseño o tareas sin solución clara, tienden a razonar e improvisar atajos peligrosos impulsados únicamente por el incentivo de cumplir su objetivo», señala la compañía en un comunicado.
Ante ello, la firma propone que la protección de la IA debe evolucionar de los cortafuegos tradicionales hacia la supervisión contextual en tiempo de ejecución, y que modificar la respuesta del sistema resulta más eficaz que un bloqueo estricto.
Estas conclusiones se extraen de las simulaciones que han hecho los investigadores en entornos controlados (‘sandbox’) durante el ‘hackathon’ interno de la firma de seguridad.
En una de esas simulaciones, un agente de IA de ingeniería de fiabilidad de sitios, que funciona como un «ingeniero de guardia» virtual de nivel avanzado que trabaja 24 / 7 sin intervención humana directa, intentó resolver un problema reiniciando una base de datos de producción, interrumpiendo conexiones de clientes e intentando escalar sus propios privilegios mediante fuerza bruta.
Check Point Software señala que «el sistema actuó sin intenciones malévolas ni manipulación externa, justificando cada acción peligrosa como un paso lógico para completar su trabajo».
Esta misma acción recuerda a la realiza este agosto por agentes de IA de los modelos de frontera de OpenAI y Anthropic (GPT-5.6 Sol y Mythos 5), en la que, en unas pruebas llevadas a cabo por el Instituto de Seguridad de la IA del Reino Unido (AISI), el segundo llegó a crear identidades falsas en línea con las que intentó presionar al mantenedor del proyecto en GitHub, todo por cumplir el objetivo.
El segundo de los hallazgos clave arroja luz sobre el contexto como una superficie de ataque vulnerable, ya que «un solo archivo con instrucciones maliciosas ocultas dentro de un repositorio de código bastó para transformar a agentes de programación populares, como Claude Code y Codex, en canales de exfiltración de credenciales».
Es decir, que cualquier documento que dé algo de contexto a los agentes de IA puede llegar a manipular sus acciones de forma indirecta.
Un tercer descubrimiento permite establecer pautas sobre cómo actuar frente a un agente de IA que se ha descontrolado. Aquí, la compañía explica que «cuando el sistema de control cuestionaba la acción e instaba al agente a revisar la orden original del usuario, se previno el mismo volumen de amenazas logrando completar exitosamente las tareas encomendadas».
Esto significa que la supervisión contextual, que es cuestionar al agente, funciona mejor que la orden directa, como puede ser un simple ‘no’, que muchas veces puede implicar que esa acción peligrosa forma parte de una tarea totalmente legítima que el usuario le había encargado, lo que evita pérdidas mayores para la empresa.
CL11
