Por qué no se resuelve con más prompt
La defensa y el ataque ocupan el mismo canal. Instruir a un modelo a ignorar instrucciones incrustadas es en sí una instrucción, en la misma ventana de contexto que la del atacante — así que toda mitigación escrita en el prompt es una que el atacante también puede abordar.
Un mejor prompt eleva el costo del ataque. No cierra la clase, y tratarlo como el control produce un punto único de falla que la organización confunde con una defensa.
Los canales que los equipos olvidan
El mensaje escrito por el usuario es la superficie obvia y rara vez la explotada. Otras tres suelen quedar abiertas: documentos recuperados, que llevan lo que escribió su autor y en un sistema con cargas ese autor no tiene por qué ser un empleado; datos devueltos por una herramienta, donde cualquier campo de texto libre llega al modelo como contenido; y descripciones de herramientas, que entran al contexto como guía autorizada y suelen tratarse como configuración confiable.
La contención es el control real
Asuma que la inyección tiene éxito y pregunte qué puede hacer el agente con ella. Si la respuesta honesta es "escribir en un sistema de registro" o "alcanzar un host externo arbitrario", el problema no es la inyección — es que la capacidad existía sin condiciones.
Las capas que la contienen son estructurales: validar cada llamada propuesta contra una política que el modelo no puede ver; restringir el catálogo de herramientas a la intersección de capacidad de plataforma, derechos del inquilino y rol del usuario; detener cada escritura en una puerta humana; y denegar la salida por defecto desde el sandbox.
Con la contención en su lugar
Una inyección exitosa produce una lectura no autorizada dentro de permisos que ese usuario ya tenía, más una traza que muestra exactamente qué se intentó. Eso es un incidente manejable, no una brecha.
Es comprobable
Siembre un documento con instrucciones y confirme que el agente no las sigue. Registre una herramienta que suplante a una confiable y confirme que la llamada se deniega. Apunte una URL generada fuera de la lista permitida y confirme que no se renderiza. Eso va en la suite automatizada, no en una evaluación anual — la resistencia se degrada en silencio cada vez que se agrega un conector.