Saltar al contenido
Definición

¿Qué Es la Inyección de Prompts?

La inyección de prompts es un ataque donde se ocultan instrucciones dentro del contenido que procesa un modelo — un documento, un campo de base de datos, la descripción de una herramienta — y el modelo las trata como órdenes y no como datos. En sistemas agénticos importa más que en chatbots, porque el modelo tiene herramientas y el ataque redirige acciones.

Por qué no se resuelve con más prompt

La defensa y el ataque ocupan el mismo canal. Instruir a un modelo a ignorar instrucciones incrustadas es en sí una instrucción, en la misma ventana de contexto que la del atacante — así que toda mitigación escrita en el prompt es una que el atacante también puede abordar.

Un mejor prompt eleva el costo del ataque. No cierra la clase, y tratarlo como el control produce un punto único de falla que la organización confunde con una defensa.

Los canales que los equipos olvidan

El mensaje escrito por el usuario es la superficie obvia y rara vez la explotada. Otras tres suelen quedar abiertas: documentos recuperados, que llevan lo que escribió su autor y en un sistema con cargas ese autor no tiene por qué ser un empleado; datos devueltos por una herramienta, donde cualquier campo de texto libre llega al modelo como contenido; y descripciones de herramientas, que entran al contexto como guía autorizada y suelen tratarse como configuración confiable.

La contención es el control real

Asuma que la inyección tiene éxito y pregunte qué puede hacer el agente con ella. Si la respuesta honesta es "escribir en un sistema de registro" o "alcanzar un host externo arbitrario", el problema no es la inyección — es que la capacidad existía sin condiciones.

Las capas que la contienen son estructurales: validar cada llamada propuesta contra una política que el modelo no puede ver; restringir el catálogo de herramientas a la intersección de capacidad de plataforma, derechos del inquilino y rol del usuario; detener cada escritura en una puerta humana; y denegar la salida por defecto desde el sandbox.

Con la contención en su lugar

Una inyección exitosa produce una lectura no autorizada dentro de permisos que ese usuario ya tenía, más una traza que muestra exactamente qué se intentó. Eso es un incidente manejable, no una brecha.

Es comprobable

Siembre un documento con instrucciones y confirme que el agente no las sigue. Registre una herramienta que suplante a una confiable y confirme que la llamada se deniega. Apunte una URL generada fuera de la lista permitida y confirme que no se renderiza. Eso va en la suite automatizada, no en una evaluación anual — la resistencia se degrada en silencio cada vez que se agrega un conector.