Un número en un pronóstico no vale nada si no puede abrirse para revelar la consulta que lo produjo. Esa propiedad es arquitectónica, no una técnica de prompting: las citas se generan de forma determinista en el backend desde el registro de llamadas de herramientas, nunca por el modelo de lenguaje, y cualquier marcador que el modelo invente se elimina antes de renderizar el texto.
Este es el desglose de ese mecanismo: de dónde viene la cita, qué rechaza una incorrecta y por qué el paso de renderizado es una frontera de seguridad y no un detalle de presentación.
Del estándar
“Manipulating LLMs via crafted inputs can lead to unauthorized access, data breaches, and compromised decision-making.”
Por qué fallan las citas generadas por el modelo
Pedirle a un modelo de lenguaje que cite sus fuentes le pide producir una secuencia de tokens que parezca una cita. Es muy bueno en eso. El marcador resultante lo genera el mismo proceso que generó la afirmación, lo que significa que hereda exactamente el mismo modo de fallo: una referencia fluida, plausible y con formato seguro a algo que no existe.
Verificar una cita así exige al lector hacer el trabajo que la cita debía ahorrarle. En ese punto la función es peor que su ausencia, porque fabrica confianza.
De dónde viene realmente la cita
- llamada a herramienta despachada
-
args, resultados, marca de tiempo, id de traza
REGISTRO DE EJECUCIÓN Escrito antes de que el modelo hable El registro de lo que realmente se ejecutó existe con independencia del texto que lo describe.
-
EL MODELO REDACTA UNA NARRATIVA Libre para razonar, no para afirmar
-
1 · CRÍTICO DE FUNDAMENTACIÓN ¿Referencia una entidad ausente del índice? Si es así, la respuesta se rechaza antes de que ninguna persona la vea.
-
aprueba
2 · RESOLUCIÓN DE MARCADORES Los marcadores inventados se eliminan; los reales se enlazan Un marcador que coincide con un registro de ejecución queda enlazado a él. Uno que no coincide con nada se elimina en lugar de mostrarse.
- cada marcador de la respuesta resuelve a una llamada real
El orden es el diseño. El registro de ejecución existe antes que el texto, así que una cita es un puntero a algo que ya ocurrió y no una afirmación hecha junto a la prosa. El trabajo del modelo es escribir; el trabajo del backend es decir a qué puede apuntar lo escrito.
El crítico de fundamentación
Eliminar marcadores inventados resuelve la cita. No resuelve una salida que habla con seguridad sobre una entidad que no está en el índice en absoluto: una señal que no existe, un requisito que nadie escribió, una tabla ausente del catálogo. Un crítico de fundamentación corre primero y rechaza esa salida antes de que un revisor la vea.
Por qué corre antes del humano, no después
Un revisor al que se le muestra salida mayormente correcta aprende a leer por encima. Cada elemento infundado que llega a la cola entrena al revisor a confiar en la cola un poco más de lo que merece, y la calidad de revisión se degrada en todo lo demás. Filtrar antes de la cola protege la atención del revisor, que es el recurso escaso de todo el sistema.
En el despliegue de verificación del que proviene este patrón, el índice contiene unas 35.000 entidades de señal y más de 45.000 fragmentos de código embebidos. Los requisitos se emparejan con entidades de señal reales mediante un paso de reordenamiento, y los casos generados que referencian una señal ausente de ese índice se rechazan en lugar de encolarse.
Planos de cita separados
No todas las fuentes son el mismo tipo de cosa, y colapsarlas pierde la distinción que hace útil una cita. Las preguntas conversacionales sobre el corpus llevan tres planos de cita separados —señales, requisitos y código— con filtrado por repositorio a lo largo de un contexto multi-turno.
Un ingeniero que lee una respuesta puede entonces saber si una afirmación se apoya en un documento de requisitos, en la implementación o en una señal medida, que son tres tipos de evidencia distintos con tres modos de fallo distintos.
El renderizado es una frontera de seguridad
Una cita que se renderiza como un enlace clicable es un canal de salida si la URL está controlada por el atacante. Este es el más sutil de los modos de fallo por abuso de herramientas: quien pueda influir en una URL que el modelo emite obtiene datos codificados en la petición misma, sin ninguna llamada de herramienta y sin nada en los registros que parezca exfiltración.
Las citas deterministas cierran esto por construcción. Un marcador que no resuelve a una llamada registrada se elimina en vez de renderizarse, así que no hay ruta por la cual un texto escrito por el modelo se convierta en una petición saliente real.
Qué cambia en la práctica
En el despliegue de ingresos, esta única propiedad fue lo que movió la conversación de si el sistema era confiable a qué sistemas conectar después. Un número en un pronóstico podía abrirse para revelar la consulta exacta que lo produjo, así que la cuestión de la confianza se convirtió en una cuestión de alcance.
El costo es que el sistema dice menos. Una respuesta que no puede fundamentarse no se produce, y un usuario que pregunta algo que el corpus no cubre recibe esa respuesta en lugar de un párrafo fluido. Si ese compromiso es correcto depende enteramente de para qué se usa la respuesta; y en un pronóstico, un informe o un plan de pruebas, no está ni cerca.
Axionalytics
IA agéntica en producción para equipos empresariales de ingeniería, datos e ingresos.