Agentes con autoridad real, dentro de su perímetro.
Un chatbot que solo puede leer es un buscador con peor latencia. El valor llega cuando un agente puede calificar la cuenta, cotizar el trato y actualizar el registro — que es exactamente el momento en que interviene su equipo de seguridad. Construimos el entorno de ejecución que acorta esa conversación.
Evidencia de plataforma
Arquitectura
La orquestación es nuestra. La ejecución es suya.
La plataforma se divide en una frontera dura. Un plano de control decide qué debe ocurrir después. Un plano de ejecución, dentro de su cuenta en la nube, es lo único que toca sus datos. Ambos se comunican por TLS mutuo con contexto de traza distribuida propagado en la unión.
- Navegador por WebSocket → interfaz de sesión
- SSO · SAML 2.0 · OIDC → gestor del ciclo de vida de sesión
-
INGRESS → GOVERNANCE → ROUTER → SUPERVISOR → EGRESS Tokenización, análisis de inyección, puerta previa a la ejecución El enrutador clasifica cada turno como NEW_TASK, CONTINUATION, META_OPERATION o AMBIGUOUS antes de ejecutar nada más.
-
FÁBRICA DE AGENTES Intersección de herramientas en tres vías platform ∩ tenant ∩ RBAC — emitida como manifiesto de sesión firmado
-
MOTOR RAZONAR → ACTUAR → OBSERVAR Tres capas de validación previa y una puerta humana en cada escritura
-
EVALUADOR DE REFLEXIÓN Puerta de calidad, volcado de medición y confirmación de memoria en dos fases
- Pasarela LLM — enrutamiento, conmutación por error, claves virtuales y limitación de tasa
- Sumidero de trazas — auditoría de caja transparente con OpenTelemetry
- EgressFilterSpec — reglas eBPF y un sumidero DNS
- Sidecar de PII — analiza toda la salida estándar antes de que salga
- Sistemas conectados por OAuth 2.0 — almacenes, lakehouses, CRM, ticketing y ERP; cada uno se añade con un manifiesto YAML, no con un cambio de código
Un objetivo nuevo, así que el catálogo se recompila desde cero: plataforma ∩ inquilino ∩ su rol, firmado para este turno. No se hereda nada del intercambio anterior.
Un refinamiento de la respuesta anterior. El manifiesto se reutiliza y las citas del turno previo siguen siendo resolubles, de modo que «eso» todavía apunta a un conjunto de resultados que el backend puede nombrar.
Una pregunta sobre la sesión, no sobre los datos. Se responde desde el propio manifiesto firmado: no se llama a ninguna herramienta, no se toca ningún almacén y la respuesta no puede exceder lo que el manifiesto ya declara.
«Esos» no tiene un referente que el backend pueda resolver, y la acción es una escritura. Un enrutador sin este estado elegiría el antecedente más probable y continuaría. Este se detiene y devuelve una pregunta:
«¿Se refiere a las 12 oportunidades de la respuesta anterior o a las 47 del embudo? No voy a adivinar en una escritura.»Enrutamiento contextual
"Ahora desglósalo por región" no es una pregunta nueva.
La mayoría de los marcos agénticos reconstruye toda la tubería en cada turno, por eso las preguntas de seguimiento son lentas, costosas y pierden el hilo. Un enrutador semántico está diseñado para clasificar cada turno en menos de 100 milisegundos, eligiendo una de cuatro rutas antes de ejecutar nada.
NEW_TASK
Compilación completa
Una solicitud no relacionada. La fábrica compila una especificación nueva contra la intersección de permisos de plataforma, inquilino y rol.
CONTINUATION
Bypass en caché
Un refinamiento de la respuesta anterior. Se reutiliza la especificación en caché, sujeta a un TTL y un hash de permisos, así el seguimiento es casi instantáneo.
META_OPERATION
Sin tubería
"Expórtalo a diapositivas." Una solicitud sobre la salida, no sobre los datos. Nunca llega al motor de razonamiento y no cuesta inferencia.
AMBIGUOUS
Preguntar, no adivinar
La intención no está clara. En vez de gastar una tubería en una suposición, el agente muestra una tarjeta de aclaración y espera al humano.
La memoria de trabajo persiste entre turnos bajo un commit en dos fases: un borrador se acumula durante el turno y se promueve solo si el turno termina bien. Un turno fallido no deja estado parcial, así la siguiente pregunta parte de un contexto coherente y no de uno a medio escribir.
Exploración de datos
No puede pegar 50.000 tablas en un prompt.
Toda demostración funciona con un esquema de doce tablas. Los catálogos empresariales reales tienen decenas de miles, y el enfoque estándar — volcar el esquema al contexto y dar al modelo una sola herramienta de consulta — colapsa de inmediato en costo, latencia y precisión.
Por eso el agente explora en lugar de ingerir. La recuperación destaca las pocas tablas relevantes. Luego un conjunto de herramientas de sondeo previsualiza, cuenta, agrega y busca texto como lo haría un analista competente antes de comprometerse a una consulta costosa.
El patrón de puntero
Cuando un conjunto de resultados supera el umbral, el conector lo materializa en almacenamiento de objetos y devuelve una URL prefirmada. El modelo recibe una referencia y un resumen — nunca las filas crudas. El costo queda acotado sin importar el tamaño de la respuesta, y la carga sensible nunca entra en una ventana de contexto.
catalog: 50,000+ tables · 0 injected into context
1 discover_schema("revenue by account, Q3")
→ 7 candidate tables, ranked
2 preview_table("fct_opportunity", n=5)
→ 22 columns, 3 date grains found
3 count_rows("fct_opportunity", filter=Q3)
→ 1,284,905
4 text_search("stage", distinct)
→ 9 stage values, 2 deprecated
5 aggregate(group=account, metric=arr)
→ 84,112 rows > threshold
→ materialized to object store
→ pre-signed pointer returned
rows seen by the model: 0
Procedencia
El modelo no escribe sus propias citas.
Pedirle a un modelo de lenguaje que cite sus fuentes es pedirle a lo que alucina que certifique que no lo hizo. Las citas se generan de forma determinista en el backend desde el registro real de llamadas y se reconcilian con la narrativa. Los marcadores que el modelo inventa se eliminan antes de renderizar.
FAILURE MODE 01
Sobrecarga de prompt
Los esquemas ingenuos meten la carga completa en el prompt para que el modelo la referencie. El nuestro nunca lo hace — el backend ya tiene el mapeo.
FAILURE MODE 02
Marcadores inventados
Un modelo que aprendió que las citas parecen autorizadas las producirá sin que se lo pidan. Todo marcador sin registro de llamada correspondiente se elimina.
FAILURE MODE 03
Amnesia entre turnos
Las citas que se reinician en cada mensaje hacen inauditable un análisis multi-turno. En su lugar, la bibliografía se acumula durante la sesión.
FAILURE MODE 04
Inyección de enlaces
Una cita que se muestra como enlace es un canal de salida si la URL la controla un atacante. Los destinos se validan contra una lista permitida antes de renderizar.
Integración
Un sistema nuevo es un archivo YAML, no un lanzamiento.
Conectar un almacén de datos, un sistema de tickets o un ERP no debería requerir un sprint. Los conectores se declaran como manifiestos: la capa descubre el esquema en tiempo de ejecución y lo inyecta justo a tiempo, así que agregar un sistema es un commit de configuración revisado como cualquier otro cambio.
Seis capas de endurecimiento están debajo, cada una cerrando un ataque específico contra agentes que usan herramientas.
Supresión de herramientas suplantadas, con fallo cerrado. Un servidor malicioso no puede registrar una herramienta que suplante a una confiable. Las colisiones de nombre se resuelven denegando, nunca adivinando.
Defensa contra inyección en descripciones. Las descripciones de herramientas son entrada no confiable. Las instrucciones escondidas en la descripción de una herramienta no pueden redirigir al agente.
Guardas de reintento conscientes de idempotencia. Una falla transitoria en una escritura no idempotente no se convierte en silencio en una transacción duplicada al reintentar.
Inyección de esquema justo a tiempo. Los esquemas entran al contexto solo cuando la herramienta va a usarse, evitando que un catálogo grande consuma la ventana.
Validación de consultas por AST. Las consultas generadas se analizan en un árbol sintáctico y se verifican estructuralmente, así el anidamiento de subconsultas no burla una regla que solo lee cadenas.
Aprobaciones ancladas al esquema. Una aprobación humana se vincula al esquema y plan exactos con los que se otorgó, así no puede reutilizarse tras un cambio de definición.
Qué incluye la plataforma
No es una hoja de ruta. Están construidas, probadas y en ejecución.
| Capa | Capacidad |
|---|---|
| Identidad | Ingreso SAML 2.0 y OIDC (Azure AD, Okta, personalizado), con almacenamiento de tokens respaldado por gestión de claves. |
| Autorización | Intersección triple de herramientas — capacidad de plataforma, derecho del inquilino y rol del usuario — compilada en un manifiesto de sesión firmado por turno. |
| Privacidad | Tokenización contextual antes de transmitir con reinyección tras la respuesta, gobernada por una política declarativa por inquilino: listas de categorías, patrones de identificadores propios, listas de exclusión seguras y reglas de contexto omitido. |
| Defensa | Escaneo de inyección de prompts a velocidad de línea en el ingreso, más una puerta de pre-ejecución de tres capas que valida cada llamada propuesta antes de despacharla. |
| Observabilidad | Trazado OpenTelemetry de extremo a extremo con contexto W3C propagado a través de la frontera control/ejecución, con registro transparente de cada acción del agente. |
| Control humano | Aprobar / rechazar / escalar en cada escritura, con vista previa de impacto y un token de concurrencia optimista que bloquea la repetición contra un plan modificado. |
| Despliegue | Docker, Kubernetes y Helm para on-premises o BYOC, un binario de escritorio firmado, o nube gestionada — el mismo código en cada topología. |
| Comercial | Facturación medida por resultados vía AWS y Azure Marketplace con guardas de idempotencia, para que compras transaccione con un compromiso de nube existente. |
FAQ
Lo que preguntan los arquitectos de seguridad.
En MicroVMs a nivel de hardware dentro de su VPC — nunca en un host compartido. Cada sandbox usa un hipervisor a nivel de hardware para aislamiento de hipervisor, lleva un filtro de salida eBPF y un sumidero DNS que restringen el tráfico a su lista permitida, y ejecuta un sidecar que escanea toda la salida en busca de datos personales antes de que salga.
Defensa en cuatro capas, porque ninguna basta por sí sola. Escaneo de inyección a velocidad de línea en el ingreso; las descripciones de herramientas se tratan como entrada no confiable para que las instrucciones ocultas no redirijan el comportamiento; una puerta de pre-ejecución de tres capas valida cada llamada antes de despacharla; y el filtro de salida implica que incluso un agente comprometido no tiene a dónde enviar nada.
Un manifiesto YAML, no un cambio de código. La capa de conectores descubre el esquema en tiempo de ejecución y lo inyecta justo a tiempo, así que un almacén, sistema de tickets o ERP nuevo es un commit de configuración que pasa por su revisión de cambios habitual. Las seis capas de endurecimiento aplican automáticamente.
La cadena causal completa, no un resumen. Cada acción se traza de extremo a extremo con contexto W3C propagado entre los planos de control y ejecución, así un auditor puede reconstruir qué turno disparó qué llamada, qué devolvió, quién aprobó la escritura resultante y contra qué token de versión. Las citas de la narrativa resuelven a esos mismos registros.
Sí — Kubernetes y Helm, Docker Compose, o un binario de escritorio firmado. Es el mismo código en cada topología, así que elegir on-premises no lo deja en una rama rezagada. La inferencia se enruta por el gateway que su organización ya aprobó, no por una ruta que impongamos.
Traiga a su arquitecto de seguridad a la primera llamada.
La mayoría de los proveedores quiere hablar con el patrocinador de negocio y postergar la conversación de seguridad. Preferimos tenerla primero, porque la topología de despliegue es la decisión de producto. Traiga el cuestionario.
Escrito sobre esto
La ingeniería detrás, en detalle
Guía
Desplegar un Agente Contra Databricks Unity Catalog
La inyección de esquema colapsa pasadas unos cientos de tablas. Un conjunto reducido de herramientas de sondeo, descubrimiento por recuperación, un patrón de puntero para resultados masivos — y los tres modos de fallo que solo aparecen con un catálogo real detrás.
Comparativa
LangChain y LangGraph en un Despliegue Empresarial
Una biblioteca de orquestación no es alternativa a un sistema gobernado: es un componente dentro de uno. Doce decisiones que la biblioteca le deja, y cuándo asumirlas es lo correcto.
Comparativa
Microsoft 365 Copilot y el Trabajo que No Hace
Un asistente y un sustrato de ejecución gobernado no compiten por la misma línea de presupuesto. La frontera está donde una acción deja de ser reversible — y heredar permisos no es lo mismo que intersectarlos.
Comparativa
Construirlo en Casa: Lo que el Estimado Omite
Muchas organizaciones deberían construirlo, y las que no son identificables por una propiedad del trabajo. La demostración es la primera quinta parte; el sustrato es el resto, y no se adapta a un prototipo que ya funciona.
Comparativa
CrewAI y AutoGen Frente a Restricciones Empresariales
Los marcos de coordinación resuelven bien la delegación. La delegación es también cómo una instrucción inyectada escala privilegios, y el número de agentes es un costo de diseño, no una capacidad.
Desglose
Desglose: La Puerta de Escritura Previa a la Ejecución
Una política que el modelo no puede leer, un catálogo de herramientas compilado por turno y un diff de radio de impacto anclado a un token de versión. Tres verificaciones en la ruta de ejecución, y el techo de rendimiento que compran.
Desglose
Desglose: Procedencia Determinista de Citas
El modelo escribe la respuesta; el backend decide a qué puede apuntar. Un crítico de fundamentación, resolución de marcadores contra el registro de ejecución, y por qué renderizar una cita es una frontera de seguridad.
Arquitectura
Aprobación Humana Que Realmente Resiste: Puertas de Escritura, Radio de Impacto y Protección Contra Repetición
La mayoría de las aprobaciones humanas son un diálogo de confirmación. Tres propiedades separan una puerta de aprobación real de una casilla que fabrica consentimiento.
Ingeniería
Cómo un Agente Consulta un Almacén de 50.000 Tablas Sin Leer el Esquema
Toda demostración funciona con doce tablas. Los catálogos reales tienen decenas de miles, y el enfoque estándar colapsa en costo, latencia y precisión a la vez.
Estrategia
Construir, Comprar o Ensamblar: Cómo Adquirir Capacidad de IA Empresarial
El marco construir-o-comprar oculta la opción que la mayoría de las empresas realmente necesita, y las tres restricciones que la deciden no tienen que ver con capacidad de ingeniería.