Saltar al contenido
Solución 05 · Preparación de Datos

Un agente vale lo que puede encontrar y confiar.

La mayoría de los pilotos de IA decepcionantes se le achacan al modelo. El modelo rara vez es el problema. Los nombres de columna no son significado, un esquema deja de caber en un prompt pasadas unos cientos de tablas, y nadie quiere un sistema que lea datos personales que nunca se le autorizó ver. Esta es la capa que sostiene cada agente que desplegamos — y la parte del trabajo que sobrevive a cualquier framework de moda.

prepare · catalog scan

› fuente · almacén · 50.000+ tablas

  ✓ profile · grain and keys inferred, then confirmed

  ✓ semantic · 214 measures named in business terms

  ✓ scan · 31 sensitive spans tokenized

  ✓ lineage · every field traced to its source

  ✓ ready · retrieval index built, nothing left the perimeter

El fallo que nadie registra

Una respuesta incorrecta y una respuesta segura son idénticas.

Apunte un modelo capaz a un almacén crudo y responderá. Unirá por una clave plausible, elegirá un grano que nadie acordó, excluirá en silencio las filas que se filtraron tres transformaciones antes, y devolverá un número con dos decimales. Nada falla. Nada se registra. Alguien lleva ese número a una reunión.

El instinto es arreglarlo con un mejor modelo o un prompt más largo. Ninguno ataca la causa. Un modelo no puede inferir que ingresos significa neto de devoluciones aquí y bruto en la filial, que la tabla de clientes tiene dos filas por cliente desde la fusión de 2023, o que el equipo de finanzas dejó de confiar en una columna en marzo. Ese conocimiento vive en las personas y en el código de transformación. Hasta que se escriba donde el sistema pueda leerlo, cada respuesta es una conjetura bien formateada.

Este trabajo no es vistoso y es la diferencia entre un piloto y un sistema. También es lo primero que pregunta una revisión de seguridad, porque es donde los datos regulados se manejan bien o no se manejan.

Qué significa listo

Cuatro capas, cada una verificable por un revisor.

«Listo para IA» es una frase de marketing salvo que se descomponga en artefactos concretos. Estos son los cuatro que construimos, en el orden en que deben ocurrir.

01

Significado, no nombres de columna

Grano, claves, relaciones y la definición de negocio de cada medida, expresadas como una capa sobre la que el agente razona en lugar de adivinar. Donde una definición esté en disputa entre dos equipos, eso se registra como un hecho del negocio en lugar de resolverse en silencio a favor del que el modelo vio primero.

Qué es una capa semántica
02

Datos sensibles, tratados antes de la inferencia

Los valores personales y regulados se detectan y tokenizan antes de que ninguna llamada salga de su perímetro, y el mapeo que los revertiría nunca sale. La detección es determinista, no un juicio del modelo — pedirle a un modelo que redacte su propia entrada no es un control que un revisor acepte, porque el modo de fallo es invisible.

Ver el control que le corresponde
03

Descubrimiento más allá del límite del prompt

Inyectar el esquema en el prompt funciona hasta que deja de funcionar, y el precipicio llega antes de lo que se espera. Pasado ese punto, encontrar las siete tablas correctas entre cincuenta mil es en sí un problema de recuperación, resuelto con un conjunto reducido de herramientas de sondeo y un patrón de puntero, no comprando una ventana de contexto mayor.

Cómo funciona a escala
04

Linaje que sobrevive hasta la respuesta

Una cita solo vale si resuelve a la consulta exacta y al conjunto de resultados detrás, no al título de un documento. Cada fuente lleva además una expectativa explícita de frescura, para que una respuesta basada en una tabla que dejó de cargar el martes lo diga en lugar de envejecer en silencio hacia el error.

Ver el desglose de procedencia

Por qué separarlo

Esta es la parte que usted conserva.

Los frameworks y proveedores de modelos rotan en cuestión de meses. Un modelo semántico, una política de tokenización y unos contratos de linaje, no.

Lee sus fuentes donde están

Sin migración y sin una segunda copia que gobernar, asegurar y mantener actualizada. Un duplicado es un pasivo nuevo, no un cimiento.

Sobrevive a la capa de agentes sobre ella

Cambie el framework de orquestación, cambie de proveedor de modelos, pase de piloto a producción — la capa de preparación no se ve afectada, porque describe su negocio y no las abstracciones de un proveedor.

Es lo que hace revisable al resto

Dónde se detectan los datos regulados, qué puede alcanzar el agente y cómo una afirmación se remonta a una fila se deciden aquí. Una revisión de seguridad que obtiene una respuesta clara en esta capa deja de repetir la misma pregunta cinco veces más arriba.

Preguntado en cada arranque.

Porque los nombres de columna no son significado. Un modelo apuntado a un esquema crudo adivina el grano, une por la clave equivocada y responde en silencio una pregunta distinta a la formulada. Tampoco escala: pasadas unos cientos de tablas el esquema ya no cabe en un prompt, y pasados unos miles la recuperación se convierte en todo el problema.

Los datos sensibles se tokenizan antes de la llamada de inferencia, y el mapeo que los revertiría permanece dentro de su perímetro. El modelo ve un token donde había un nombre o un número de cuenta. La detección es un paso determinista, no un juicio del modelo, porque un modelo al que se le pide redactar su propia entrada falla de forma invisible.

No. La capa de preparación lee de su almacén, lago o aplicaciones existentes, donde ya están. Mover datos crearía una segunda copia que gobernar, asegurar y mantener fresca, que es lo contrario del objetivo.

Sí, y esa es la razón para hacerlo como capa propia. Un modelo semántico, una política de tokenización y contratos de linaje son activos que sobreviven a cualquier framework o proveedor de modelos vigente. Son la parte de un programa de IA que menos probablemente se tire en dieciocho meses.

Traiga la fuente que nadie quiere tocar.

Esa con la unión no documentada, la columna que dos equipos definen distinto y los datos personales que alguien no está seguro de si siguen ahí. Esa es la conversación útil, y es una forma más rápida de saber si esto vale la pena que cualquier demostración.