Publicado el 3 de junio de 2026 en el blog de Anthropic, este informe del equipo de Data Science & Data Engineering (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry) describe cómo Anthropic hizo que su analítica fuera self-service con Claude: 95% de las consultas de negocio automatizadas, ~95% de precisión en conjunto (hasta ~99% en ciertos dominios).

El punto de partida es que la analítica no es código: "a menudo solo hay una única respuesta correcta usando una única fuente correcta". El reto no es la creatividad generativa sino la capacidad de asociar una pregunta con entidades precisas y actualizadas en el modelo de datos. Tres modos de fallo amenazan esto: ambigüedad concepto↔entidad (¿qué cuenta como "usuarios activos"? ¿se excluye a los fraudulentos? ¿qué ventana?), obsolescencia (staleness) de los activos y del conocimiento del agente, y fallo de recuperación — el 80% de las consultas fallidas tenían igualmente la información presente en el corpus. El peor caso es el fallo silencioso: una respuesta incorrecta pero plausible, usada sin objeción.

La respuesta es una "pila de analítica agéntica" de cuatro capas. (1) Fundamentos de datos: modelado dimensional, conjuntos de datos canónicos "fuente única de verdad", metadatos tratados "como producto de primera clase", integridad vía CI/CD. (2) Fuentes de verdad en orden decreciente de confianza: una semantic layer que el agente está "estructuralmente obligado (por instrucción de la skill) a recurrir primero", después el linaje, un corpus de consultas destilado en documentos (no recuperación en bruto), y un grafo de conocimiento de negocio (hojas de ruta, registros de decisiones, organización). (3) Skills — la palanca decisiva: "sin skills … no superaba el 21% … Añadir skills lleva estas cifras de forma consistente por encima del 95%". Se organizan en pares: una Knowledge skill enrutadora (~30 archivos de referencia) y una Unbook skill que codifica el flujo de trabajo del analista senior (aclarar, buscar fuentes, ejecutar, revisión adversarial). El mantenimiento está colocalizado: un hook de revisión señala cualquier cambio de modelo sin el cambio de skill correspondiente — ~90% de las PR de datos ahora incluyen una skill en el mismo diff. (4) Validación: evaluaciones offline con umbral (~90% para autorizar un agente), pruebas de ablación, y salvaguardas online (revisión adversarial: +6% de precisión pero +32% de tokens y +72% de latencia; pies de página de procedencia; recolección de correcciones por agentes programados).

Dos resultados negativos dan forma a la doctrina: dar acceso mediante grep en bruto a miles de archivos SQL mueve la precisión "menos de un punto" (el cuello de botella es la estructura, no el acceso), y dejar que el LLM defina las métricas fue "netamente negativo" — de ahí la regla: documentación generada, definiciones propiedad de los humanos. Para empezar: un puñado de conjuntos de datos canónicos, unas pocas docenas de evaluaciones, una thin knowledge skill.