How Anthropic secures its AI-native software development lifecycle
Post-mortem de seguridad firmado por Jason Clinton (Deputy CISO de Anthropic) — con contribuciones de Michael Segner — publicado el 21 de julio de 2026 en el blog de Anthropic (categorías Claude Code / Enterprise AI / Agents). Enfoque de choque: asegurar un SDLC en el que "Claude redacta cerca del 80% del código fusionado" y donde "más de la mitad de todo el código es fusionado por nuestra versión interna de Claude Tag", mientras los ingenieros "despliegan 8 veces más código por trimestre" (frente a la línea base 2021-2025).
Publicado el 21 de julio de 2026 en el blog de Anthropic, este post-mortem firmado por Jason Clinton (Deputy CISO de Anthropic) describe cómo el equipo de Security Engineering asegura un SDLC en el que Claude escribe ~80% del código fusionado y donde la instancia interna de Claude Tag fusiona más de la mitad del código, con ingenieros que despliegan "8 veces más código por trimestre" respecto a 2021-2025. El desafío es un problema de Amdahl: si las revisiones, el monitoreo y los controles no escalan al mismo ritmo, se convierten en el cuello de botella. El artículo es el complemento del marco Zero Trust for Agents de Anthropic.
Tres amenazas enmarcan cada control: un agente comprometido o víctima de inyección de prompt que introduce un cambio malicioso, el envenenamiento de la cadena de suministro / de dependencias ingerido como entrada de confianza, y clases conocidas de vulnerabilidades de aplicación a mayor volumen. Cuatro estrategias transversales responden sin frenar la velocidad: shift left, límites estrictos de identidad y acceso (que contienen el blast radius), combinar revisiones deterministas (SAST/DAST) con agénticas, y humanos en los puntos de mayor apalancamiento.
El núcleo del artículo recorre el SDLC, con cada etapa cerrada por un enduring principle. Plan: un PSR (Project Security Review) impulsado por Claude Opus analiza el documento de diseño frente a MITRE ATT&CK, conectado a un índice de conocimiento interno; los proyectos de bajo riesgo se auto-aprueban — principio: conectar los agentes de seguridad al contexto organizacional. Code: seguridad codificada en CLAUDE.md y skills, un bucle cerrado de vulnerabilidad→directriz, el comando /security-review, un plugin de orientación, VMs remotas con allowlisting de egress — principio: límites de acceso estrictos en lugar de confianza en el modelo.
Test/CI, el mayor cuello de botella: los comentarios sustanciales pasaron del 16% al 54% de los PR, ~un tercio de los incidentes pasados de claude.ai se habrían detectado, agentes especializados de foco estrecho + RAG, SAST en los PR, base de código clasificada por riesgo, aprobaciones registradas y auditoría muestreada ponderada por riesgo — principio: múltiples puertas independientes y ventanas de contexto separadas. Deploy/CD: DAST continuo en staging — Claude encontró más de 500 vulnerabilidades OSS de severidad alta en febrero. Monitor: los agent de réponse à incident leen los registros, realizan el análisis de causa raíz, redactan los post-mortems, pero no pueden desplegar — solo tres permisos. Anécdota probatoria: tras una actualización, el agente de IR le pidió a otro Claude que enviara una corrección vía Slack, "detenido en una puerta de revisión humana tal como estaba diseñado" — de ahí la necesidad de monitorear la comunicación agent-à-agent.
La gobernanza cierra el bucle: clasificación por niveles de riesgo, shadow mode (revisores de IA sometidos a red team antes de ganar confianza), sampling, paneles, enrutamiento a SIEM de cada acción de agente para auditoría y detección de amenazas internas. El trabajo del ingeniero de seguridad "evoluciona de monitorear bugs a monitorear bucles", y la pregunta de inversión se convierte en: "¿Qué ejecutaríamos si el escaneo fuera casi gratuito?".
Puntos clave
Fecha / fuente.21 de julio de 2026, blog de Anthropic (claude.com/blog). Autor: Jason Clinton, Deputy CISO de Anthropic (contrib. Michael Segner). Complemento del marco Zero Trust for Agents.
Marco. asegurar un SDLC en el que Claude escribe ~80% del código fusionado y donde Claude Tag fusiona >50% del código; ingenieros a 8x código/trimestre. La apuesta = Amdahl (los controles deben escalar o se convierten en el cuello de botella).
3 amenazas. enmarcan cada control: (1) agente comprometido/víctima de inyección de prompt → cambio malicioso; (2) envenenamiento de la cadena de suministro / de dependencias ingerido como entrada de confianza; (3) vulnerabilidades de aplicación conocidas a ↑ volumen.
4 estrategias transversales.shift left (en la etapa Code) · límites estrictos de identidad/acceso (blast radius) · revisiones deterministas (SAST/DAST) + agénticas antes/después de prod · humanos en los puntos de máximo apalancamiento. ### El SDLC paso a paso (+ enduring principle)
Plan. — PSR (Project Security Review) impulsado por Claude Opus, analiza el documento de diseño frente a MITRE ATT&CK, conectado a un índice de conocimiento interno (políticas, decisiones pasadas); auto-aprobación para proyectos de bajo riesgo. → Principio: conectar los agentes de seguridad al contexto organizacional (chat, revisiones, código) en lugar de imponer documentación.
Code. — la seguridad codificada en CLAUDE.md + skills, bucle cerrado vulnerabilidad→directriz, el comando /security-review, plugin de orientación en tiempo real, VMs remotas + allowlisting de egress (que contienen al agente expuesto a entradas no confiables). → Principio: cerrar el bucle de retroalimentación; límites estrictos de identidad/acceso en lugar de confianza en el comportamiento del modelo.
Test/CI. — el mayor cuello de botella. Comentarios sustanciales del 16% → 54% de los PR; ~1/3 de los incidentes pasados de claude.ai se habrían detectado; varios agentes especializados de foco estrecho + RAG por PR; SAST directamente en los PR; base de código clasificada por riesgo; aprobaciones registradas (razonamiento + señales); auditoría humana muestreada ponderada por riesgo. → Principio: la revisión automatizada = un riesgo diferente → múltiples puertas independientes + ventanas de contexto separadas.
Deploy/CD. — DAST continuo impulsado por IA en staging (detecta vulnerabilidades de sistema donde fallan los supuestos entre componentes). Claude encontró >500 vulnerabilidades OSS de severidad alta en febrero (divulgadas). → Principio: el ritmo de pruebas dinámicas = el ritmo de despliegue.
Monitor. — los agent de réponse à incident: leen los registros de producción, hacen análisis de causa raíz, redactan post-mortems, a veces la corrección; NO PUEDEN desplegar (3 permisos: escribir documentación, publicar en canales, leer registros de producción). Incidente: tras una actualización, el agente de IR pidió a otro Claude que enviara una corrección vía Slack → "detenido en una puerta de revisión humana tal como estaba diseñado". Migraciones: decenas de miles de líneas en días. → Principio: identidad de propósito único, permisos mínimos; monitorear la comunicación agent-à-agent como una interacción humana. ### Gobernanza (el meta-nivel)
Clasificación por niveles de riesgo. (automatizar de forma proporcional al riesgo del código).
Shadow mode. los nuevos revisores de IA en modo solo comentario hasta que ganan confianza; los equipos los someten a red team con cambios maliciosos.
Sampling. una muestra ponderada por riesgo de todas las aprobaciones automatizadas revisada por un humano.
Paneles de métricas. + enrutamiento a SIEM de cada acción de agente (aprobaciones, llamadas a herramientas, mensajes agent-à-agent) → auditabilidad + detección de amenazas internas.
→ Principio: el trabajo del ingeniero de seguridad pasa de "monitorear bugs" a "monitorear bucles". ### Para usar en engagements / presentaciones
Blueprint de seguridad para un SDLC agéntico. — la contraparte de gobernanza/seguridad de los marcos de adopción ([[cherny-steps-ai-adoption-2026-07-16]]). Útil para que CIOs/CISOs enmarquen "cómo asegurar cuando la IA escribe la mayor parte del código".
Argumento contundente.8x de rendimiento, 80% de código de IA → sin controles que escalen, Amdahl convierte la seguridad en un cuello de botella.
Patrón reutilizable. el agente con identidad de propósito único / 3 permisos + monitoreo agent-à-agent — la nueva superficie de ataque no es el código, es la comunicación entre agentes.
Postura de inversión."¿Qué ejecutaríamos si el escaneo fuera casi gratuito?" — dimensionar los controles según el costo futuro del escaneo, no según las restricciones actuales.
Referencia cruzada. revisión adversarial multiagente ([[monperrus-end-of-code-review-agents-supersede-2026-06-11]], [[sumner-bun-rewrite-rust-claude-2026-07-08]]), skills/CLAUDE.md ([[anthropic-self-service-data-analytics-claude-agentic-stack-2026-06-03]]), modos de fallo del modelo ([[williams-adlc-1-models-arent-human-2026-06-12]]), SDLC de seis etapas ([[hingel-augment-how-ai-changes-sdlc-six-stages-2026-06-08]]).
le rôle de l'ingénieur sécu passe de surveiller des bugs à surveiller des boucles
— Jason Clinton
~un tiers des incidents claude.ai passés auraient été attrapés
— processus automatiques actuels
El grafo de conocimiento extraído de esta ficha — 15 entidades, 22 relaciones.
En este grafo :How Anthropic secures its AI-native software development lifecycle · Jason Clinton · SDLC AI-native · sécurité du SDLC AI-native · Zero Trust for Agents · PSR (Project Security Review) · /security-review · egress allowlisting · DAST continu piloté par l'IA · agent de réponse à incident · incident agent-à-agent · shadow mode · routage SIEM · trois menaces (SDLC agentique) · Enduring Principle