Boris Cherny, Creator & Head of Claude Code chez Anthropic, publie un tableau-framework — « Steps of AI Adoption » — né d'un constat répété : dans beaucoup d'entreprises, une personne décuple son output avec Claude, mais le reste de l'organisation ne suit pas. Il en tire une échelle de maturité en 5 étapes (0→4), dont l'axe structurant est l'ordre de grandeur d'agents qu'un ingénieur pilote — et la transformation de rôle que cela impose.

0 — Gated (0 agent) : accès verrouillé, modèles anciens, pas de gouvernance MCP ni d'infra pour héberger le code de Claude ; goulet = sécurité/approbations legacy et obsession du cost-per-token. 1 — Assisted (~1) : « vous + un agent », pair programming supervisé, travail synchrone ; goulet = votre attention, car sans auto-vérification vous relisez tout. 2 — Parallel (~10) : vous devenez orchestrateur de 5–10 agents sur worktrees séparés ; Claude s'auto-vérifie (tests/build/lint/security), Auto mode et revues automatiques par défaut ; goulet = la relecture de flux multiples. 3 — Supervised autonomy (~100) : manager de managers, Claude écrit presque tout, la maintenance tourne en fond ; goulet = la confiance dans la boucle et le débit décisionnel. 4 — AI-native (~1 000+) : VP qui pilote par l'intention, boucle fermée où Claude lance la plupart des agents, supervision par exception.

aurait-on de toute façon dépensé de l'effort d'ingénierie là-dessus ? si oui, combien d'heures-ingénieur manuelles cela aurait-il coûté ?

Boris Cherny , linkedin.com

Thèse centrale : les tokens ne font pas monter d'un cran. Chaque palier a un goulet propre ; on progresse en le cassant et en bâtissant le prochain jeu de garde-fous qui rend l'output digne de confiance. Les leviers nommés : boucle d'auto-vérification (tests + build + lint + e2e sur un vrai environnement), Auto mode contre les prompts bloquants, code review + security review par défaut, interfaces multi-agents (Agent view, Desktop, mobile, Tag), puis /loop, /batch, /goal, dynamic workflows, worktree isolation, CLAUDE.md + Skills pour encoder les standards, et enfin le Claude Agent SDK pour programmer/planifier des flottes d'agents.

Sur le pilotage, Cherny écarte la métrique de vanité : l'usage mesure l'activité, pas le retour. La bonne question — aurait-on dépensé cet effort de toute façon, et combien d'heures-ingénieur manuelles ? — donne le vrai ROI. Le gain décisif survient quand corriger et maintenir passent en arrière-plan, libérant les équipes pour construire ce qui n'était pas atteignable avant. Repère honnête : Anthropic est à l'étape 3 et pousse vers 4 ; lui-même vient d'atteindre le niveau 4.