Aller au contenu

root / tags / compare-the-market

#Compare the Market

2 fiches

Qualité & Sécurité

Code review dans le SDLC augmenté : l'anneau de contraintes autour des agents

Épisode « Phase 5 · Review » de la série SFEIR sur le SDLC augmenté, publié **le jour même** du post LinkedIn d'Addy Osmani qu'il traduit en spécification de phase. Thèse : **la qualité a changé d'adresse** — elle ne se lit plus dans le code (les agents en produisent plus que personne ne peut relire) mais dans **l'anneau de contraintes qui entoure l'agent**. L'anneau d'Osmani (sept dimensions — correction, sécurité, performance, accessibilité, maintenabilité, **efficience économique**, **compréhensibilité** — reliées par la règle de **back-pressure** : « on ne confie à une boucle que l'autonomie qu'on sait vérifier à faible coût et de façon fiable, pas un pouce de plus ») est redessiné, traduit et rattaché à la phase 5 du cycle SFEIR à 11 phases. Le corollaire structurant : **le goulot n'a jamais été la génération, c'est la vérification** — « la génération est une bouche large, la vérification un col étroit ; accélérer la bouche épaissit le tas au col ». **La décision de conception la plus intéressante est un choix d'architecture de cycle** : Review est délibérément **hors des trois gates humains** (Define, Plan, Ship), parce que faire porter le gate à Review reviendrait à mettre l'attention humaine — ressource finie — en point de contrôle d'une capacité de génération qui, elle, scale : « vous auriez bâti un pipeline dont le débit maximal est le nombre de diffs qu'un senior peut lire avant la fin de la journée ». D'où le partage : **Review instrumente, Ship décide** — Review livre un *faisceau de preuves opposable*, Ship décide sur les preuves, pas sur le diff intégral. Position située face à Monperrus (dont SFEIR retient le diagnostic — l'inspection humaine de chaque diff ne résiste pas à la vitesse agentique — mais refuse la conclusion : l'acceptation ne se délègue pas). Le piège nommé est **la validation circulaire** (l'agent qui écrit le code écrit les tests qui le valident : « vous avez construit un miroir, pas un anneau »), avec cinq contre-mesures reprises d'Anthropic (gates indépendants en fenêtres de contexte séparées, déterministe + agentique jamais l'un à la place de l'autre, mode ombre, tiering par risque, journalisation vers le SIEM) et l'avertissement de Compare the Market (**graphe AST ~70 % vs RAG vectoriel ~58 %**, le RAG faisant *pire que pas de contexte du tout*). Le prolongement propre au cabinet est **le cliquet** : « toute échappée devient une contrainte » — un défaut qui a franchi l'anneau se referme *dans l'anneau* (test, règle de lint, rubrique, garde-fou de harnais) au Compound-1, « le seul actif de la chaîne qui s'apprécie pendant que les modèles se déprécient » (mesure interne non auditable : **− 30 % d'itérations de correction après dix cycles**). Clôture par la reformulation de la question : « ce code est-il bon ? » est devenu insoluble ; reste **« qu'est-ce que mon système refuse de laisser passer ? »**

#anneau de contraintes#constraints around agents#phase Review

SFEIR (voix éditoriale du cabinet, article non signé individuellement) — construit sur Addy Osmani (Google) ; cite Martin Monperrus · Paula Hingel (Augment Code) · DORA/Google Cloud · Jason Clinton (Anthropic) · l'équipe Engineering de Compare the Market

Qualité & Sécurité

Comparing Context Retrieval Approaches for AI Code Review

Étude empirique de l'équipe engineering **Compare the Market** (Meerkat Careers, UK) qui évalue quatre approches de **récupération de contexte pour la revue de code par IA** : Baseline (pas de contexte additionnel), **RAG** (recherche vectorielle), **GKG** (GitLab Knowledge Graph, graphe de connaissances AST) et **GKG+RAG** (hybride). Évaluation sur **79 merge requests** réelles avec **MLflow sur Databricks**. Résultat-choc : **RAG performe pire que le baseline** sur presque toutes les métriques — le bruit vectoriel est contre-productif pour la revue de code. **GKG surpasse RAG de +21 %** en couverture des commentaires inline (0,696 vs 0,577) grâce à la compréhension structurelle AST (Tree-sitter + base de graphe Kuzu). Le code exige une compréhension **structurelle** (appelants, signatures, hiérarchies), pas une simple similarité sémantique. GKG coûte 4× le baseline mais délivre des améliorations mesurables ; RAG coûte 3× sans amélioration. Implémentation en **sidecar Docker** CI/CD wrappant le binaire GKG (encore en bêta GitLab) avec serveur MCP local.

#Compare the Market#Meerkat Careers#revue de code IA

Équipe Engineering Compare the Market (Meerkat Careers, UK — site de comparaison d'assurances et services financiers).