Vai al contenuto

root / tags / compare-the-market

#Compare the Market

2 fiches

Qualità e Sicurezza Traduzione verificata automaticamente

Code review dans le SDLC augmenté : l'anneau de contraintes autour des agents

Episodio "Fase 5 · Review" della serie SFEIR sul SDLC aumentato, pubblicato **lo stesso giorno** del post LinkedIn di Addy Osmani che traduce in una specifica di fase. Tesi: **la qualità ha cambiato indirizzo** — non si legge più nel codice (gli agenti ne producono più di quanto chiunque possa revisionare) ma nell'**anello di vincoli che circonda l'agente**. L'anello di Osmani (sette dimensioni — correttezza, sicurezza, prestazioni, accessibilità, manutenibilità, **efficienza economica**, **comprensibilità** — collegate dalla regola del **back-pressure**: "a un loop viene concessa solo l'autonomia che può essere verificata in modo economico e affidabile, non un millimetro di più") viene ridisegnato, tradotto e ancorato alla fase 5 del ciclo a 11 fasi di SFEIR. Il corollario strutturante: **il collo di bottiglia non è mai stato la generazione, è la verifica** — "la generazione è una bocca larga, la verifica un collo stretto; accelerare la bocca ispessisce l'accumulo al collo." **La decisione di design più interessante riguarda l'architettura del ciclo**: la Review è deliberatamente **fuori dai tre gate umani** (Define, Plan, Ship), perché fare della Review il gate metterebbe l'attenzione umana — una risorsa finita — come punto di controllo di una capacità di generazione che a sua volta scala: "si sarebbe costruita una pipeline il cui throughput massimo è il numero di diff che un senior può leggere prima della fine della giornata." Da qui la separazione: **la Review istruisce, lo Ship decide** — la Review fornisce un *corpo di prove opponibile*, lo Ship decide sulla base delle prove, non sull'intero diff. Una posizione presa contro Monperrus (di cui SFEIR conserva la diagnosi — l'ispezione umana di ogni diff non può reggere alla velocità agentica — ma respinge la conclusione: l'accettazione non può essere delegata). La trappola citata è la **validazione circolare** (l'agente che scrive il codice scrive i test che lo validano: "si è costruito uno specchio, non un anello"), con cinque contromisure tratte da Anthropic (gate indipendenti in finestre di contesto separate, deterministico e agentico che non si sostituiscono mai a vicenda, shadow mode, tiering basato sul rischio, logging verso il SIEM) e l'avvertimento di Compare the Market (**grafo AST ~70% contro RAG vettoriale ~58%**, con il RAG che si comporta *peggio di nessun contesto*). L'estensione propria dell'azienda è **il cricchetto**: "ogni fuga diventa un vincolo" — un difetto che ha attraversato l'anello viene chiuso *all'interno dell'anello* (test, regola di lint, rubrica di review, guardrail dell'harness) a Compound-1, "l'unico asset della catena che si apprezza mentre i modelli si deprezzano" (una misura interna non verificata: **−30% di iterazioni di fix dopo dieci cicli**). Si chiude riformulando la domanda: "questo codice è buono?" è diventata una domanda senza risposta; ciò che resta è **"che cosa il mio sistema si rifiuta di lasciar passare?"**

#anello di vincoli#vincoli attorno agli agenti#fase Review

SFEIR (voix éditoriale du cabinet, article non signé individuellement) — construit sur Addy Osmani (Google) ; cite Martin Monperrus · Paula Hingel (Augment Code) · DORA/Google Cloud · Jason Clinton (Anthropic) · l'équipe Engineering de Compare the Market

Qualità e Sicurezza Traduzione verificata automaticamente

Comparing Context Retrieval Approaches for AI Code Review

Studio empirico del team di ingegneria di **Compare the Market** (Meerkat Careers, UK) che valuta quattro approcci al **recupero di contesto per la revisione del codice con IA**: Baseline (nessun contesto aggiuntivo), **RAG** (ricerca vettoriale), **GKG** (GitLab Knowledge Graph, grafo di conoscenza basato su AST), e **GKG+RAG** (ibrido). Valutazione su **79 merge request reali** con **MLflow su Databricks**. Risultato sorprendente: **RAG ottiene risultati peggiori della baseline** su quasi tutte le metriche — il rumore vettoriale è controproducente per la revisione del codice. **GKG supera RAG del +21%** nella copertura dei commenti inline (0,696 contro 0,577) grazie alla comprensione strutturale dell'AST (Tree-sitter + database a grafo Kuzu). Il codice richiede una comprensione **strutturale** (chiamanti, firme, gerarchie), non una semplice similarità semantica. GKG costa 4 volte la baseline ma offre miglioramenti misurabili; RAG costa 3 volte senza alcun miglioramento. Implementato come **sidecar Docker** in CI/CD che avvolge il binario GKG (ancora in beta su GitLab) con un server MCP locale.

#Compare the Market#Meerkat Careers#revisione del codice con IA

Équipe Engineering Compare the Market (Meerkat Careers, UK — site de comparaison d'assurances et services financiers).