Saltar al contenido

root / tags / compare-the-market

#Compare the Market

2 fiches

Calidad y Seguridad Traducción verificada automáticamente

Code review dans le SDLC augmenté : l'anneau de contraintes autour des agents

Episodio «Fase 5 · Review» de la serie de SFEIR sobre el SDLC aumentado, publicado **el mismo día** que la publicación de Addy Osmani en LinkedIn que traduce en una especificación de fase. Tesis: **la calidad ha cambiado de dirección** — ya no se lee en el código (los agentes producen más código del que nadie puede revisar) sino en **el anillo de restricciones que rodea al agente**. El anillo de Osmani (siete dimensiones — corrección, seguridad, rendimiento, accesibilidad, mantenibilidad, **eficiencia económica**, **comprensibilidad** — enlazadas por la regla de **back-pressure**: «un bucle solo recibe la autonomía que puede verificarse de forma barata y fiable, ni un ápice más») se redibuja, se traduce y se adjunta a la fase 5 del ciclo de 11 fases de SFEIR. El corolario estructurante: **el cuello de botella nunca ha sido la generación, es la verificación** — «la generación es una boca ancha, la verificación un cuello estrecho; acelerar la boca engrosa la pila en el cuello». **La decisión de diseño más interesante es una elección de arquitectura del ciclo**: Review queda deliberadamente **fuera de las tres puertas humanas** (Define, Plan, Ship), porque convertir Review en la puerta pondría la atención humana — un recurso finito — como el punto de control de una capacidad de generación que a su vez escala: «habrías construido un pipeline cuyo rendimiento máximo es el número de diffs que un senior puede leer antes de que acabe el día». De ahí la separación: **Review instrumenta, Ship decide** — Review entrega un *cuerpo de evidencia oponible*, Ship decide sobre la evidencia, no sobre el diff completo. Una postura enfrentada a Monperrus (de quien SFEIR conserva el diagnóstico — la inspección humana de cada diff no puede resistir la velocidad agéntica — pero rechaza la conclusión: la aceptación no puede delegarse). La trampa señalada es la **validación circular** (el agente que escribe el código escribe los tests que lo validan: «has construido un espejo, no un anillo»), con cinco contramedidas extraídas de Anthropic (puertas independientes en ventanas de contexto separadas, determinista + agéntico que nunca se sustituyen entre sí, modo sombra, categorización por riesgo, registro en el SIEM) y la advertencia de Compare the Market (**grafo AST ~70% frente a RAG vectorial ~58%**, con el RAG rindiendo *peor que sin contexto alguno*). La extensión propia de la firma es **el trinquete**: «cada fuga se convierte en una restricción» — un defecto que ha cruzado el anillo se cierra *dentro del anillo* (test, regla de lint, rúbrica de revisión, guardrail del harness) en Compound-1, «el único activo de la cadena que se revaloriza mientras los modelos se deprecian» (una medición interna no auditada: **−30% de iteraciones de corrección tras diez ciclos**). Cierra reformulando la pregunta: «¿es bueno este código?» se ha vuelto una pregunta sin respuesta; lo que queda es **«¿qué se niega a dejar pasar mi sistema?»**

#anillo de restricciones#restricciones alrededor de los agentes#fase Review

SFEIR (voix éditoriale du cabinet, article non signé individuellement) — construit sur Addy Osmani (Google) ; cite Martin Monperrus · Paula Hingel (Augment Code) · DORA/Google Cloud · Jason Clinton (Anthropic) · l'équipe Engineering de Compare the Market

Calidad y Seguridad Traducción verificada automáticamente

Comparing Context Retrieval Approaches for AI Code Review

Estudio empírico del equipo de ingeniería de **Compare the Market** (Meerkat Careers, Reino Unido) que evalúa cuatro enfoques para la **recuperación de contexto en revisión de código con IA**: Baseline (sin contexto adicional), **RAG** (búsqueda vectorial), **GKG** (GitLab Knowledge Graph, grafo de conocimiento basado en AST) y **GKG+RAG** (híbrido). Evaluación sobre **79 merge requests reales** con **MLflow en Databricks**. Resultado llamativo: **RAG rinde peor que el baseline** en casi todas las métricas — el ruido vectorial resulta contraproducente para la revisión de código. **GKG supera a RAG en un +21%** en cobertura de comentarios en línea (0,696 frente a 0,577) gracias a la comprensión estructural mediante AST (Tree-sitter + base de datos de grafos Kuzu). El código requiere comprensión **estructural** (llamadores, firmas, jerarquías), no una mera similitud semántica. GKG cuesta 4 veces el baseline pero aporta mejoras medibles; RAG cuesta 3 veces sin mejora alguna. Implementado como **sidecar Docker** en CI/CD que envuelve el binario de GKG (aún en beta en GitLab) con un servidor MCP local.

#Compare the Market#Meerkat Careers#revisión de código con IA

Équipe Engineering Compare the Market (Meerkat Careers, UK — site de comparaison d'assurances et services financiers).