Aller au contenu

root / tags / multi-agents

#multi-agents

4 fiches

Efficient Tokens & Effective Teams in Buzz

Billet de benchmarks **Block Engineering** du **6 août 2026**, signé **Atish Patel**, portant sur **Buzz** — le workspace humains + agents lancé le 21 juillet — et posant une question de coût : quelle est l'équipe d'agents **la moins chère qui réussit de façon fiable** ? Trois résultats. **(A) Un résultat négatif, publié en entier** : sur **Terminal-Bench 2.1**, **douze compositions d'équipe** (paires, triades, essaims bon marché sous un modèle *frontier*) ont été opposées à l'agent solo autour duquel chacune était construite, et **aucune ne l'a devancé à prix équivalent**. L'explication est structurelle — une tâche qui finit en minutes *« n'a pas assez de structure pour être divisée »*, et *« More agents mostly buys you the cost of explaining it twice »*. **(B) L'horizon retourne le résultat** : sur **Long-Horizon Terminal-Bench** (44 tâches, une tâche valant des heures de travail, même chef **GPT-5.6 Sol** en effort *high*), le solo termine 15 tâches pour 59,1 %, +2 QuickBees 19 pour 64,1 %, +1 QuickBee +1 WorkerBee 19 pour 69,5 %, **+2 WorkerBees 20 pour 71,5 %** — soit **+12,4 points**, dont 11,4 proviennent des tâches menées à leur terme. *« Same seats, opposite result, because the work is a different shape. »* Ces runs ont été conduits à **3× le timeout**, solo compris. **(C) Le prix cesse d'acheter de la qualité au-delà d'un seuil** : en solo sur Terminal-Bench 2.1, **Opus 5 en effort *xhigh* est le run le plus cher (140,63 $) pour 75,0 %**, derrière six runs allant de 20,08 $ à 109,82 $ et de 79,5 % à 88,4 % — cause déclarée, un sur-raisonnement ayant conduit 17 des 88 tâches au timeout. Entre les six meilleurs runs, **5,5× d'écart de prix pour 8,9 points d'écart de score** : *« choosing between them is not a quality decision at all. It is a budget decision. »* Le billet propose une taxonomie assumée comme *ad hoc* — **QuickBee**, **WorkerBee**, **SmartBee**, plus l'humain *« honorary bee »* — et deux formes d'équipe, la **Hive** permanente qui mémorise vos préférences et le **Swarm** jetable qui mémorise le projet. Conditions : tout tourne sur **Harbor**, contre de vrais agents Buzz sur un relais **live**, **une tentative par tâche, sans retry**, prix arrêtés au **2026-07-30**.

#Buzz#Block#équipes d'agents

- **Atish Patel** — *« Building AI solutions @ Block »* · auteur unique du billet · publié le **6 août 2026** sur `engineering.block.xyz`.

Architecture & Construction

The End of Code Review: Coding Agents Supersede Human Inspection

Papier arXiv (cs.SE) de Martin Monperrus défendant une thèse radicale pour le SDLC : les agents de codage ont franchi un seuil de capacité tel que **la revue de code humaine n'est plus un composant nécessaire** d'un pipeline qualité. Deux affirmations : (1) des systèmes autonomes à base de LLM atteignent tous les objectifs de la revue (détection de défauts, qualité, conformité) à coût moindre et débit supérieur ; (2) le modèle hybride « l'agent écrit, l'humain relit » est intenable — il n'assure pas une vraie qualité et ne passe pas à l'échelle de la vélocité IA, créant une « fausse sécurité ». Monperrus oppose à l'inspection de Fagan (1976) un **pipeline de vérification adversariale multi-agents** (agent générateur + agents reviewers indépendants + tests/méthodes formelles + consensus par vote). L'humain se recentre sur la spec, les arbitrages d'architecture, l'approbation des domaines critiques et les cas limites. Recommandations : piloter d'abord sur composants à faible risque, mesurer agent vs humain, expliciter les décisions de rejet.

#revue de code#code review#inspection de Fagan

Martin Monperrus