Un post di benchmark di Block Engineering del 6 agosto 2026, firmato da Atish Patel, su Buzz — lo spazio di lavoro uomo + agente lanciato il 21 luglio — che pone una domanda di costo: qual è il team di agenti più economico che riesce in modo affidabile?
Di - **Atish Patel** — *« Building AI solutions @ Block »*// Fonte engineering.block.xyz ↗/Lettura 2 min/.md// Traduzione verificata automaticamente
#Buzz#Block#team di agenti#composizione del team#multi-agente#orchestrazione#QuickBee#WorkerBee
Un post di benchmark di Block firmato da Atish Patel, pubblicato il 6 agosto 2026, che estende il lancio di Buzz: dal momento in cui assemblare un team di agenti è diventato banale, qual è il più economico che riesce in modo affidabile?
Prima il vocabolario. Il post propone quattro livelli: QuickBee (veloce ed economico — build, screenshot, test, triage di prima battuta: GPT-5.6 Luna, DeepSeek V4 Flash, modelli locali, eseguito a effort high), WorkerBee (versatile, porta avanti un intero sottoinsieme senza supervisione: GPT-5.6 Terra, Gemini 3.6 Flash, modelli open), SmartBee (visione d'insieme, trade-off, escalation: Claude Opus 5, Kimi K3, GPT-5.6 Sol, a effort medium), e l'essere umano, "l'ape più costosa del team, e la più lenta. Anche se resta la più intelligente". Due forme di team: l'Hive permanente, che ricorda le preferenze dell'utente, e lo Swarm usa e getta, che ricorda il progetto e poi scompare.
Il risultato in solo. Su Terminal-Bench 2.1, aumentare l'effort di un modello economico è il miglior investimento: Luna passa da 1,61 $ / 57,3% (medium) a 4,98 $ / 75,0% (high). All'estremo opposto, Opus 5 a effort xhigh è l'esecuzione più costosa (140,63 $) e ottiene solo il 75,0%, avendo raggiunto il timeout su 17 dei 88 compiti a causa di un eccesso di ragionamento. Tra le sei esecuzioni migliori: uno scarto di prezzo di 5,5×, uno scarto di punteggio di 8,9 punti. Conclusione: "scegliere tra loro non è affatto una decisione di qualità. È una decisione di budget."
Il risultato di team, in due atti. Su Terminal-Bench 2.1, sono state testate dodici composizioni e nessuna ha battuto il solo a parità di costo — un compito breve non ha abbastanza struttura da poter essere suddiviso. Su Long-Horizon Terminal-Bench (44 compiti pluriorari, modello guida GPT-5.6 Sol, 3× il timeout), il ribaltamento è netto: solo 15 compiti / 59,1%, +2 WorkerBee 20 / 71,5% — +12,4 punti, di cui 11,4 provengono da completamenti aggiuntivi. Il team costa di più per compito, il che si ripaga "quando l'alternativa è un essere umano che riprende un lavoro non finito".
La regola operativa. Instradare le escalation dei worker verso un coordinatore SmartBee piuttosto che verso l'essere umano: "ogni ambiguità diventa una notifica" è la vera modalità di guasto. Un ingegnere di Block afferma di aver migrato oltre 2.000 app con uno Swarm (coordinatore, 1-10 migratori, verificatore indipendente), con il coordinatore che memorizza le risposte umane.
Avvertenze: n=1 per compito, nessun intervallo di confidenza, costi del team non pubblicati, e un'ammissione — "questo potrebbe cambiare se i modelli venissero addestrati a una collaborazione migliore."
Punti chiave
Data / fonte.6 agosto 2026, engineering.block.xyz, firmato da Atish Patel. Misurazioni su Harbor, veri agenti Buzz su un relay live, un solo tentativo per compito, senza retry, prezzi al 30-07-2026.
Inquadramento chiave. la domanda posta non è "qual è il team migliore" ma "qual è il più economico che riesce in modo affidabile". Tutti i risultati derivano da questo. ### Risultato negativo sui compiti brevi Su Terminal-Bench 2.1, dodici composizioni — coppie, triadi, sciami economici sotto un modello guida frontier — sono state messe a confronto con l'agente solo attorno al quale ciascuna era costruita: nessuna l'ha battuto a parità di costo. La ragione indicata è strutturale: un compito che si conclude in pochi minuti non ha abbastanza struttura da poter essere suddiviso, e "Più agenti comprano soprattutto il costo di doverlo spiegare due volte." Regola che ne deriva: non assemblare un team per un lavoro breve e ben specificato. Contrappeso empirico al post di lancio [[longwell-block-buzz-workspace-agents-nostr-2026-07-21]]. ### L'orizzonte temporale ribalta il risultato Long-Horizon Terminal-Bench, 44 compiti, modello guida GPT-5.6 Sol a effort high per tutte le formazioni: | Formazione | Compiti completati /44 | Punteggio | |---|---|---| | SmartBee solo | 15 | 59,1% | | + 2 QuickBee | 19 | 64,1% | | + 1 QuickBee + 1 WorkerBee | 19 | 69,5% | | + 2 WorkerBee | 20 | 71,5% | +12,4 punti, di cui 11,4 sono completamenti aggiuntivi: il team non fa meglio, porta a termine il lavoro. Tre avvertenze: esecuzioni a 3× il timeout (solo incluso), costo del team non pubblicato, n=1 per compito. Criterio decisionale proposto dal post: il team vale il suo costo aggiuntivo "quando l'alternativa è un essere umano che riprende un lavoro non finito". ### Il tetto dei rendimenti decrescenti del prezzo Solo su Terminal-Bench 2.1, Opus 5 a effort xhigh = 140,63 $ per il 75,0%, l'esecuzione più costosa, dietro a sei esecuzioni tra 20,08 $ e 109,82 $ (dal 79,5% all'88,4%). Causa indicata: eccesso di ragionamento, con 17 compiti su 88 andati in timeout. Si tratta anzitutto di un artefatto legato al tempo reale — una proprietà della combinazione modello × harness × timeout, non una misura della capacità grezza. Ciò che resta attuabile: "Pagare di più smette di aiutare, poi comincia a nuocere", e uno SmartBee a effort medium è sufficiente per la maggior parte dei compiti. Tra le sei esecuzioni migliori: uno scarto di prezzo di 5,5× per uno scarto di punteggio di 8,9 punti, che il post considera un pareggio a questa dimensione del campione. "Tutto ciò che va da Terra a effort medium in su è, per quanto questi compiti possano dirlo, lo stesso agente. Il che è una buona notizia, perché significa che scegliere tra loro non è affatto una decisione di qualità. È una decisione di budget." Ambito limitato a questo benchmark, a questi prezzi e a questo harness. ### Effort di ragionamento: il compromesso si ribalta a seconda del livello Su un modello economico, aumentare l'effort è il miglior investimento: Luna medium = 1,61 $ / 57,3% → Luna high = 4,98 $ / 75,0%. Su un modello frontier, aumentare l'effort costa di più e peggiora le prestazioni. | Livello | Effort consigliato | Lavoro | Esempi citati | |---|---|---|---| | QuickBee | max / xhigh / high | build, screenshot, suite di test, triage di prima battuta | GPT-5.6 Luna, DeepSeek V4 Flash, modelli locali | | WorkerBee | high / xhigh | un intero sottoinsieme end-to-end, senza supervisione | GPT-5.6 Terra, Gemini 3.6 Flash, modelli open | | SmartBee | medium | visione d'insieme, trade-off, assorbimento delle escalation | Claude Opus 5, Kimi K3, GPT-5.6 Sol | | Essere umano | — | "L'ape più costosa del team, e la più lenta. Anche se resta la più intelligente." | — | Il punto di inversione dipende dai timeout locali: da ritestare prima di generalizzare. ### Hive o Swarm: cosa dovrebbe ricordare il team?
Hive. — un team permanente di agenti nominati, ciascuno con un ruolo e una memoria delle preferenze dell'utente. Argomento cumulativo: "La seconda volta che revisiona il codice di un collega, sa quali osservazioni minori si possono ignorare. La decima volta, informarlo è più veloce che informare una persona."Swarm — un team usa e getta per un progetto con un inizio e una fine (migrazione, aggiornamento di framework, refactor su larga scala), che accumula una memoria del progetto e viene poi eliminato. Criterio di scelta: il soggetto da ricordare è l'utente o il progetto? Prerequisito assunto: l'agente è un posto, non una sessione — nome, persona, memoria, una propria presenza nel canale. ### Topologia delle escalation Diagnosi: "La modalità di guasto degli strumenti agentici non è che il lavoro sia scadente, è che ogni ambiguità diventa una notifica." Il coordinatore SmartBee assorbe la routine (test instabile, import ambiguo, configurazione spostata) e scrive le risposte umane in memoria, così lo Swarm diventa nel tempo più economico da supervisionare. "L'essere umano smette di essere middleware e torna a essere l'ultimo revisore." Domanda qualificante da porre a qualsiasi strumento multi-agente: dove finiscono le escalation, e lo strumento impara dalle risposte? ### Testimonianza di migrazione Leigh Maddock, Engineer @ Block: "Ho migrato oltre 2000 app/progetti usando Buzz e uno Swarm di agenti", con 1 coordinatore, da 1 a 10 migratori paralleli e 1 verificatore indipendente, con il coordinatore che gestisce la maggior parte delle escalation. Testimonianza, non una misurazione: nessuna durata, nessun costo, nessun tasso di fallimento, nessuna definizione di "migrato". Il pattern resta trasferibile — la stessa forma dei minions one-shot descritti in [[gray-stripe-minions-coding-agents-part1-2026-02-09]], con l'aggiunta del verificatore indipendente e della memoria delle escalation. ### Composizioni pronte all'uso | Caso | Composizione | |---|---| | Revisione di PR | SmartBee che revisiona la PR + QuickBee che compila in locale e produce screenshot | | Triage di test instabili | QuickBee che riesegue i test e raccoglie prove + SmartBee che decide | | Lavoro breve | un singolo agente, eventualmente un QuickBee su compiti correlati ma distinti | Denominatore comune: il livello costoso legge e decide, il livello economico esegue e raccoglie prove. ### Posizionamento commerciale Buzz accetta abbonamenti Claude Code e Codex, modelli open e modelli locali: "Non si è vincolati a un unico fornitore né costretti ad affidare ogni compito al modello più costoso per pigrizia." La composizione predefinita proposta è esplicitamente tri-vendor. La tesi secondo cui "il modello migliore non è sempre quello giusto" è vera ed è commercialmente utile a chi vende il componente anziché il modello. Vedi anche [[paymentsdive-block-dorsey-pricing-ia-2026-08-06]]. ### Condizioni sperimentali, da riprodurre se l'esercizio viene ripetuto Harbor; veri agenti Buzz su un relay live ("Nessuno dei risultati qui sotto è stato misurato su un banco di prova semplificato"); un tentativo per compito, senza retry, con timeout; LHTB a 3× il timeout, solo incluso; prezzi al 30-07-2026; Kimi K3 e DeepSeek V4 Flash non supportano l'effort medium. Nessun intervallo di confidenza, n=1 — il post stesso riconosce il pareggio tra sei esecuzioni come un effetto della dimensione del campione. Considerare queste cifre come ordini di grandezza.
Dati chiave
nessuna delle dodici composizioni di team testate su Terminal-Bench 2.1 ha superato l'agente solo equivalente in rapporto qualità-prezzo
su Long-Horizon Terminal-Bench, un team SmartBee + 2 WorkerBee completa 20 compiti su 44 per il 71,5 %, contro 15 compiti e il 59,1 % per lo SmartBee solo
Claude Opus 5 in modalità xhigh è il run solo più costoso di Terminal-Bench 2.1 a 140,63 dollari per il 75,0 %, tra sei run fatturati da 20,08 a 109,82 dollari
oltre un certo tier i modelli sono indistinguibili su questi compiti, tanto che scegliere tra loro non è più una decisione di qualità ma una decisione di budget
— Block
un compito breve non ha abbastanza struttura per essere diviso, e aggiungere agenti si limita a comprare il costo di spiegarlo due volte
— Block
plus de 2 000 apps et projets ont été migrés chez Block avec un Swarm composé d'un coordinateur, de 1 à 10 migrateurs parallèles et d'un vérificateur indépendant
— Leigh Maddock
Il grafo di conoscenza estratto da questa fiche — 14 entità, 28 relazioni.
In questo grafo :QuickBee · WorkerBee · SmartBee · Hive · Swarm · escalade agent-vers-agent · Terminal-Bench 2.1 · Long-Horizon Terminal-Bench · Harbor · Claude Opus 5 · GPT-5.6 Luna · Buzz · Atish Patel · Leigh Maddock