# patel-block-buzz-teams-tokens-benchmarks-2026-08-06

## Veille

Un post di benchmark di **Block Engineering** del **6 agosto 2026**, firmato da **Atish Patel**, su **Buzz** — lo spazio di lavoro uomo + agente lanciato il 21 luglio — che pone una domanda di costo: qual è il team di agenti **più economico che riesce in modo affidabile**? Tre risultati. **(A) Un risultato negativo, pubblicato per intero**: su **Terminal-Bench 2.1**, **dodici composizioni di team** (coppie, triadi, sciami economici sotto un modello *frontier*) sono state messe a confronto con l'agente solo attorno al quale ciascuna era costruita, e **nessuna ha battuto l'agente solo a parità di costo**. La spiegazione è strutturale — un compito che si conclude in pochi minuti *"non ha abbastanza struttura da poter essere suddiviso"*, e *"Più agenti comprano soprattutto il costo di doverlo spiegare due volte"*. **(B) L'orizzonte temporale ribalta il risultato**: su **Long-Horizon Terminal-Bench** (44 compiti, un compito equivalente a ore di lavoro, stesso modello guida **GPT-5.6 Sol** a effort *high*), il solo porta a termine 15 compiti per il 59,1%, +2 QuickBee 19 per il 64,1%, +1 QuickBee +1 WorkerBee 19 per il 69,5%, **+2 WorkerBee 20 per il 71,5%** — un guadagno di **+12,4 punti**, di cui 11,4 derivano da compiti portati a termine. *"Stessi posti, risultato opposto, perché il lavoro ha una forma diversa."* Queste esecuzioni sono girate a **3× il timeout**, solo incluso. **(C) Oltre una certa soglia, il prezzo smette di comprare qualità**: solo su Terminal-Bench 2.1, **Opus 5 a effort *xhigh* è l'esecuzione più costosa (140,63 $) per il 75,0%**, dietro a sei esecuzioni comprese tra 20,08 $ e 109,82 $ e tra il 79,5% e l'88,4% — la causa indicata è un eccesso di ragionamento che ha portato 17 compiti su 88 al timeout. Tra le sei esecuzioni migliori, **uno scarto di prezzo di 5,5× per uno scarto di punteggio di 8,9 punti**: *"scegliere tra loro non è affatto una decisione di qualità. È una decisione di budget."* Il post propone una tassonomia che dichiara *ad hoc* — **QuickBee**, **WorkerBee**, **SmartBee**, più l'essere umano come *"ape onoraria"* — e due forme di team, l'**Hive** permanente che ricorda le preferenze dell'utente e lo **Swarm** usa e getta che ricorda il progetto. Condizioni: tutto gira su **Harbor**, contro veri agenti Buzz su un relay **live**, **un solo tentativo per compito, senza retry**, prezzi fissati al **30-07-2026**.

## Titre Article

Efficient Tokens & Effective Teams in Buzz

## Date

2026-08-06

## URL

https://engineering.block.xyz/blog/effective-teams-buzz

## Keywords

Buzz, Block, team di agenti, composizione del team, multi-agente, orchestrazione, QuickBee, WorkerBee, SmartBee, ape onoraria, tassonomia a livelli, Hive, Swarm, team permanente, team usa e getta, memoria della persona, memoria del progetto, posto anziché sessione, escalation, coordinatore, verificatore indipendente, middleware umano, ultimo revisore, Terminal-Bench 2.1, Long-Horizon Terminal-Bench, LHTB, Harbor, relay live, risultato negativo, compiti lunghi, struttura divisibile, overhead di coordinamento, timeout, eccesso di ragionamento, effort di ragionamento, effort medium, effort high, effort xhigh, token di ragionamento, costo per compito, decisione di budget, rendimenti decrescenti, GPT-5.6 Luna, GPT-5.6 Terra, GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash, DeepSeek V4 Flash, Kimi K3, modelli locali, abbonamento Claude Code, Codex, multi-fornitore, migrazione di massa, Leigh Maddock, Atish Patel, revisione di PR, triage di test instabili

## Authors

- **Atish Patel** — *« Building AI solutions @ Block »*, auteur unique du billet, publié le **6 août 2026** sur `engineering.block.xyz`.
- **Leigh Maddock** — Engineer @ Block, cité en encadré pour un témoignage de migration (2 000+ apps/projets).

Billet de benchmarks écrit par l'éditeur du produit mesuré. Deux éléments à porter avec cette réserve : Block publie un **résultat négatif sur sa propre fonctionnalité phare**, et rappelle trois fois que **les modèles ne sont pas les siens** (OpenAI, Anthropic, Google, DeepSeek, Moonshot AI) — la métrique optimisée, *« le moins cher qui réussit »*, étant aussi celle qui valorise un workspace multi-fournisseurs.

## Ton

**Profilo**: un post di benchmark con finalità prescrittiva, registro ingegneristico pragmatico, strutturato come una guida all'acquisto. Pubblico: team che già gestiscono più agenti e tengono d'occhio la propria bolletta di inferenza.

**Stile**: si apre con un **TL;DR di sette righe**, ciascuna riga che abbina una raccomandazione alla propria cifra, poi alterna raccomandazione → grafico → lettura del grafico. La metafora dell'ape viene spinta fino a diventare una tassonomia utilizzabile (QuickBee, WorkerBee, SmartBee, *ape onoraria*), con illustrazioni, e il post stesso disinnesca l'effetto gergale: *"Nota: Hive e Swarm sono termini specifici di questo blog che abbiamo coniato"*. Lo scopo dichiarato di questa griglia è esplicito — *"Il livello + l'effort consigliato aiutano a eliminare il rumore delle uscite dei modelli"*: ragionare per livelli per smettere di inseguire ogni singola uscita di modello. L'onestà è messa in scena e sostenuta nel tempo: *"la prima risposta non è stata quella che speravamo"*, seguita dal risultato negativo pubblicato per intero, e da asterischi che annotano le anomalie nella tabella (Opus 5 in timeout, Kimi K3 e DeepSeek V4 Flash che non gestiscono l'effort *medium*). Il costo viene inquadrato come un problema sociale interno: *"Pagare prezzi da frontiera per il primo è il modo in cui si finisce per spiegare una bolletta di inferenza in una riunione in cui non si voleva finire."*

**Frasi distintive**:
- ***"L'ape giusta. Il team giusto. Il compito giusto."***
- ***"Smettere di essere middleware"*** · ***"Smettere di fare da balia all'IA"***
- ***"Pagare di più smette di aiutare, poi comincia a nuocere"***
- ***"non è affatto una decisione di qualità. È una decisione di budget"***
- ***"Stessi posti, risultato opposto, perché il lavoro ha una forma diversa"***
- ***"Più agenti comprano soprattutto il costo di doverlo spiegare due volte"***
- ***"su un modello economico, i token di ragionamento sono l'affare migliore disponibile"***
- ***"la modalità di guasto degli strumenti agentici non è che il lavoro sia scadente, è che ogni ambiguità diventa una notifica"***

**Postura epistemica**: insolitamente ben delimitata per un post di un fornitore. Le condizioni sono dichiarate (Harbor, veri agenti Buzz su un relay live, un tentativo per compito senza retry, prezzi al 30-07-2026, LHTB a 3× il timeout, *"Nessuno dei risultati qui sotto è stato misurato su un banco di prova semplificato"*), le anomalie sono annotate, e una conclusione è presentata come provvisoria: *"Questo potrebbe cambiare se i modelli venissero addestrati a una collaborazione migliore."* Mancano tuttavia: qualsiasi intervallo di confidenza, il costo del team su LHTB, e la variazione del modello guida nel confronto tra team; **n=1 per compito**.

## Pense-betes

- **Data / fonte**: **6 agosto 2026**, `engineering.block.xyz`, firmato da **Atish Patel**. Misurazioni su **Harbor**, veri agenti Buzz su un relay live, **un solo tentativo per compito, senza retry**, prezzi al **30-07-2026**.
- **Inquadramento chiave**: la domanda posta non è "qual è il team migliore" ma "qual è il più economico che riesce in modo affidabile". Tutti i risultati derivano da questo. ### Risultato negativo sui compiti brevi Su **Terminal-Bench 2.1**, dodici composizioni — coppie, triadi, sciami economici sotto un modello guida *frontier* — sono state messe a confronto con l'agente solo attorno al quale ciascuna era costruita: **nessuna l'ha battuto a parità di costo**. La ragione indicata è strutturale: un compito che si conclude in pochi minuti non ha abbastanza struttura da poter essere suddiviso, e *"Più agenti comprano soprattutto il costo di doverlo spiegare due volte."* Regola che ne deriva: non assemblare un team per un lavoro breve e ben specificato. Contrappeso empirico al post di lancio [[longwell-block-buzz-workspace-agents-nostr-2026-07-21]]. ### L'orizzonte temporale ribalta il risultato Long-Horizon Terminal-Bench, 44 compiti, modello guida GPT-5.6 Sol a effort *high* per tutte le formazioni: | Formazione | Compiti completati /44 | Punteggio | |---|---|---| | SmartBee solo | 15 | 59,1% | | + 2 QuickBee | 19 | 64,1% | | + 1 QuickBee + 1 WorkerBee | 19 | 69,5% | | **+ 2 WorkerBee** | **20** | **71,5%** | +12,4 punti, di cui **11,4 sono completamenti aggiuntivi**: il team non fa meglio, porta a termine il lavoro. Tre avvertenze: esecuzioni a 3× il timeout (solo incluso), costo del team non pubblicato, n=1 per compito. Criterio decisionale proposto dal post: il team vale il suo costo aggiuntivo *"quando l'alternativa è un essere umano che riprende un lavoro non finito"*. ### Il tetto dei rendimenti decrescenti del prezzo Solo su Terminal-Bench 2.1, **Opus 5 a effort *xhigh* = 140,63 $ per il 75,0%**, l'esecuzione più costosa, dietro a sei esecuzioni tra 20,08 $ e 109,82 $ (dal 79,5% all'88,4%). Causa indicata: eccesso di ragionamento, con 17 compiti su 88 andati in timeout. Si tratta anzitutto di un artefatto legato al tempo reale — una proprietà della combinazione modello × harness × timeout, non una misura della capacità grezza. Ciò che resta attuabile: *"Pagare di più smette di aiutare, poi comincia a nuocere"*, e uno SmartBee a effort *medium* è sufficiente per la maggior parte dei compiti. Tra le sei esecuzioni migliori: **uno scarto di prezzo di 5,5× per uno scarto di punteggio di 8,9 punti**, che il post considera un pareggio a questa dimensione del campione. *"Tutto ciò che va da Terra a effort medium in su è, per quanto questi compiti possano dirlo, lo stesso agente. Il che è una buona notizia, perché significa che scegliere tra loro non è affatto una decisione di qualità. È una decisione di budget."* Ambito limitato a questo benchmark, a questi prezzi e a questo harness. ### Effort di ragionamento: il compromesso si ribalta a seconda del livello Su un modello economico, aumentare l'effort è il miglior investimento: **Luna medium = 1,61 $ / 57,3%** → **Luna high = 4,98 $ / 75,0%**. Su un modello frontier, aumentare l'effort costa di più e peggiora le prestazioni. | Livello | Effort consigliato | Lavoro | Esempi citati | |---|---|---|---| | **QuickBee** | max / xhigh / high | build, screenshot, suite di test, triage di prima battuta | GPT-5.6 Luna, DeepSeek V4 Flash, modelli locali | | **WorkerBee** | high / xhigh | un intero sottoinsieme end-to-end, senza supervisione | GPT-5.6 Terra, Gemini 3.6 Flash, modelli open | | **SmartBee** | medium | visione d'insieme, trade-off, assorbimento delle escalation | Claude Opus 5, Kimi K3, GPT-5.6 Sol | | **Essere umano** | — | *"L'ape più costosa del team, e la più lenta. Anche se resta la più intelligente."* | — | Il punto di inversione dipende dai timeout locali: da ritestare prima di generalizzare. ### Hive o Swarm: cosa dovrebbe ricordare il team?
- **Hive** — un team **permanente** di agenti nominati, ciascuno con un ruolo e una memoria delle preferenze **dell'utente**. Argomento cumulativo: *"La seconda volta che revisiona il codice di un collega, sa quali osservazioni minori si possono ignorare. La decima volta, informarlo è più veloce che informare una persona."*

**Swarm** — un team **usa e getta** per un progetto con un inizio e una fine (migrazione, aggiornamento di framework, refactor su larga scala), che accumula una memoria **del progetto** e viene poi eliminato. Criterio di scelta: il soggetto da ricordare è l'utente o il progetto? Prerequisito assunto: l'agente è **un posto, non una sessione** — nome, persona, memoria, una propria presenza nel canale. ### Topologia delle escalation Diagnosi: *"La modalità di guasto degli strumenti agentici non è che il lavoro sia scadente, è che ogni ambiguità diventa una notifica."* Il coordinatore SmartBee assorbe la routine (test instabile, import ambiguo, configurazione spostata) e **scrive le risposte umane in memoria**, così lo Swarm diventa nel tempo più economico da supervisionare. *"L'essere umano smette di essere middleware e torna a essere l'ultimo revisore."* Domanda qualificante da porre a qualsiasi strumento multi-agente: dove finiscono le escalation, e lo strumento impara dalle risposte? ### Testimonianza di migrazione **Leigh Maddock**, Engineer @ Block: *"Ho migrato oltre 2000 app/progetti usando Buzz e uno Swarm di agenti"*, con 1 coordinatore, da 1 a 10 migratori paralleli e 1 verificatore indipendente, con il coordinatore che gestisce la maggior parte delle escalation. Testimonianza, non una misurazione: nessuna durata, nessun costo, nessun tasso di fallimento, nessuna definizione di "migrato". Il pattern resta trasferibile — la stessa forma dei *minions* one-shot descritti in [[gray-stripe-minions-coding-agents-part1-2026-02-09]], con l'aggiunta del verificatore indipendente e della memoria delle escalation. ### Composizioni pronte all'uso | Caso | Composizione | |---|---| | Revisione di PR | SmartBee che revisiona la PR + QuickBee che compila in locale e produce screenshot | | Triage di test instabili | QuickBee che riesegue i test e raccoglie prove + SmartBee che decide | | Lavoro breve | un singolo agente, eventualmente un QuickBee su compiti correlati ma distinti | Denominatore comune: il livello costoso legge e decide, il livello economico esegue e raccoglie prove. ### Posizionamento commerciale Buzz accetta abbonamenti **Claude Code** e **Codex**, modelli open e modelli locali: *"Non si è vincolati a un unico fornitore né costretti ad affidare ogni compito al modello più costoso per pigrizia."* La composizione predefinita proposta è esplicitamente tri-vendor. La tesi secondo cui "il modello migliore non è sempre quello giusto" è vera ed è commercialmente utile a chi vende il componente anziché il modello. Vedi anche [[paymentsdive-block-dorsey-pricing-ia-2026-08-06]]. ### Condizioni sperimentali, da riprodurre se l'esercizio viene ripetuto Harbor; veri agenti Buzz su un relay live (*"Nessuno dei risultati qui sotto è stato misurato su un banco di prova semplificato"*); un tentativo per compito, senza retry, con timeout; LHTB a 3× il timeout, solo incluso; prezzi al 30-07-2026; Kimi K3 e DeepSeek V4 Flash non supportano l'effort *medium*. Nessun intervallo di confidenza, n=1 — il post stesso riconosce il pareggio tra sei esecuzioni come un effetto della dimensione del campione. Considerare queste cifre come ordini di grandezza.

## RésuméDe400mots

Un post di benchmark di **Block** firmato da **Atish Patel**, pubblicato il **6 agosto 2026**, che estende il lancio di **Buzz**: dal momento in cui assemblare un team di agenti è diventato banale, *qual è il più economico che riesce in modo affidabile?*

**Prima il vocabolario.** Il post propone quattro livelli: **QuickBee** (veloce ed economico — build, screenshot, test, triage di prima battuta: GPT-5.6 Luna, DeepSeek V4 Flash, modelli locali, **eseguito a effort high**), **WorkerBee** (versatile, porta avanti un intero sottoinsieme senza supervisione: GPT-5.6 Terra, Gemini 3.6 Flash, modelli open), **SmartBee** (visione d'insieme, trade-off, escalation: Claude Opus 5, Kimi K3, GPT-5.6 Sol, **a effort *medium***), e l'essere umano, *"l'ape più costosa del team, e la più lenta. Anche se resta la più intelligente"*. Due forme di team: l'**Hive** permanente, che ricorda le preferenze **dell'utente**, e lo **Swarm** usa e getta, che ricorda **il progetto** e poi scompare.

**Il risultato in solo.** Su **Terminal-Bench 2.1**, aumentare l'effort di un **modello economico** è il miglior investimento: Luna passa da 1,61 $ / 57,3% (*medium*) a 4,98 $ / 75,0% (*high*). All'estremo opposto, **Opus 5 a effort *xhigh* è l'esecuzione più costosa (140,63 $) e ottiene solo il 75,0%**, avendo **raggiunto il timeout su 17 dei 88 compiti** a causa di un eccesso di ragionamento. Tra le sei esecuzioni migliori: **uno scarto di prezzo di 5,5×, uno scarto di punteggio di 8,9 punti**. Conclusione: *"scegliere tra loro non è affatto una decisione di qualità. È una decisione di budget."*

**Il risultato di team, in due atti.** Su Terminal-Bench 2.1, sono state testate **dodici composizioni** e **nessuna ha battuto il solo a parità di costo** — un compito breve non ha abbastanza struttura da poter essere suddiviso. Su **Long-Horizon Terminal-Bench** (44 compiti pluriorari, modello guida GPT-5.6 Sol, **3× il timeout**), il ribaltamento è netto: solo **15 compiti / 59,1%**, +2 WorkerBee **20 / 71,5%** — **+12,4 punti, di cui 11,4 provengono da completamenti aggiuntivi**. Il team costa di più per compito, il che si ripaga *"quando l'alternativa è un essere umano che riprende un lavoro non finito"*.

**La regola operativa.** Instradare le escalation dei worker verso un **coordinatore SmartBee** piuttosto che verso l'essere umano: *"ogni ambiguità diventa una notifica"* è la vera modalità di guasto. Un ingegnere di Block afferma di aver **migrato oltre 2.000 app** con uno Swarm (coordinatore, 1-10 migratori, verificatore indipendente), con il coordinatore che memorizza le risposte umane.

**Avvertenze**: n=1 per compito, nessun intervallo di confidenza, costi del team non pubblicati, e un'ammissione — *"questo potrebbe cambiare se i modelli venissero addestrati a una collaborazione migliore."*

## GrapheDeConnaissance

- Block —publie→ des benchmarks d'équipes d'agents exécutés sur de vrais agents Buzz via un relais live, une tentative par tâche et sans retry (AFFIRMATION, 0.96)
- Atish Patel —travaille_chez→ Block (ORGANISATION, 0.96)
- Leigh Maddock —travaille_chez→ Block (ORGANISATION, 0.95)
- Block —mesure→ aucune des douze compositions d'équipe testées sur Terminal-Bench 2.1 n'a devancé l'agent solo équivalent en rapport qualité-prix (MESURE, 0.96)
- Block —affirme_que→ une tâche courte n'a pas assez de structure pour être divisée, et ajouter des agents ne fait qu'acheter le coût de l'expliquer deux fois (CITATION, 0.94)
- Block —mesure→ sur Long-Horizon Terminal-Bench, une équipe SmartBee + 2 WorkerBees termine 20 tâches sur 44 pour 71,5 %, contre 15 tâches et 59,1 % pour le SmartBee solo (MESURE, 0.96)
- équipe d'agents à horizon long —améliore→ le nombre de tâches menées à terme : +12,4 points de récompense moyenne, dont 11,4 points imputables aux complétions supplémentaires (MESURE, 0.94)
- équipe d'agents à horizon long —s_applique_à→ le travail qui court sur des heures ou se répète sur plusieurs jours, pas les tâches courtes et bien spécifiées (AFFIRMATION, 0.94)
- Block —mesure→ Claude Opus 5 en effort xhigh est le run solo le plus cher de Terminal-Bench 2.1 à 140,63 dollars pour 75,0 %, sous six runs facturés de 20,08 à 109,82 dollars (MESURE, 0.95)
- Claude Opus 5 —s_oppose_à→ le mur d'horloge du harness en effort xhigh : le sur-raisonnement a provoqué un timeout sur 17 des 88 tâches (AFFIRMATION, 0.93)
- effort de raisonnement élevé —améliore→ le score d'un modèle bon marché pour un coût marginal faible : GPT-5.6 Luna passe de 1,61 dollar et 57,3 % en medium à 4,98 dollars et 75,0 % en high (MESURE, 0.95)
- effort de raisonnement élevé —s_oppose_à→ le rendement d'un modèle frontier, où payer davantage cesse d'aider puis commence à nuire (AFFIRMATION, 0.92)
- Block —affirme_que→ au-delà d'un certain tier les modèles sont indiscernables sur ces tâches, si bien que choisir entre eux n'est plus une décision de qualité mais une décision de budget (CITATION, 0.95)
- Block —mesure→ un écart de prix de 5,5 fois pour 8,9 points de score entre les six meilleurs runs solo de Terminal-Bench 2.1 (MESURE, 0.94)
- Block —recommande→ de faire tourner les QuickBees et WorkerBees en effort élevé et de réserver les tokens de SmartBee à la coordination, au jugement et aux décisions difficiles (AFFIRMATION, 0.95)
- Hive —permet→ de maintenir une équipe permanente d'agents nommés dont la mémoire accumule les préférences de l'utilisateur (AFFIRMATION, 0.94)
- Swarm —permet→ de monter une équipe jetable pour un projet borné, dont la mémoire partagée retient les cas particuliers du projet et disparaît avec lui (AFFIRMATION, 0.94)
- Swarm —est_variante_de→ Hive (METHODOLOGIE, 0.85)
- escalade agent-vers-agent —résout→ le mode de défaillance de l'outillage agentique, où chaque ambiguïté devient une notification pour l'humain (AFFIRMATION, 0.95)
- escalade agent-vers-agent —réduit→ le coût de supervision d'un Swarm au fil du temps, le coordinateur écrivant les réponses humaines en mémoire (AFFIRMATION, 0.93)
- Leigh Maddock —affirme_que→ plus de 2 000 apps et projets ont été migrés chez Block avec un Swarm composé d'un coordinateur, de 1 à 10 migrateurs parallèles et d'un vérificateur indépendant (AFFIRMATION, 0.9)
- Buzz —permet→ à des agents de se déléguer du travail entre eux et de s'escalader des questions sans qu'un humain relaie quoi que ce soit (AFFIRMATION, 0.95)
- Buzz —s_applique_à→ Claude Code, Codex, modèles ouverts et modèles locaux, avec leurs abonnements existants (AFFIRMATION, 0.94)
- Buzz —permet→ de composer une équipe tri-fournisseurs : Claude Opus 5 en SmartBee, GPT-5.6 Terra en WorkerBee, un modèle local en QuickBee (AFFIRMATION, 0.93)
- Terminal-Bench 2.1 —mesure→ la performance d'agents sur des tâches de terminal courtes, achevées en minutes (AFFIRMATION, 0.9)
- Long-Horizon Terminal-Bench —mesure→ la performance d'agents sur 44 tâches dont chacune représente des heures de travail (AFFIRMATION, 0.92)
- Harbor —permet→ d'exécuter ces benchmarks contre de vrais agents Buzz sur un relais live plutôt que sur un banc d'essai simplifié (AFFIRMATION, 0.91)
- Block —prédit→ que la supériorité de l'agent solo sur les tâches courtes pourrait s'inverser si les modèles sont entraînés à mieux collaborer (AFFIRMATION, 0.9)

---
Canonical: https://www.thekb.eu/it/fiches/patel-block-buzz-teams-tokens-benchmarks-2026-08-06/
