# patel-block-buzz-teams-tokens-benchmarks-2026-08-06

## Veille

Ein **Block-Engineering**-Benchmark-Beitrag vom **6. August 2026**, verfasst von **Atish Patel**, über **Buzz** – den am 21. Juli gestarteten Workspace für Mensch und Agent – der eine Kostenfrage stellt: Welches Agententeam ist **das günstigste, das zuverlässig erfolgreich ist**? Drei Befunde. **(A) Ein vollständig veröffentlichtes negatives Ergebnis**: Auf **Terminal-Bench 2.1** wurden **zwölf Teamzusammensetzungen** (Paare, Triaden, günstige Schwärme unter einem *Frontier*-Modell) gegen den jeweiligen Solo-Agenten antreten lassen, um den sie herum gebaut waren, und **keine schlug ihn bei gleichen Kosten**. Die Erklärung ist struktureller Natur – einer Aufgabe, die in Minuten erledigt ist, *„fehlt genug Struktur, um sie aufzuteilen"*, und *„mehr Agenten kaufen meist nur die Kosten, es zweimal zu erklären"*. **(B) Der Zeithorizont kehrt das Ergebnis um**: Auf **Long-Horizon Terminal-Bench** (44 Aufgaben, eine Aufgabe im Wert von Stunden Arbeit, gleicher Lead **GPT-5.6 Sol** mit *high*-Aufwand) schließt Solo 15 Aufgaben ab bei 59,1 %, +2 QuickBees 19 bei 64,1 %, +1 QuickBee +1 WorkerBee 19 bei 69,5 %, **+2 WorkerBees 20 bei 71,5 %** – ein Zugewinn von **+12,4 Punkten**, wovon 11,4 aus abgeschlossenen Aufgaben stammen. *„Gleiche Plätze, umgekehrtes Ergebnis, weil die Arbeit eine andere Form hat."* Diese Durchläufe liefen mit dem **3-fachen Timeout**, Solo eingeschlossen. **(C) Jenseits einer Schwelle kauft der Preis keine Qualität mehr**: Solo auf Terminal-Bench 2.1, **Opus 5 mit *xhigh*-Aufwand ist der teuerste Durchlauf (140,63 $) bei 75,0 %**, hinter sechs Durchläufen zwischen 20,08 $ und 109,82 $ und 79,5 % bis 88,4 % – als Ursache wird Over-Reasoning genannt, das 17 von 88 Aufgaben in den Timeout trieb. Unter den sechs besten Durchläufen liegt **eine 5,5-fache Preisspanne bei einer Punktzahldifferenz von 8,9 Punkten**: *„die Wahl zwischen ihnen ist überhaupt keine Qualitätsentscheidung. Es ist eine Budgetentscheidung."* Der Beitrag schlägt eine Taxonomie vor, die er selbst als *ad hoc* bezeichnet – **QuickBee**, **WorkerBee**, **SmartBee**, dazu der Mensch als *„Ehrenbiene"* – sowie zwei Teamformen: die permanente **Hive**, die sich die Präferenzen der Nutzenden merkt, und der einmalige **Swarm**, der sich das Projekt merkt. Rahmenbedingungen: alles läuft auf **Harbor**, gegen echte Buzz-Agenten auf einem **Live**-Relay, **ein Versuch pro Aufgabe, kein Retry**, Preise festgeschrieben zum **30.07.2026**.

## Titre Article

Efficient Tokens & Effective Teams in Buzz

## Date

2026-08-06

## URL

https://engineering.block.xyz/blog/effective-teams-buzz

## Keywords

Buzz, Block, Agententeams, Teamzusammensetzung, Multi-Agent, Orchestrierung, QuickBee, WorkerBee, SmartBee, Ehrenbiene, Stufentaxonomie, Hive, Swarm, permanentes Team, einmaliges Team, Persona-Gedächtnis, Projektgedächtnis, Sitzplatz statt Sitzung, Eskalation, Koordinator, unabhängiger Verifizierer, menschliche Middleware, letzter Reviewer, Terminal-Bench 2.1, Long-Horizon Terminal-Bench, LHTB, Harbor, Live-Relay, negatives Ergebnis, lange Aufgaben, teilbare Struktur, Koordinationsaufwand, Timeout, Over-Reasoning, Reasoning-Aufwand, medium-Aufwand, high-Aufwand, xhigh-Aufwand, Reasoning-Token, Kosten pro Aufgabe, Budgetentscheidung, abnehmender Grenzertrag, GPT-5.6 Luna, GPT-5.6 Terra, GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash, DeepSeek V4 Flash, Kimi K3, lokale Modelle, Claude Code-Abonnement, Codex, anbieterübergreifend, Massenmigration, Leigh Maddock, Atish Patel, PR-Review, Triage flakiger Tests

## Authors

- **Atish Patel** — *« Building AI solutions @ Block »*, auteur unique du billet, publié le **6 août 2026** sur `engineering.block.xyz`.
- **Leigh Maddock** — Engineer @ Block, cité en encadré pour un témoignage de migration (2 000+ apps/projets).

Billet de benchmarks écrit par l'éditeur du produit mesuré. Deux éléments à porter avec cette réserve : Block publie un **résultat négatif sur sa propre fonctionnalité phare**, et rappelle trois fois que **les modèles ne sont pas les siens** (OpenAI, Anthropic, Google, DeepSeek, Moonshot AI) — la métrique optimisée, *« le moins cher qui réussit »*, étant aussi celle qui valorise un workspace multi-fournisseurs.

## Ton

**Profil**: ein Benchmark-Beitrag mit präskriptivem Anspruch, pragmatischem Engineering-Register, aufgebaut wie ein Kaufratgeber. Zielgruppe: Teams, die bereits mehrere Agenten betreiben und ihre Inferenzrechnung im Blick behalten.

**Stil**: beginnt mit einem **siebenzeiligen TL;DR**, in dem jede Zeile eine Empfehlung mit ihrer Kennzahl verbindet, danach wechseln sich Empfehlung → Diagramm → Diagrammauslegung ab. Die Bienen-Metapher wird bis zu einer nutzbaren Taxonomie getrieben (QuickBee, WorkerBee, SmartBee, *Ehrenbiene*), mit Illustrationen, wobei der Beitrag selbst den Jargon-Effekt entschärft: *„Hinweis: Hive und Swarm sind blogspezifische, von uns geprägte Begriffe"*. Der Zweck dieses Rasters wird explizit genannt — *„Die Stufe plus der empfohlene Aufwand helfen dabei, die lauten Modell-Releases auszublenden"*: Denken in Stufen, um nicht jeder Modellveröffentlichung hinterherzulaufen. Die Ehrlichkeit ist inszeniert und durchgehalten: *„die erste Antwort war nicht die, auf die wir gehofft hatten"*, gefolgt vom vollständig veröffentlichten negativen Ergebnis, sowie Sternchen, die die Auffälligkeiten in der Tabelle kennzeichnen (Timeout bei Opus 5, Kimi K3 und DeepSeek V4 Flash ohne Unterstützung für *medium*-Aufwand). Kosten werden als internes soziales Problem gerahmt: *„Für das erste Ergebnis Frontier-Preise zu zahlen, führt am Ende dazu, eine Inferenzrechnung in einem Meeting zu erklären, in dem man nicht sein wollte."*

**Charakteristische Formulierungen**:
- ***„Die richtige Biene. Das richtige Team. Die richtige Aufgabe."***
- ***„Aufhören, Middleware zu sein"*** · ***„Aufhören, KI zu babysitten"***
- ***„Mehr zu zahlen hilft ab einem Punkt nicht mehr, sondern schadet"***
- ***„es ist überhaupt keine Qualitätsentscheidung. Es ist eine Budgetentscheidung"***
- ***„Gleiche Plätze, umgekehrtes Ergebnis, weil die Arbeit eine andere Form hat"***
- ***„Mehr Agenten kaufen meist nur die Kosten, es zweimal zu erklären"***
- ***„bei einem günstigen Modell sind Reasoning-Token das beste verfügbare Angebot"***
- ***„der Fehlermodus von Agenten-Tooling ist nicht, dass die Arbeit schlecht ist, sondern dass jede Unklarheit zu einer Benachrichtigung wird"***

**Epistemische Haltung**: für einen Herstellerbeitrag ungewöhnlich gut abgegrenzt. Rahmenbedingungen werden genannt (Harbor, echte Buzz-Agenten auf einem Live-Relay, ein Versuch pro Aufgabe ohne Retry, Preise Stand 30.07.2026, LHTB mit 3-fachem Timeout, *„Keines der folgenden Ergebnisse wurde auf einem abgespeckten Testaufbau gemessen"*), Auffälligkeiten werden kommentiert, und eine Schlussfolgerung wird als vorläufig dargestellt: *„Das könnte sich ändern, wenn Modelle für bessere Zusammenarbeit trainiert werden."* Es fehlen jedoch: jegliches Konfidenzintervall, die Teamkosten von LHTB und die Lead-Variation im Teamvergleich; **n=1 pro Aufgabe**.

## Pense-betes

- **Datum/Quelle**: **6. August 2026**, `engineering.block.xyz`, verfasst von **Atish Patel**. Messungen auf **Harbor**, echte Buzz-Agenten auf einem Live-Relay, **ein Versuch pro Aufgabe, kein Retry**, Preise Stand **30.07.2026**.
- **Zentrale Rahmung**: Die gestellte Frage lautet nicht „welches das beste Team ist", sondern „welches das günstigste ist, das zuverlässig erfolgreich ist". Alle Befunde folgen daraus. ### Negatives Ergebnis bei kurzen Aufgaben Auf **Terminal-Bench 2.1** wurden zwölf Zusammensetzungen — Paare, Triaden, günstige Schwärme unter einem *Frontier*-Lead — gegen den jeweiligen Solo-Agenten antreten lassen, um den sie herum gebaut waren: **keine schlug ihn bei gleichen Kosten**. Der angegebene Grund ist struktureller Natur: einer Aufgabe, die in Minuten erledigt ist, fehlt die Struktur, um sie aufzuteilen, und *„Mehr Agenten kaufen meist nur die Kosten, es zweimal zu erklären."* Daraus resultierende Regel: für kurze, klar spezifizierte Arbeit kein Team zusammenstellen. Empirisches Gegengewicht zum Launch-Beitrag [[longwell-block-buzz-workspace-agents-nostr-2026-07-21]]. ### Der Zeithorizont kehrt das Ergebnis um Long-Horizon Terminal-Bench, 44 Aufgaben, Lead GPT-5.6 Sol mit *high*-Aufwand für alle Aufstellungen: | Aufstellung | Abgeschlossene Aufgaben /44 | Score | |---|---|---| | SmartBee solo | 15 | 59,1 % | | + 2 QuickBees | 19 | 64,1 % | | + 1 QuickBee + 1 WorkerBee | 19 | 69,5 % | | **+ 2 WorkerBees** | **20** | **71,5 %** | +12,4 Punkte, wovon **11,4 zusätzlich abgeschlossene Aufgaben** sind: Das Team leistet nicht mehr, es bringt die Aufgabe zu Ende. Drei Vorbehalte: Durchläufe mit 3-fachem Timeout (Solo eingeschlossen), Teamkosten nicht veröffentlicht, n=1 pro Aufgabe. Vom Beitrag vorgeschlagenes Entscheidungskriterium: Das Team lohnt seine Mehrkosten, *„wenn die Alternative ein Mensch ist, der unfertige Arbeit übernehmen muss"*. ### Die Grenze abnehmender Erträge beim Preis Solo auf Terminal-Bench 2.1, **Opus 5 mit *xhigh*-Aufwand = 140,63 $ bei 75,0 %**, der teuerste Durchlauf, hinter sechs Durchläufen zwischen 20,08 $ und 109,82 $ (79,5 % bis 88,4 %). Angegebene Ursache: Over-Reasoning, wobei 17 von 88 Aufgaben in den Timeout liefen. Dies ist in erster Linie ein Artefakt der Laufzeit — eine Eigenschaft der Kombination aus Modell × Harness × Timeout, kein Maß für die rohe Fähigkeit. Was handlungsrelevant bleibt: *„Mehr zu zahlen hilft ab einem Punkt nicht mehr, sondern schadet"*, und eine SmartBee mit *medium*-Aufwand genügt für die meisten Aufgaben. Unter den sechs besten Durchläufen: **eine 5,5-fache Preisspanne bei einer Punktzahldifferenz von 8,9 Punkten**, was der Beitrag bei dieser Stichprobengröße als Gleichstand behandelt. *„Alles von Terra mit medium-Aufwand aufwärts ist für diese Aufgaben derselbe Agent, soweit erkennbar. Das ist eine gute Nachricht, denn es bedeutet, dass die Wahl zwischen ihnen überhaupt keine Qualitätsentscheidung ist. Es ist eine Budgetentscheidung."* Geltungsbereich beschränkt auf diesen Benchmark, diese Preise und diesen Harness. ### Reasoning-Aufwand: der Trade-off kehrt sich je nach Stufe um Bei einem günstigen Modell ist die Erhöhung des Aufwands der beste Kauf: **Luna medium = 1,61 $ / 57,3 %** → **Luna high = 4,98 $ / 75,0 %**. Bei einem Frontier-Modell kostet die Erhöhung des Aufwands mehr und verschlechtert das Ergebnis. | Stufe | Empfohlener Aufwand | Arbeit | Genannte Beispiele | |---|---|---|---| | **QuickBee** | max / xhigh / high | Builds, Screenshots, Testsuite, Erst-Triage | GPT-5.6 Luna, DeepSeek V4 Flash, lokale Modelle | | **WorkerBee** | high / xhigh | ein vollständiger End-to-End-Teilbereich, unbeaufsichtigt | GPT-5.6 Terra, Gemini 3.6 Flash, offene Modelle | | **SmartBee** | medium | Gesamtbild, Abwägungen, Aufnahme von Eskalationen | Claude Opus 5, Kimi K3, GPT-5.6 Sol | | **Mensch** | — | *„Die teuerste Biene im Team, und die langsamste. Aber immer noch die klügste."* | — | Der Umkehrpunkt hängt von den lokalen Timeouts ab: vor einer Verallgemeinerung erneut testen. ### Hive oder Swarm: Was soll sich das Team merken?
- **Hive** — ein **permanentes** Team benannter Agenten, jeder mit einer Rolle und einer Erinnerung an die eigenen Präferenzen. Kumulatives Argument: *„Beim zweiten Mal, wenn sie den Code eines Kollegen reviewt, weiß sie, welche Kleinigkeiten abgewinkt werden. Beim zehnten Mal geht das Briefing schneller als das Briefing einer Person."* **Swarm** — ein **einmaliges** Team für ein Projekt mit Anfang und Ende (Migration, Framework-Upgrade, großes Refactoring), das eine Erinnerung **an das Projekt** aufbaut und danach gelöscht wird. Auswahlkriterium: Soll sich das Subjekt an die Person oder an das Projekt erinnern? Angenommene Voraussetzung: Der Agent ist **ein Sitzplatz, keine Sitzung** — Name, Persona, Gedächtnis, eigene Präsenz im Kanal. ### Eskalationstopologie Diagnose: *„Der Fehlermodus von Agenten-Tooling ist nicht, dass die Arbeit schlecht ist, sondern dass jede Unklarheit zu einer Benachrichtigung wird."* Der SmartBee-Koordinator übernimmt die Routine (flakiger Test, mehrdeutiger Import, verschobene Konfiguration) und **schreibt menschliche Antworten ins Gedächtnis**, sodass die Aufsicht über den Swarm mit der Zeit günstiger wird. *„Der Mensch hört auf, Middleware zu sein, und wird wieder zum letzten Reviewer."* Prüffrage für jedes Multi-Agenten-Tool: Wohin gehen Eskalationen, und lernt das Tool aus den Antworten? ### Erfahrungsbericht zur Migration **Leigh Maddock**, Engineer @ Block: *„Ich habe über 2000 Apps/Projekte mit Buzz und einem Swarm von Agenten migriert"*, mit 1 Koordinator, 1 bis 10 parallelen Migratoren und 1 unabhängigem Verifizierer, wobei der Koordinator den Großteil der Eskalationen übernahm. Erfahrungsbericht, keine Messung: keine Dauer, keine Kosten, keine Fehlerrate, keine Definition von „migriert". Das Muster bleibt übertragbar — dieselbe Form wie die One-Shot-*Minions*, beschrieben in [[gray-stripe-minions-coding-agents-part1-2026-02-09]], ergänzt um den unabhängigen Verifizierer und das Eskalationsgedächtnis. ### Einsatzfertige Zusammensetzungen | Fall | Zusammensetzung | |---|---| | PR-Review | SmartBee, die den PR reviewt + QuickBee, die lokal baut und Screenshots erstellt | | Triage flakiger Tests | QuickBee, die Tests erneut laufen lässt und Belege sammelt + SmartBee, die entscheidet | | Kurze Arbeit | ein einzelner Agent, gegebenenfalls eine QuickBee für verwandte, aber unterschiedliche Aufgaben | Gemeinsamer Nenner: Die teure Stufe liest und entscheidet, die günstige Stufe führt aus und sammelt Belege. ### Kommerzielle Positionierung Buzz akzeptiert **Claude Code**- und **Codex**-Abonnements, offene Modelle und lokale Modelle: *„Man ist nicht an einen Anbieter gebunden oder gezwungen, aus Bequemlichkeit jede Aufgabe dem teuersten Modell zu geben."* Die vorgeschlagene Standardzusammensetzung ist explizit dreianbieterübergreifend. Die These „das beste Modell ist nicht immer das richtige" trifft zu und ist kommerziell nützlich für alle, die den Teil statt das Modell verkaufen. Siehe auch [[paymentsdive-block-dorsey-pricing-ia-2026-08-06]]. ### Versuchsbedingungen, zur Übernahme bei Wiederholung Harbor; echte Buzz-Agenten auf einem Live-Relay (*„Keines der folgenden Ergebnisse wurde auf einem abgespeckten Testaufbau gemessen"*); ein Versuch pro Aufgabe, kein Retry, mit Timeouts; LHTB mit 3-fachem Timeout, Solo eingeschlossen; Preise Stand 30.07.2026; Kimi K3 und DeepSeek V4 Flash unterstützen keinen *medium*-Aufwand. Kein Konfidenzintervall, n=1 — der Beitrag selbst räumt den Gleichstand unter sechs Durchläufen als Stichprobengrößeneffekt ein. Diese Zahlen sind als Größenordnungen zu verstehen.

## RésuméDe400mots

Ein **Block**-Benchmark-Beitrag von **Atish Patel**, veröffentlicht am **6. August 2026**, der an den **Buzz**-Launch anknüpft: Da das Zusammenstellen eines Agententeams dort trivial geworden ist, stellt sich die Frage, *welches das günstigste ist, das zuverlässig erfolgreich ist*.

**Erst das Vokabular.** Der Beitrag schlägt vier Stufen vor: **QuickBee** (schnell und günstig – Builds, Screenshots, Tests, Erst-Triage: GPT-5.6 Luna, DeepSeek V4 Flash, lokale Modelle, **mit hohem Aufwand betrieben**), **WorkerBee** (vielseitig, übernimmt unbeaufsichtigt einen vollständigen Teilbereich: GPT-5.6 Terra, Gemini 3.6 Flash, offene Modelle), **SmartBee** (Gesamtbild, Abwägungen, Eskalationen: Claude Opus 5, Kimi K3, GPT-5.6 Sol, **mit *medium*-Aufwand**), sowie der Mensch, *„die teuerste Biene im Team, und die langsamste. Aber immer noch die klügste"*. Zwei Teamformen: die permanente **Hive**, die sich die Präferenzen der Nutzenden merkt, und der einmalige **Swarm**, der sich **das Projekt** merkt und danach verschwindet.

**Das Solo-Ergebnis.** Auf **Terminal-Bench 2.1** ist die Erhöhung des Aufwands eines **günstigen Modells** der beste Kauf: Luna steigt von 1,61 $ / 57,3 % (*medium*) auf 4,98 $ / 75,0 % (*high*). Am anderen Ende ist **Opus 5 mit *xhigh*-Aufwand der teuerste Durchlauf (140,63 $) und erreicht nur 75,0 %**, nachdem durch Over-Reasoning **bei 17 von 88 Aufgaben der Timeout erreicht wurde**. Unter den sechs besten Durchläufen: **eine 5,5-fache Preisspanne bei einer Punktzahldifferenz von 8,9 Punkten**. Fazit: *„die Wahl zwischen ihnen ist überhaupt keine Qualitätsentscheidung. Es ist eine Budgetentscheidung."*

**Das Teamergebnis, in zwei Akten.** Auf Terminal-Bench 2.1 wurden **zwölf Zusammensetzungen** getestet, und **keine schlug Solo bei gleichen Kosten** – einer kurzen Aufgabe fehlt die Struktur, um sie aufzuteilen. Auf **Long-Horizon Terminal-Bench** (44 mehrstündige Aufgaben, Lead GPT-5.6 Sol, **3-facher Timeout**) zeigt sich die Umkehrung deutlich: Solo **15 Aufgaben / 59,1 %**, +2 WorkerBees **20 / 71,5 %** – **+12,4 Punkte, wovon 11,4 aus zusätzlich abgeschlossenen Aufgaben stammen**. Das Team kostet pro Aufgabe mehr, was sich auszahlt, *„wenn die Alternative ein Mensch ist, der unfertige Arbeit übernehmen muss"*.

**Die Betriebsregel.** Eskalationen von Workern werden an einen **SmartBee-Koordinator** geleitet statt an den Menschen: *„jede Unklarheit wird zu einer Benachrichtigung"* ist der eigentliche Fehlermodus. Ein Block-Ingenieur berichtet von **über 2.000 migrierten Apps** mit einem Swarm (Koordinator, 1–10 Migratoren, unabhängiger Verifizierer), wobei der Koordinator menschliche Antworten im Gedächtnis speichert.

**Vorbehalte**: n=1 pro Aufgabe, kein Konfidenzintervall, Teamkosten nicht veröffentlicht, sowie ein Eingeständnis – *„das könnte sich ändern, wenn Modelle für bessere Zusammenarbeit trainiert werden."*

## GrapheDeConnaissance

- Block —publie→ des benchmarks d'équipes d'agents exécutés sur de vrais agents Buzz via un relais live, une tentative par tâche et sans retry (AFFIRMATION, 0.96)
- Atish Patel —travaille_chez→ Block (ORGANISATION, 0.96)
- Leigh Maddock —travaille_chez→ Block (ORGANISATION, 0.95)
- Block —mesure→ aucune des douze compositions d'équipe testées sur Terminal-Bench 2.1 n'a devancé l'agent solo équivalent en rapport qualité-prix (MESURE, 0.96)
- Block —affirme_que→ une tâche courte n'a pas assez de structure pour être divisée, et ajouter des agents ne fait qu'acheter le coût de l'expliquer deux fois (CITATION, 0.94)
- Block —mesure→ sur Long-Horizon Terminal-Bench, une équipe SmartBee + 2 WorkerBees termine 20 tâches sur 44 pour 71,5 %, contre 15 tâches et 59,1 % pour le SmartBee solo (MESURE, 0.96)
- équipe d'agents à horizon long —améliore→ le nombre de tâches menées à terme : +12,4 points de récompense moyenne, dont 11,4 points imputables aux complétions supplémentaires (MESURE, 0.94)
- équipe d'agents à horizon long —s_applique_à→ le travail qui court sur des heures ou se répète sur plusieurs jours, pas les tâches courtes et bien spécifiées (AFFIRMATION, 0.94)
- Block —mesure→ Claude Opus 5 en effort xhigh est le run solo le plus cher de Terminal-Bench 2.1 à 140,63 dollars pour 75,0 %, sous six runs facturés de 20,08 à 109,82 dollars (MESURE, 0.95)
- Claude Opus 5 —s_oppose_à→ le mur d'horloge du harness en effort xhigh : le sur-raisonnement a provoqué un timeout sur 17 des 88 tâches (AFFIRMATION, 0.93)
- effort de raisonnement élevé —améliore→ le score d'un modèle bon marché pour un coût marginal faible : GPT-5.6 Luna passe de 1,61 dollar et 57,3 % en medium à 4,98 dollars et 75,0 % en high (MESURE, 0.95)
- effort de raisonnement élevé —s_oppose_à→ le rendement d'un modèle frontier, où payer davantage cesse d'aider puis commence à nuire (AFFIRMATION, 0.92)
- Block —affirme_que→ au-delà d'un certain tier les modèles sont indiscernables sur ces tâches, si bien que choisir entre eux n'est plus une décision de qualité mais une décision de budget (CITATION, 0.95)
- Block —mesure→ un écart de prix de 5,5 fois pour 8,9 points de score entre les six meilleurs runs solo de Terminal-Bench 2.1 (MESURE, 0.94)
- Block —recommande→ de faire tourner les QuickBees et WorkerBees en effort élevé et de réserver les tokens de SmartBee à la coordination, au jugement et aux décisions difficiles (AFFIRMATION, 0.95)
- Hive —permet→ de maintenir une équipe permanente d'agents nommés dont la mémoire accumule les préférences de l'utilisateur (AFFIRMATION, 0.94)
- Swarm —permet→ de monter une équipe jetable pour un projet borné, dont la mémoire partagée retient les cas particuliers du projet et disparaît avec lui (AFFIRMATION, 0.94)
- Swarm —est_variante_de→ Hive (METHODOLOGIE, 0.85)
- escalade agent-vers-agent —résout→ le mode de défaillance de l'outillage agentique, où chaque ambiguïté devient une notification pour l'humain (AFFIRMATION, 0.95)
- escalade agent-vers-agent —réduit→ le coût de supervision d'un Swarm au fil du temps, le coordinateur écrivant les réponses humaines en mémoire (AFFIRMATION, 0.93)
- Leigh Maddock —affirme_que→ plus de 2 000 apps et projets ont été migrés chez Block avec un Swarm composé d'un coordinateur, de 1 à 10 migrateurs parallèles et d'un vérificateur indépendant (AFFIRMATION, 0.9)
- Buzz —permet→ à des agents de se déléguer du travail entre eux et de s'escalader des questions sans qu'un humain relaie quoi que ce soit (AFFIRMATION, 0.95)
- Buzz —s_applique_à→ Claude Code, Codex, modèles ouverts et modèles locaux, avec leurs abonnements existants (AFFIRMATION, 0.94)
- Buzz —permet→ de composer une équipe tri-fournisseurs : Claude Opus 5 en SmartBee, GPT-5.6 Terra en WorkerBee, un modèle local en QuickBee (AFFIRMATION, 0.93)
- Terminal-Bench 2.1 —mesure→ la performance d'agents sur des tâches de terminal courtes, achevées en minutes (AFFIRMATION, 0.9)
- Long-Horizon Terminal-Bench —mesure→ la performance d'agents sur 44 tâches dont chacune représente des heures de travail (AFFIRMATION, 0.92)
- Harbor —permet→ d'exécuter ces benchmarks contre de vrais agents Buzz sur un relais live plutôt que sur un banc d'essai simplifié (AFFIRMATION, 0.91)
- Block —prédit→ que la supériorité de l'agent solo sur les tâches courtes pourrait s'inverser si les modèles sont entraînés à mieux collaborer (AFFIRMATION, 0.9)

---
Canonical: https://www.thekb.eu/de/fiches/patel-block-buzz-teams-tokens-benchmarks-2026-08-06/
