Ein Block-Benchmark-Beitrag von Atish Patel, veröffentlicht am 6. August 2026, der an den Buzz-Launch anknüpft: Da das Zusammenstellen eines Agententeams dort trivial geworden ist, stellt sich die Frage, welches das günstigste ist, das zuverlässig erfolgreich ist.
Erst das Vokabular. Der Beitrag schlägt vier Stufen vor: QuickBee (schnell und günstig – Builds, Screenshots, Tests, Erst-Triage: GPT-5.6 Luna, DeepSeek V4 Flash, lokale Modelle, mit hohem Aufwand betrieben), WorkerBee (vielseitig, übernimmt unbeaufsichtigt einen vollständigen Teilbereich: GPT-5.6 Terra, Gemini 3.6 Flash, offene Modelle), SmartBee (Gesamtbild, Abwägungen, Eskalationen: Claude Opus 5, Kimi K3, GPT-5.6 Sol, mit medium-Aufwand), sowie der Mensch, „die teuerste Biene im Team, und die langsamste. Aber immer noch die klügste". Zwei Teamformen: die permanente Hive, die sich die Präferenzen der Nutzenden merkt, und der einmalige Swarm, der sich das Projekt merkt und danach verschwindet.
Das Solo-Ergebnis. Auf Terminal-Bench 2.1 ist die Erhöhung des Aufwands eines günstigen Modells der beste Kauf: Luna steigt von 1,61 $ / 57,3 % (medium) auf 4,98 $ / 75,0 % (high). Am anderen Ende ist Opus 5 mit xhigh-Aufwand der teuerste Durchlauf (140,63 $) und erreicht nur 75,0 %, nachdem durch Over-Reasoning bei 17 von 88 Aufgaben der Timeout erreicht wurde. Unter den sechs besten Durchläufen: eine 5,5-fache Preisspanne bei einer Punktzahldifferenz von 8,9 Punkten. Fazit: „die Wahl zwischen ihnen ist überhaupt keine Qualitätsentscheidung. Es ist eine Budgetentscheidung."
Das Teamergebnis, in zwei Akten. Auf Terminal-Bench 2.1 wurden zwölf Zusammensetzungen getestet, und keine schlug Solo bei gleichen Kosten – einer kurzen Aufgabe fehlt die Struktur, um sie aufzuteilen. Auf Long-Horizon Terminal-Bench (44 mehrstündige Aufgaben, Lead GPT-5.6 Sol, 3-facher Timeout) zeigt sich die Umkehrung deutlich: Solo 15 Aufgaben / 59,1 %, +2 WorkerBees 20 / 71,5 % – +12,4 Punkte, wovon 11,4 aus zusätzlich abgeschlossenen Aufgaben stammen. Das Team kostet pro Aufgabe mehr, was sich auszahlt, „wenn die Alternative ein Mensch ist, der unfertige Arbeit übernehmen muss".
Die Betriebsregel. Eskalationen von Workern werden an einen SmartBee-Koordinator geleitet statt an den Menschen: „jede Unklarheit wird zu einer Benachrichtigung" ist der eigentliche Fehlermodus. Ein Block-Ingenieur berichtet von über 2.000 migrierten Apps mit einem Swarm (Koordinator, 1–10 Migratoren, unabhängiger Verifizierer), wobei der Koordinator menschliche Antworten im Gedächtnis speichert.
Vorbehalte: n=1 pro Aufgabe, kein Konfidenzintervall, Teamkosten nicht veröffentlicht, sowie ein Eingeständnis – „das könnte sich ändern, wenn Modelle für bessere Zusammenarbeit trainiert werden."
Kernpunkte
Datum/Quelle.6. August 2026, engineering.block.xyz, verfasst von Atish Patel. Messungen auf Harbor, echte Buzz-Agenten auf einem Live-Relay, ein Versuch pro Aufgabe, kein Retry, Preise Stand 30.07.2026.
Zentrale Rahmung. Die gestellte Frage lautet nicht „welches das beste Team ist", sondern „welches das günstigste ist, das zuverlässig erfolgreich ist". Alle Befunde folgen daraus. ### Negatives Ergebnis bei kurzen Aufgaben Auf Terminal-Bench 2.1 wurden zwölf Zusammensetzungen — Paare, Triaden, günstige Schwärme unter einem Frontier-Lead — gegen den jeweiligen Solo-Agenten antreten lassen, um den sie herum gebaut waren: keine schlug ihn bei gleichen Kosten. Der angegebene Grund ist struktureller Natur: einer Aufgabe, die in Minuten erledigt ist, fehlt die Struktur, um sie aufzuteilen, und „Mehr Agenten kaufen meist nur die Kosten, es zweimal zu erklären." Daraus resultierende Regel: für kurze, klar spezifizierte Arbeit kein Team zusammenstellen. Empirisches Gegengewicht zum Launch-Beitrag [[longwell-block-buzz-workspace-agents-nostr-2026-07-21]]. ### Der Zeithorizont kehrt das Ergebnis um Long-Horizon Terminal-Bench, 44 Aufgaben, Lead GPT-5.6 Sol mit high-Aufwand für alle Aufstellungen: | Aufstellung | Abgeschlossene Aufgaben /44 | Score | |---|---|---| | SmartBee solo | 15 | 59,1 % | | + 2 QuickBees | 19 | 64,1 % | | + 1 QuickBee + 1 WorkerBee | 19 | 69,5 % | | + 2 WorkerBees | 20 | 71,5 % | +12,4 Punkte, wovon 11,4 zusätzlich abgeschlossene Aufgaben sind: Das Team leistet nicht mehr, es bringt die Aufgabe zu Ende. Drei Vorbehalte: Durchläufe mit 3-fachem Timeout (Solo eingeschlossen), Teamkosten nicht veröffentlicht, n=1 pro Aufgabe. Vom Beitrag vorgeschlagenes Entscheidungskriterium: Das Team lohnt seine Mehrkosten, „wenn die Alternative ein Mensch ist, der unfertige Arbeit übernehmen muss". ### Die Grenze abnehmender Erträge beim Preis Solo auf Terminal-Bench 2.1, Opus 5 mit xhigh-Aufwand = 140,63 $ bei 75,0 %, der teuerste Durchlauf, hinter sechs Durchläufen zwischen 20,08 $ und 109,82 $ (79,5 % bis 88,4 %). Angegebene Ursache: Over-Reasoning, wobei 17 von 88 Aufgaben in den Timeout liefen. Dies ist in erster Linie ein Artefakt der Laufzeit — eine Eigenschaft der Kombination aus Modell × Harness × Timeout, kein Maß für die rohe Fähigkeit. Was handlungsrelevant bleibt: „Mehr zu zahlen hilft ab einem Punkt nicht mehr, sondern schadet", und eine SmartBee mit medium-Aufwand genügt für die meisten Aufgaben. Unter den sechs besten Durchläufen: eine 5,5-fache Preisspanne bei einer Punktzahldifferenz von 8,9 Punkten, was der Beitrag bei dieser Stichprobengröße als Gleichstand behandelt. „Alles von Terra mit medium-Aufwand aufwärts ist für diese Aufgaben derselbe Agent, soweit erkennbar. Das ist eine gute Nachricht, denn es bedeutet, dass die Wahl zwischen ihnen überhaupt keine Qualitätsentscheidung ist. Es ist eine Budgetentscheidung." Geltungsbereich beschränkt auf diesen Benchmark, diese Preise und diesen Harness. ### Reasoning-Aufwand: der Trade-off kehrt sich je nach Stufe um Bei einem günstigen Modell ist die Erhöhung des Aufwands der beste Kauf: Luna medium = 1,61 $ / 57,3 % → Luna high = 4,98 $ / 75,0 %. Bei einem Frontier-Modell kostet die Erhöhung des Aufwands mehr und verschlechtert das Ergebnis. | Stufe | Empfohlener Aufwand | Arbeit | Genannte Beispiele | |---|---|---|---| | QuickBee | max / xhigh / high | Builds, Screenshots, Testsuite, Erst-Triage | GPT-5.6 Luna, DeepSeek V4 Flash, lokale Modelle | | WorkerBee | high / xhigh | ein vollständiger End-to-End-Teilbereich, unbeaufsichtigt | GPT-5.6 Terra, Gemini 3.6 Flash, offene Modelle | | SmartBee | medium | Gesamtbild, Abwägungen, Aufnahme von Eskalationen | Claude Opus 5, Kimi K3, GPT-5.6 Sol | | Mensch | — | „Die teuerste Biene im Team, und die langsamste. Aber immer noch die klügste." | — | Der Umkehrpunkt hängt von den lokalen Timeouts ab: vor einer Verallgemeinerung erneut testen. ### Hive oder Swarm: Was soll sich das Team merken?
Hive. — ein permanentes Team benannter Agenten, jeder mit einer Rolle und einer Erinnerung an die eigenen Präferenzen. Kumulatives Argument: „Beim zweiten Mal, wenn sie den Code eines Kollegen reviewt, weiß sie, welche Kleinigkeiten abgewinkt werden. Beim zehnten Mal geht das Briefing schneller als das Briefing einer Person."Swarm — ein einmaliges Team für ein Projekt mit Anfang und Ende (Migration, Framework-Upgrade, großes Refactoring), das eine Erinnerung an das Projekt aufbaut und danach gelöscht wird. Auswahlkriterium: Soll sich das Subjekt an die Person oder an das Projekt erinnern? Angenommene Voraussetzung: Der Agent ist ein Sitzplatz, keine Sitzung — Name, Persona, Gedächtnis, eigene Präsenz im Kanal. ### Eskalationstopologie Diagnose: „Der Fehlermodus von Agenten-Tooling ist nicht, dass die Arbeit schlecht ist, sondern dass jede Unklarheit zu einer Benachrichtigung wird." Der SmartBee-Koordinator übernimmt die Routine (flakiger Test, mehrdeutiger Import, verschobene Konfiguration) und schreibt menschliche Antworten ins Gedächtnis, sodass die Aufsicht über den Swarm mit der Zeit günstiger wird. „Der Mensch hört auf, Middleware zu sein, und wird wieder zum letzten Reviewer." Prüffrage für jedes Multi-Agenten-Tool: Wohin gehen Eskalationen, und lernt das Tool aus den Antworten? ### Erfahrungsbericht zur Migration Leigh Maddock, Engineer @ Block: „Ich habe über 2000 Apps/Projekte mit Buzz und einem Swarm von Agenten migriert", mit 1 Koordinator, 1 bis 10 parallelen Migratoren und 1 unabhängigem Verifizierer, wobei der Koordinator den Großteil der Eskalationen übernahm. Erfahrungsbericht, keine Messung: keine Dauer, keine Kosten, keine Fehlerrate, keine Definition von „migriert". Das Muster bleibt übertragbar — dieselbe Form wie die One-Shot-Minions, beschrieben in [[gray-stripe-minions-coding-agents-part1-2026-02-09]], ergänzt um den unabhängigen Verifizierer und das Eskalationsgedächtnis. ### Einsatzfertige Zusammensetzungen | Fall | Zusammensetzung | |---|---| | PR-Review | SmartBee, die den PR reviewt + QuickBee, die lokal baut und Screenshots erstellt | | Triage flakiger Tests | QuickBee, die Tests erneut laufen lässt und Belege sammelt + SmartBee, die entscheidet | | Kurze Arbeit | ein einzelner Agent, gegebenenfalls eine QuickBee für verwandte, aber unterschiedliche Aufgaben | Gemeinsamer Nenner: Die teure Stufe liest und entscheidet, die günstige Stufe führt aus und sammelt Belege. ### Kommerzielle Positionierung Buzz akzeptiert Claude Code- und Codex-Abonnements, offene Modelle und lokale Modelle: „Man ist nicht an einen Anbieter gebunden oder gezwungen, aus Bequemlichkeit jede Aufgabe dem teuersten Modell zu geben." Die vorgeschlagene Standardzusammensetzung ist explizit dreianbieterübergreifend. Die These „das beste Modell ist nicht immer das richtige" trifft zu und ist kommerziell nützlich für alle, die den Teil statt das Modell verkaufen. Siehe auch [[paymentsdive-block-dorsey-pricing-ia-2026-08-06]]. ### Versuchsbedingungen, zur Übernahme bei Wiederholung Harbor; echte Buzz-Agenten auf einem Live-Relay („Keines der folgenden Ergebnisse wurde auf einem abgespeckten Testaufbau gemessen"); ein Versuch pro Aufgabe, kein Retry, mit Timeouts; LHTB mit 3-fachem Timeout, Solo eingeschlossen; Preise Stand 30.07.2026; Kimi K3 und DeepSeek V4 Flash unterstützen keinen medium-Aufwand. Kein Konfidenzintervall, n=1 — der Beitrag selbst räumt den Gleichstand unter sechs Durchläufen als Stichprobengrößeneffekt ein. Diese Zahlen sind als Größenordnungen zu verstehen.
Kernzahlen
Keine der zwölf getesteten Teamzusammensetzungen auf Terminal-Bench 2.1 übertraf den äquivalenten Solo-Agenten im Preis-Leistungs-Verhältnis
Bei Long-Horizon Terminal-Bench schließt ein Team aus SmartBee + 2 WorkerBees 20 von 44 Aufgaben mit 71,5 % ab, gegenüber 15 Aufgaben und 59,1 % für die SmartBee solo
Claude Opus 5 mit Effort xhigh ist der teuerste Solo-Run von Terminal-Bench 2.1 mit 140,63 Dollar für 75,0 %, unter sechs abgerechneten Runs von 20,08 bis 109,82 Dollar
Jenseits einer bestimmten Stufe sind Modelle bei diesen Aufgaben nicht mehr unterscheidbar, sodass die Wahl zwischen ihnen keine Qualitäts-, sondern eine Budgetentscheidung ist
— Block
Eine kurze Aufgabe hat nicht genug Struktur, um aufgeteilt zu werden, und das Hinzufügen von Agenten kauft nur die Kosten ein, sie zweimal zu erklären
— Block
plus de 2 000 apps et projets ont été migrés chez Block avec un Swarm composé d'un coordinateur, de 1 à 10 migrateurs parallèles et d'un vérificateur indépendant
— Leigh Maddock
Der aus dieser Fiche extrahierte Wissensgraph — 14 Entitäten, 28 Relationen.
In diesem Graphen :QuickBee · WorkerBee · SmartBee · Hive · Swarm · escalade agent-vers-agent · Terminal-Bench 2.1 · Long-Horizon Terminal-Bench · Harbor · Claude Opus 5 · GPT-5.6 Luna · Buzz · Atish Patel · Leigh Maddock