Zum Inhalt springen

root / tags / terminal-bench-2-1

#Terminal-Bench 2.1

4 Fiches

Architektur & Konstruktion Automatisch geprüfte Übersetzung

Buzz (buzz.xyz) — Rapport de recherche pour présentation

Interner Rechercheureport vom **12. August 2026**, der zu Präsentationszwecken alles öffentlich Dokumentierte über **Buzz** zusammenfasst — den Workspace für Menschen und Agenten von **Block**, der am **21. Juli 2026** unter der Lizenz **Apache 2.0** eingeführt wurde. Er aggregiert die beiden bereits veröffentlichten Engineering-Beiträge neben der Unternehmensankündigung, das GitHub-Repository, die Presseberichterstattung, X sowie **drei unabhängige Praxisberichte**, die die einzigen nicht selbst berichteten Daten des Dossiers darstellen. **(A) Eine durch Zitat dokumentierte Begriffslücke**: Der Launch-Tweet von **Jack Dorsey** kündigt *„model-agnostic, decentralized, self-sovereign, and open source“* an; Blocks `ARCHITECTURE.md` stellt fest: *„The relay is the single source of truth. All reads and writes flow through it. There is no peer-to-peer event exchange, no gossip, no replication.“* Der Relay ist somit pro Community einzig und maßgeblich: Buzz' „Dezentralisierung“ ist eine **organisatorische Souveränität** — Self-Hosting und portable Identität — keine Netzwerkredundanz. Formulierung von **TFTC**: *„Two of those three hold cleanly. The third needs a qualifier.“* **(B) Eine Asymmetrie zwischen nachgewiesener Rigorosität und Ausnutzungsrisiko.** Auf der einen Seite ein für ein v0.4.x/0.5.x seltenes Maß an Formalismus: Spezifikation der Mandanten-Isolation **mechanisiert in TLA+**, in **Tamarin** verifizierte Autorisierungseigenschaften, ein modellgeprüftes Git-Speicherprotokoll, ein hash-verkettetes Append-only-Audit-Log, 127 *event kinds*, NIP-01/42/98/34. Auf der anderen Seite ist Kanalmitgliedschaft die Berechtigungseinheit — *„channel membership is not fine-grained tool authorization“* (João Queirós) —, Agenten laufen in `--dangerously-skip-permissions` außerhalb jeder Sandbox auf der Maschine eines Menschen, und die Beobachtbarkeit fehlt: *„Buzz tells me an agent got a message. It doesn't tell me what happens next“* (DevTools Daily, das stille OOM-Kills berichtet). Block räumt es ein: *„the agent can do anything, and security rests entirely on restricting who can tell it what to do“*. **(C) Der technische Stack**, der in den veröffentlichten Beiträgen fehlt: **Rust**-Relay (Axum WS + REST), **Postgres**, **Redis**, **S3/MinIO** via Blossom, Desktop-Client **Tauri + React**. Die Agentenintegration erfolgt über **`buzz-acp`**, ein **ACP**-Harness, das goose, Codex und Claude Code einbindet und **ACP ↔ MCP** übersetzt, sowie **`buzz-agent`**, einen hauseigenen Agenten. Der Report korrigiert sich an einem Punkt selbst: Die *„+33% more work“* in Blocks TL;DR sind das **Verhältnis abgeschlossener Aufgaben (20 gegenüber 15 von 44)**, kein Punktzahlgewinn — die Punktzahl selbst steigt von 59,1 % auf 71,5 %, also **+12,4 Punkte**.

#Buzz#buzz.xyz#Block

**Deep Research Veille Interne** — rapport non signé · produit le **12 août 2026** en préparation d'une présentation. Aucune URL publique ; source archivée dans `raw-data/`.

KI-Coding-Agenten & Skills Automatisch geprüfte Übersetzung

Efficient Tokens & Effective Teams in Buzz

Ein **Block-Engineering**-Benchmark-Beitrag vom **6. August 2026**, verfasst von **Atish Patel**, über **Buzz** – den am 21. Juli gestarteten Workspace für Mensch und Agent – der eine Kostenfrage stellt: Welches Agententeam ist **das günstigste, das zuverlässig erfolgreich ist**? Drei Befunde. **(A) Ein vollständig veröffentlichtes negatives Ergebnis**: Auf **Terminal-Bench 2.1** wurden **zwölf Teamzusammensetzungen** (Paare, Triaden, günstige Schwärme unter einem *Frontier*-Modell) gegen den jeweiligen Solo-Agenten antreten lassen, um den sie herum gebaut waren, und **keine schlug ihn bei gleichen Kosten**. Die Erklärung ist struktureller Natur – einer Aufgabe, die in Minuten erledigt ist, *„fehlt genug Struktur, um sie aufzuteilen"*, und *„mehr Agenten kaufen meist nur die Kosten, es zweimal zu erklären"*. **(B) Der Zeithorizont kehrt das Ergebnis um**: Auf **Long-Horizon Terminal-Bench** (44 Aufgaben, eine Aufgabe im Wert von Stunden Arbeit, gleicher Lead **GPT-5.6 Sol** mit *high*-Aufwand) schließt Solo 15 Aufgaben ab bei 59,1 %, +2 QuickBees 19 bei 64,1 %, +1 QuickBee +1 WorkerBee 19 bei 69,5 %, **+2 WorkerBees 20 bei 71,5 %** – ein Zugewinn von **+12,4 Punkten**, wovon 11,4 aus abgeschlossenen Aufgaben stammen. *„Gleiche Plätze, umgekehrtes Ergebnis, weil die Arbeit eine andere Form hat."* Diese Durchläufe liefen mit dem **3-fachen Timeout**, Solo eingeschlossen. **(C) Jenseits einer Schwelle kauft der Preis keine Qualität mehr**: Solo auf Terminal-Bench 2.1, **Opus 5 mit *xhigh*-Aufwand ist der teuerste Durchlauf (140,63 $) bei 75,0 %**, hinter sechs Durchläufen zwischen 20,08 $ und 109,82 $ und 79,5 % bis 88,4 % – als Ursache wird Over-Reasoning genannt, das 17 von 88 Aufgaben in den Timeout trieb. Unter den sechs besten Durchläufen liegt **eine 5,5-fache Preisspanne bei einer Punktzahldifferenz von 8,9 Punkten**: *„die Wahl zwischen ihnen ist überhaupt keine Qualitätsentscheidung. Es ist eine Budgetentscheidung."* Der Beitrag schlägt eine Taxonomie vor, die er selbst als *ad hoc* bezeichnet – **QuickBee**, **WorkerBee**, **SmartBee**, dazu der Mensch als *„Ehrenbiene"* – sowie zwei Teamformen: die permanente **Hive**, die sich die Präferenzen der Nutzenden merkt, und der einmalige **Swarm**, der sich das Projekt merkt. Rahmenbedingungen: alles läuft auf **Harbor**, gegen echte Buzz-Agenten auf einem **Live**-Relay, **ein Versuch pro Aufgabe, kein Retry**, Preise festgeschrieben zum **30.07.2026**.

#Buzz#Block#Agententeams

- **Atish Patel** — *« Building AI solutions @ Block »* · auteur unique du billet · publié le **6 août 2026** sur `engineering.block.xyz`.

KI-Coding-Agenten & Skills Automatisch geprüfte Übersetzung

Introducing Muse Code and Muse Spark 1.2

Ankündigung von **Meta AI Research**, veröffentlicht am **5. August 2026** (angegebene Lesezeit: 4 Minuten, kein individueller Autorenvermerk): **Muse Code** in der Beta-Phase, *„ein Terminal-Coding-Agent“*, sowie das Modell, das ihn antreibt, **Muse Spark 1.2**. Meta selbst ordnet die Markteinführung ein: *„Dies markiert unseren nächsten Schritt in Richtung der Frontier, mit größeren und deutlich leistungsfähigeren Modellen, die bereits in Vorbereitung sind.“* **Drei architektonische Elemente auf der Harness-Seite.** **Asynchrone Hintergrund-Agenten**, die *„während der gesamten Sitzung aktiv bleiben, statt für einzelne Aufgaben neu erzeugt zu werden“*, wodurch redundante Informationsbeschaffung vermieden und der Steuerungsbedarf verringert wird. Ein **lokales Ereignisprotokoll**, in dem *„jeder Modellaufruf, jede Tool-Ausführung, jede Genehmigung und jede Bearbeitung angehängt wird“*, wodurch die Laufzeitumgebung zu einem System wird, das *„replay-exakt und neustartsicher“* ist und nach einem Absturz genau dort fortsetzen kann, wo es aufgehört hat. Und **drei standardmäßig mitgelieferte Skills**: `/plan` (wandelt eine Aufgabe in einen zur Genehmigung vorgelegten Plan um), **`/grill`** (stellt den Plan auf die Probe, *„bis er standhält“*), und `/goal`. **Auf der Modellseite** beansprucht Meta ein **Co-Training von Modell und Harness** (*„um die Harness-Kompatibilität zu maximieren“*, wobei Harness-Trajektorien per Rejection Sampling erfasst werden und Rezeptoptimierungen für Ziele, Kompaktierung und Sub-Agenten vorgenommen werden), ein Training mit **langem Zeithorizont** (Generierung ganzer Repositories, End-to-End-Projekte, Selbstrecherche, mit Planung, Zielkonditionierung und Kontextkompaktierung) sowie eine **Selbstverbesserungsschleife**, in der Muse Spark 1.1 die Umgebungen und Anweisungsvorlagen generiert und anschließend die Kandidatenlösungen bewertet, wodurch ein Trainingsdatensatz für die 1.2 entsteht. **Was die veröffentlichten Diagramme zeigen**, ohne dass der Text dies kommentiert: Die vier Vergleiche — Terminal-Bench 2.1, DeepSWE 1.1, ein interner Meta-Benchmark und die Fallstudie zur GPU-Kernel-Optimierung — platzieren **Muse Spark 1.2 in allen vier Fällen hinter Opus 5**, einschließlich auf Metas eigenem proprietärem Benchmark (70,6 % gegenüber 79,4 %) und in der Fallstudie, in der das Modell auf dem vierten von sechs Plätzen landet (+68,7 % gegenüber +74,0 %). **Ein Vorbehalt zum Lesen des Versionsgewinns**: Bei den beiden öffentlichen Benchmarks wird 1.1 mit `mini-swe-agent` und 1.2 mit Muse Code gemessen, sodass die Differenz von 6,7 Punkten Modell- und Harness-Fortschritt vermischt. Beim internen Benchmark, dem einzigen Vergleich, bei dem keine Harness genannt wird, sinkt die Differenz zwischen 1.1 und 1.2 auf **2,3 Punkte**.

#Meta AI Research#Muse Code#Muse Spark 1.2

**Meta AI Research** — publication institutionnelle sans auteur nommé · sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation · non repris ici.

Wirtschaft & Markt Automatisch geprüfte Übersetzung

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

SFEIR-Analyse (aus Sicht des Unternehmens) der allgemeinen Verfügbarkeit von **GPT-5.6** durch OpenAI ab dem 9. Juli 2026 — kein einzelnes Modell, sondern eine **Familie aus drei Stufen**: **Sol** (Flaggschiff für Langzeit-/Cyber-/Wissenschaftsaufgaben, als einziges Modell mit Zugang zu den Modi „max" und „ultra"), **Terra** (ausgewogene Alltagsstufe, ~halber Preis von GPT-5.5) und **Luna** (schnell/wirtschaftlich, für hohes Volumen). Alle drei teilen sich ~**1,05 Mio. Token** Kontext, **128k** Ausgabe-Token und einen Wissensstand vom **16. Februar 2026**. Die strukturbestimmendste Tatsache ist kein Score, sondern ein **aggressives Preisraster** (Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$ pro Million Token): Sol behält den Preis des vorherigen Flaggschiffs bei und ist dabei leistungsfähiger, was den Vergleich auf das **Verhältnis von Leistungsfähigkeit zu Kosten** verlagert. Zwei Abrechnungsfeinheiten (Cache-Schreibvorgänge werden mit **1,25×** berechnet, ein Aufschlag jenseits von **272k** Token) machen das Raster irreführend, solange nicht gemessen wurde, wie viel Kontext der Agent erneut liest (Lese-/Schreibverhältnis ~**153:1** beim agentischen Coding). Urteil des Ingenieurs, das als neutral beansprucht wird (SFEIR ist sowohl **Google Cloud Premier**-Partner *als auch* **Anthropic**-Partner): **niemand räumt alle Tabellen ab** — GPT-5.6 dominiert Terminal-Bench 2.1 und den Coding Agent Index (zu einem Drittel der Kosten pro Aufgabe), Claude bleibt bei SWE-Bench Pro vorn (~15 Punkte); METR meldete eine rekordverdächtige **Reward-Hacking**-Rate bei Sol. Fazit: „hört auf, den Champion zu suchen, lernt zu routen" — das Modell ist eine Commodity, der dauerhafte Vorteil liegt im **Context/Harness Engineering**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)