Ankündigung von **Meta AI Research**, veröffentlicht am **5. August 2026** (angegebene Lesezeit: 4 Minuten, kein individueller Autorenvermerk): **Muse Code** in der Beta-Phase, *„ein Terminal-Coding-Agent“*, sowie das Modell, das ihn antreibt, **Muse Spark 1.2**. Meta selbst ordnet die Markteinführung ein: *„Dies markiert unseren nächsten Schritt in Richtung der Frontier, mit größeren und deutlich leistungsfähigeren Modellen, die bereits in Vorbereitung sind.“* **Drei architektonische Elemente auf der Harness-Seite.** **Asynchrone Hintergrund-Agenten**, die *„während der gesamten Sitzung aktiv bleiben, statt für einzelne Aufgaben neu erzeugt zu werden“*, wodurch redundante Informationsbeschaffung vermieden und der Steuerungsbedarf verringert wird. Ein **lokales Ereignisprotokoll**, in dem *„jeder Modellaufruf, jede Tool-Ausführung, jede Genehmigung und jede Bearbeitung angehängt wird“*, wodurch die Laufzeitumgebung zu einem System wird, das *„replay-exakt und neustartsicher“* ist und nach einem Absturz genau dort fortsetzen kann, wo es aufgehört hat. Und **drei standardmäßig mitgelieferte Skills**: `/plan` (wandelt eine Aufgabe in einen zur Genehmigung vorgelegten Plan um), **`/grill`** (stellt den Plan auf die Probe, *„bis er standhält“*), und `/goal`. **Auf der Modellseite** beansprucht Meta ein **Co-Training von Modell und Harness** (*„um die Harness-Kompatibilität zu maximieren“*, wobei Harness-Trajektorien per Rejection Sampling erfasst werden und Rezeptoptimierungen für Ziele, Kompaktierung und Sub-Agenten vorgenommen werden), ein Training mit **langem Zeithorizont** (Generierung ganzer Repositories, End-to-End-Projekte, Selbstrecherche, mit Planung, Zielkonditionierung und Kontextkompaktierung) sowie eine **Selbstverbesserungsschleife**, in der Muse Spark 1.1 die Umgebungen und Anweisungsvorlagen generiert und anschließend die Kandidatenlösungen bewertet, wodurch ein Trainingsdatensatz für die 1.2 entsteht. **Was die veröffentlichten Diagramme zeigen**, ohne dass der Text dies kommentiert: Die vier Vergleiche — Terminal-Bench 2.1, DeepSWE 1.1, ein interner Meta-Benchmark und die Fallstudie zur GPU-Kernel-Optimierung — platzieren **Muse Spark 1.2 in allen vier Fällen hinter Opus 5**, einschließlich auf Metas eigenem proprietärem Benchmark (70,6 % gegenüber 79,4 %) und in der Fallstudie, in der das Modell auf dem vierten von sechs Plätzen landet (+68,7 % gegenüber +74,0 %). **Ein Vorbehalt zum Lesen des Versionsgewinns**: Bei den beiden öffentlichen Benchmarks wird 1.1 mit `mini-swe-agent` und 1.2 mit Muse Code gemessen, sodass die Differenz von 6,7 Punkten Modell- und Harness-Fortschritt vermischt. Beim internen Benchmark, dem einzigen Vergleich, bei dem keine Harness genannt wird, sinkt die Differenz zwischen 1.1 und 1.2 auf **2,3 Punkte**.
#Meta AI Research#Muse Code#Muse Spark 1.2
**Meta AI Research** — publication institutionnelle sans auteur nommé · sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation · non repris ici.
**Skill**-Eintrag: **hyperresearch** von **Jordan Gibbs** ist ein **Deep-Research-Harness**, das Claude Code in einen dokumentarischen Rechercheagenten verwandelt, ausgeliefert als PyPI-Paket (MIT, Python 3.11-3.13), das **20 Claude Code Skills**, eine CLI, einen MCP-Server und eine lokale Web-UI installiert. Stand **3. August 2026**: 1.568 Stars, 170 Forks, Repo erstellt am 9. April 2026, letzter Push am 1. August. **Der Kern ist eine 16-stufige, nach Tiers adaptive Pipeline** — `light` (~30-40 Min.), `full` (~1,5-2,5 Std.), `dissertation` (4-8 Std., 25.000-80.000 Wörter über 300-450 Quellen) — die einen Prompt entgegennimmt und einen adversarial geprüften Bericht mit vollständiger Provenienz zurückgibt. **Die zentrale Architekturentscheidung ist zusammen mit ihrem Fehlermodus dokumentiert**: Der Einstiegs-Skill ist ein **schlanker Router** ohne eigene Prozedur, wobei jeder Schritt in seinem eigenen Skill lebt, der **frisch im Moment seines Aufrufs** geladen wird, weil die Vorgängerversion *„ein einzelner 1200-Zeilen-Skill war, der komprimiert wurde, bevor Layer 4 seine Dreifachentwurf-Prozedur brauchte. Der Orchestrator vergaß die Prozedur, schrieb einen einzigen Entwurf und produzierte einen Bericht mit flacher Bewertung“* war. **Zwei tragende Prinzipien.** *„Patchen, niemals neu erzeugen“*: Nach der Synthese sind nur chirurgische `Edit`-Nachbesserungen möglich, wobei der Patcher und der Politur-Auditor auf Ebene der Claude-Code-Allowlist auf `[Read, Edit]` werkzeugseitig gesperrt sind, sodass sie *„physisch keinen neuen Entwurf schreiben können“*. *„Die kanonische Recherchefrage ist Gesetz“*: Der wortgetreue Prompt wird einmal in `query.md` persistiert und von jedem Schritt und jedem Subagenten erneut gelesen. **Sechzehn Subagenten** mit konfigurierbarer Rolle und Modell (Fetcher und Cite-Checker auf Sonnet, Kritiker, Synthesizer und Patcher auf Opus). **Der Vault** ist ein persistenter, in SQLite indizierter Markdown-Speicher — *„Markdown ist Wahrheit, SQLite ist Cache“* — mit einem Notiz-Lebenszyklus (`draft → review → evergreen`, `stale → deprecated → archive`), nachvollziehbarer Provenienz, einem zusammengesetzten Qualitätsscore (Quellentyp, Zitationsautorität via OpenAlex und Semantic Scholar mit Retraction-Flags, internem PageRank) und einem **Unabhängigkeitsaudit**, das syndizierte Kopien zusammenfasst — *„fünf Nachdrucke einer Pressemitteilung wiegen so viel wie eine Quelle“*. **Drei mechanische Schranken vor der Auslieferung**: Zitationsintegrität (jedes zitierte Zitat muss **wortgetreu** in einer Vault-Notiz existieren), ein bei jeder zitierten DOI aufgefrischter Retraction-Sweep und eine Zitat-zu-Satz-Verknüpfungsprüfung durch ein skeptisches LLM. **Zu markierender Vorbehalt**: Die Eingangsbehauptung — *„führt derzeit das DeepResearch-Bench-RACE-Ranking an“* — wird durch ihre eigene Fußnote widerlegt, *„zukunftsgerichtete Projektion aus einem stratifizierten Pilotversuch … Eine Drittvalidierung steht noch aus“*. Eine Projektion ist kein Ranking, dennoch platziert das Diagramm sie vor Gemini und OpenAI Deep Research.
#Skill#Deep Research#Research-Harness
**Jordan Gibbs** — auteur et mainteneur du dépôt `jordan-gibbs/hyperresearch`. Le projet est distribué sous **licence MIT** et publié sur **PyPI** (`pip install hyperresearch`). Signaux d'adoption au 3 août 2026 : **1 568 étoiles** · **170 forks** · 13 issues ouvertes · dépôt créé le **9 avril 2026** et poussé le **1er août 2026** — soit une traction rapide sur moins de quatre mois. Topics déclarés : `agents` · `agentskills` · `claude-code` · `deep-research` · `deep-research-agent`.