Annonce de **Meta AI Research** publiée le **5 août 2026** (lecture annoncée : 4 minutes, aucune signature individuelle) : **Muse Code** en bêta, *« a terminal coding agent »*, et le modèle qui l'anime, **Muse Spark 1.2**. Meta situe elle-même le lancement : *« This marks our next step toward the frontier, with larger and much more capable models on the way. »* **Trois éléments d'architecture côté harnais.** Des **agents d'arrière-plan asynchrones** qui *« remain active throughout each session, rather than being spawned for individual tasks »*, afin d'éviter la collecte d'information redondante et de réduire le besoin de pilotage. Un **journal d'événements local** où *« every model call, tool run, approval, and edit is appended »*, faisant du runtime un système *« replay-exact and restart-safe »* capable de reprendre exactement où il s'est arrêté après un plantage. Et **trois skills livrées d'origine** : `/plan` (transforme une tâche en plan soumis à approbation), **`/grill`** (met le plan à l'épreuve *« until it holds up »*) et `/goal`. **Côté modèle**, Meta revendique un **co-entraînement du modèle avec le harnais** (*« to maximize harness compatibility »*, avec trajectoires de harnais échantillonnées par rejet et optimisations de recette pour les buts, la compaction et les sous-agents), un entraînement **long-horizon** (génération de dépôt entier, projets bout-en-bout, auto-recherche, avec planification, conditionnement par le but et compaction de contexte), et une **boucle d'auto-amélioration** où Muse Spark 1.1 génère les environnements et les gabarits d'instructions puis note les solutions candidates, produisant un jeu d'entraînement pour la 1.2. **Ce que montrent les graphiques publiés**, sans que le texte le commente : les quatre comparatifs — Terminal-Bench 2.1, DeepSWE 1.1, un benchmark interne Meta, et l'étude de cas d'optimisation de noyaux GPU — placent **Muse Spark 1.2 derrière Opus 5 dans les quatre cas**, y compris sur le benchmark propriétaire de Meta (70,6 % contre 79,4 %) et sur l'étude de cas, où le modèle finit quatrième sur six (+68,7 % contre +74,0 %). **Précaution de lecture sur le gain de version** : sur les deux benchmarks publics, la 1.1 est mesurée avec `mini-swe-agent` et la 1.2 avec Muse Code, de sorte que l'écart de 6,7 points mélange modèle et harnais. Sur le benchmark interne, seul comparatif où aucun harnais n'est mentionné, l'écart 1.1 → 1.2 tombe à **2,3 points**.
#Meta AI Research#Muse Code#Muse Spark 1.2
**Meta AI Research** — publication institutionnelle sans auteur nommé · sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation · non repris ici.
Fiche de **Skill** : **hyperresearch** de **Jordan Gibbs** est un **harnais de deep research** qui transforme Claude Code en agent de recherche documentaire, livré comme paquet PyPI (MIT, Python 3.11-3.13) installant **20 skills Claude Code**, une CLI, un serveur MCP et une UI web locale. Observé le **3 août 2026** : 1 568 étoiles, 170 forks, dépôt créé le 9 avril 2026, dernier push le 1er août. **Le cœur est un pipeline en 16 étapes adaptatif par paliers** — `light` (~30-40 min), `full` (~1,5-2,5 h), `dissertation` (4-8 h, 25 000-80 000 mots sur 300-450 sources) — qui prend un prompt et rend un rapport audité de façon adverse avec provenance complète. **La décision d'architecture centrale est documentée avec son mode d'échec** : la skill d'entrée est un **routeur mince** sans procédure, chaque étape vivant dans sa propre skill chargée **fraîche au moment de son invocation**, parce que la version précédente était *« one 1200-line skill that got compacted away by the time Layer 4 needed its triple-draft procedure. The orchestrator forgot the procedure, wrote a single draft, and produced a flat-scoring report. »* **Deux principes porteurs.** *« Patch, never regenerate »* : après la synthèse, seules des retouches chirurgicales `Edit` sont possibles, le patcheur et l'auditeur de polissage étant verrouillés à `[Read, Edit]` au niveau de l'allowlist Claude Code, si bien qu'ils *« physically cannot Write a new draft »*. *« Canonical research query is gospel »* : le prompt verbatim est persisté une fois dans `query.md` et relu par chaque étape et chaque sous-agent. **Seize sous-agents** au rôle et au modèle configurables (fetchers et cite-checker en Sonnet, critiques, synthétiseur et patcheur en Opus). **Le vault** est un magasin markdown persistant indexé en SQLite — *« Markdown is truth, SQLite is cache »* — avec cycle de vie des notes (`draft → review → evergreen`, `stale → deprecated → archive`), provenance traçable, score de qualité composite (type de source, autorité de citation via OpenAlex et Semantic Scholar avec indicateurs de rétractation, PageRank interne) et **audit d'indépendance** regroupant les copies syndiquées — *« five reprints of one press release argue with the weight of one source »*. **Trois gates mécaniques avant expédition** : intégrité des citations (toute citation entre guillemets doit exister **verbatim** dans une note du vault), balayage de rétractation rafraîchi sur chaque DOI cité, et vérification des liaisons citation-phrase par un LLM sceptique. **Réserve à porter** : la promesse d'ouverture — *« currently leads the DeepResearch-Bench RACE leaderboard »* — est contredite par sa propre note de bas de page, *« forward-looking projection from a stratified pilot… Third party validation is pending »*. Une projection n'est pas un classement, et le graphique la présente pourtant devant Gemini et OpenAI Deep Research.
#skill#deep research#harnais de recherche
**Jordan Gibbs** — auteur et mainteneur du dépôt `jordan-gibbs/hyperresearch`. Le projet est distribué sous **licence MIT** et publié sur **PyPI** (`pip install hyperresearch`). Signaux d'adoption au 3 août 2026 : **1 568 étoiles** · **170 forks** · 13 issues ouvertes · dépôt créé le **9 avril 2026** et poussé le **1er août 2026** — soit une traction rapide sur moins de quatre mois. Topics déclarés : `agents` · `agentskills` · `claude-code` · `deep-research` · `deep-research-agent`.