Aller au contenu

root / tags / goal

#/goal

3 fiches

Introducing Muse Code and Muse Spark 1.2

Annonce de **Meta AI Research** publiée le **5 août 2026** (lecture annoncée : 4 minutes, aucune signature individuelle) : **Muse Code** en bêta, *« a terminal coding agent »*, et le modèle qui l'anime, **Muse Spark 1.2**. Meta situe elle-même le lancement : *« This marks our next step toward the frontier, with larger and much more capable models on the way. »* **Trois éléments d'architecture côté harnais.** Des **agents d'arrière-plan asynchrones** qui *« remain active throughout each session, rather than being spawned for individual tasks »*, afin d'éviter la collecte d'information redondante et de réduire le besoin de pilotage. Un **journal d'événements local** où *« every model call, tool run, approval, and edit is appended »*, faisant du runtime un système *« replay-exact and restart-safe »* capable de reprendre exactement où il s'est arrêté après un plantage. Et **trois skills livrées d'origine** : `/plan` (transforme une tâche en plan soumis à approbation), **`/grill`** (met le plan à l'épreuve *« until it holds up »*) et `/goal`. **Côté modèle**, Meta revendique un **co-entraînement du modèle avec le harnais** (*« to maximize harness compatibility »*, avec trajectoires de harnais échantillonnées par rejet et optimisations de recette pour les buts, la compaction et les sous-agents), un entraînement **long-horizon** (génération de dépôt entier, projets bout-en-bout, auto-recherche, avec planification, conditionnement par le but et compaction de contexte), et une **boucle d'auto-amélioration** où Muse Spark 1.1 génère les environnements et les gabarits d'instructions puis note les solutions candidates, produisant un jeu d'entraînement pour la 1.2. **Ce que montrent les graphiques publiés**, sans que le texte le commente : les quatre comparatifs — Terminal-Bench 2.1, DeepSWE 1.1, un benchmark interne Meta, et l'étude de cas d'optimisation de noyaux GPU — placent **Muse Spark 1.2 derrière Opus 5 dans les quatre cas**, y compris sur le benchmark propriétaire de Meta (70,6 % contre 79,4 %) et sur l'étude de cas, où le modèle finit quatrième sur six (+68,7 % contre +74,0 %). **Précaution de lecture sur le gain de version** : sur les deux benchmarks publics, la 1.1 est mesurée avec `mini-swe-agent` et la 1.2 avec Muse Code, de sorte que l'écart de 6,7 points mélange modèle et harnais. Sur le benchmark interne, seul comparatif où aucun harnais n'est mentionné, l'écart 1.1 → 1.2 tombe à **2,3 points**.

#Meta AI Research#Muse Code#Muse Spark 1.2

**Meta AI Research** — publication institutionnelle sans auteur nommé · sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation · non repris ici.

Transformation & Adoption

Steps of AI Adoption (tableau/artifact + post LinkedIn « I talk to engineers at other companies every day… »)

**Boris Cherny** (Creator & Head of Claude Code @Anthropic) publie sur LinkedIn un tableau-framework, **« Steps of AI Adoption »**, qui cartographie l'adoption de l'IA agentique par une équipe d'ingénierie en **5 étapes (0→4)**, chacune caractérisée par un **ordre de grandeur d'agents pilotés** et une **transformation du rôle de l'ingénieur** : **0 Gated** (0 agent, accès verrouillé), **1 Assisted** (~1 agent — « vous + un agent », pair programming supervisé), **2 Parallel** (~10 agents — **orchestrateur**), **3 Supervised autonomy** (~100 agents — **manager de managers**, un arbre org), **4 AI-native** (~1 000+ agents — **VP qui pilote par l'intention**). Le tableau croise cinq colonnes : nombre d'agents, *à quoi ça ressemble*, *le goulet d'étranglement*, *les produits qui aident*, *les garde-fous*. **Thèse centrale** : consommer plus de tokens ne fait pas monter d'un cran — pour passer à l'étape suivante il faut **identifier et casser le prochain goulet d'étranglement** ET **bâtir le prochain jeu de garde-fous**. Concrètement : donner à Claude une **boucle d'auto-vérification** de confiance (tests + build + lint + e2e sur un vrai environnement), activer l'**Auto mode** (éviter les prompts de permission bloquants), passer **code review et security review par défaut**, adopter des interfaces multi-agents (Agent view CLI, Desktop, apps iOS/Android, Tag), puis `/loop`, `/batch`, `/goal`, **dynamic workflows** et **worktree isolation** pour subagents. Sur le pilotage : l'usage (dashboard) mesure l'**activité, pas le retour** ; la bonne question est *« aurait-on de toute façon dépensé de l'effort d'ingénierie là-dessus ? si oui, combien d'heures-ingénieur manuelles cela aurait-il coûté ? »* — voilà le ROI. Le vrai gain arrive quand **corriger et maintenir se fait en arrière-plan** et que les équipes se concentrent sur *construire*. Anthropic se situe à l'**étape 3, en route vers 4** ; Boris Cherny déclare avoir personnellement atteint le **niveau 4**.

#Boris Cherny#Claude Code#Anthropic

Boris Cherny (Creator & Head of Claude Code @Anthropic)

Loop Engineering: The Guide for AI Agents

Guide technique approfondi (blog d'agence Lushbinary) sur le **Loop Engineering** : concevoir les systèmes qui pilotent les agents de codage en boucle, plutôt que de les prompter manuellement. Couvre la filiation prompt → context → loop engineering, la technique Ralph (Geoffrey Huntley), les **cinq briques + la mémoire** d'une boucle, leur implémentation dans Claude Code et OpenAI Codex, l'écriture de conditions d'arrêt vérifiables, une échelle de maturité d'adoption et les risques qui s'aggravent à mesure que les boucles se sophistiquent. Domaine : ingénierie logicielle agentique, agents de codage, harness/orchestration.

#Loop engineering#agents de codage#harness engineering

Lushbinary Team