Annonce de Meta AI Research du 5 août 2026 : Muse Code en bêta, agent de codage en terminal, et Muse Spark 1.2, le modèle qui l'anime. Meta situe elle-même le lancement — « our next step toward the frontier, with larger and much more capable models on the way ».
Côté harnais, trois décisions. Des agents d'arrière-plan asynchrones qui « remain active throughout each session, rather than being spawned for individual tasks », évitant la collecte d'information redondante et décidant eux-mêmes quand remonter à l'agent principal. Un journal d'événements local consignant chaque appel de modèle, exécution d'outil, approbation et édition, ce qui rend le runtime « replay-exact and restart-safe » : après un plantage, l'agent reprend exactement où il s'était arrêté. Et trois skills livrées d'origine : /plan (plan soumis à approbation), /grill (met le plan à l'épreuve jusqu'à ce qu'il tienne) et /goal.
This marks our next step toward the frontier, with larger and much more capable models on the way
Côté modèle, Meta revendique un co-entraînement avec le harnais « to maximize harness compatibility », un entraînement long-horizon (dépôt entier, projets bout-en-bout, auto-recherche, compaction de contexte) et une boucle d'auto-amélioration où la version 1.1 génère les environnements et note les solutions, produisant le jeu d'entraînement de la 1.2.
Le fait central de cette annonce n'est écrit nulle part dans son texte. Les quatre comparatifs publiés existent uniquement sous forme d'images, et ils placent Muse Spark 1.2 derrière Opus 5 dans les quatre cas : 82,9 % contre 86,7 % sur Terminal-Bench 2.1, 59,3 % contre 65,0 % sur DeepSWE 1.1, 70,6 % contre 79,4 % sur le benchmark interne de Meta elle-même, et +68,7 % contre +74,0 % sur l'étude de cas d'optimisation de noyaux GPU, où le modèle finit quatrième sur six, derrière GPT 5.6 Sol et derrière la génération précédente d'Anthropic.
Et le gain propre au modèle est plus faible qu'il n'y paraît. Sur les deux benchmarks publics, la version 1.1 est évaluée avec mini-swe-agent et la 1.2 avec Muse Code : l'écart de 6,7 points mélange modèle et harnais. Sur le benchmark interne, seul comparatif sans harnais indiqué, il tombe à 2,3 points.
L'annonce vaut donc surtout comme confirmation empirique d'une thèse déjà posée : la valeur se déplace vers le harnais, et un harnais co-entraîné avec ses propres poids rend ces poids d'autant moins interchangeables.