# meta-muse-code-muse-spark-1-2-2026-08-05

## Veille

Anuncio de **Meta AI Research** publicado el **5 de agosto de 2026** (tiempo de lectura indicado: 4 minutos, sin firma individual): **Muse Code** en beta, *"un agente de codificación de terminal"*, y el modelo que lo impulsa, **Muse Spark 1.2**. La propia Meta enmarca el lanzamiento: *"Este es nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces en camino"* — **un paso hacia la frontera, no una gran afirmación**. Del lado del harness se describen **tres elementos arquitectónicos**: **agentes asíncronos en segundo plano** que *"permanecen activos durante toda la sesión, en lugar de crearse para tareas individuales"*, para evitar la recopilación redundante de información y reducir la necesidad de dirección; un **registro de eventos local** donde *"se añade cada llamada al modelo, ejecución de herramienta, aprobación y edición"*, lo que hace que el runtime sea *"exacto en la repetición y seguro ante reinicios"* — capaz de retomar exactamente donde se quedó tras un fallo; y **tres skills incluidas de fábrica** — `/plan` (convierte una tarea en un plan enviado para aprobación), **`/grill`** (pone a prueba el plan *"hasta que se sostiene"*), y `/goal`. Del lado del modelo, Meta afirma haber realizado un **co-entrenamiento del modelo con el harness** (*"para maximizar la compatibilidad con el harness"*, con trayectorias del harness muestreadas mediante rejection sampling y optimizaciones de recetas para objetivos, compactación y subagentes), entrenamiento de **largo horizonte** (generación de repositorios completos, proyectos de extremo a extremo, autoinvestigación, con planificación, condicionamiento de objetivos y **compactación de contexto**), y un **bucle de automejora** en el que Muse Spark 1.1 genera los entornos y las plantillas de instrucciones **y luego califica las soluciones candidatas**, produciendo un conjunto de entrenamiento para 1.2. ⚠️ **El hecho más destacable de este anuncio no aparece escrito en ningún lugar del texto**: los cuatro gráficos publicados — Terminal-Bench 2.1, DeepSWE 1.1, un benchmark interno de Meta y el caso de estudio de optimización de kernels GPU — **sitúan a Muse Spark 1.2 por detrás de Opus 5 en los cuatro casos**, incluido en el propio benchmark propietario de Meta (70.6% frente a 79.4%) y en el caso de estudio, donde el modelo termina **cuarto de seis** (+68.7% frente a +74.0%). ⚠️ **Y la ganancia real del modelo es menor de lo que parece**: en los dos benchmarks públicos, 1.1 se mide con `mini-swe-agent` y 1.2 con Muse Code — la diferencia de 6.7 puntos confunde así modelo y harness. En el benchmark interno, la única comparación en la que no se menciona ningún harness, la diferencia entre 1.1 y 1.2 se reduce a **2.3 puntos**.

## Titre Article

Introducing Muse Code and Muse Spark 1.2

## Date

2026-08-05

## URL

https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2

## Keywords

Meta AI Research, Muse Code, Muse Spark 1.2, agente de codificación de terminal, beta, harness, agentes asíncronos en segundo plano, subagentes persistentes, recopilación redundante de información, registro de eventos, registro de eventos, repetición exacta, seguro ante reinicios, recuperación tras fallo, tareas largas, skills incluidas de fábrica, plan aprobado, grill, goal, co-entrenamiento modelo-harness, rejection sampling, trayectorias del harness, compatibilidad con el harness, largo horizonte, generación de repositorios completos, autoinvestigación, condicionamiento de objetivos, compactación de contexto, automejora, generación de entornos, calificación de soluciones, Terminal-Bench 2.1, DeepSWE 1.1, benchmark interno, Opus 5, Claude Code, GPT 5.6 Terra, GPT 5.6 Sol, Codex, Grok 4.5, Gemini 3.6 Flash, Antigravity CLI, mini-swe-agent, optimización de kernels GPU, Triton, KDA, MLA, NVIDIA Hopper, llamadas a herramientas acumuladas, speedup frente a la línea base, FLA, fusión de kernels, tiling, Meta Model API, lock-in por optimización

## Authors

**Meta AI Research** — publication institutionnelle sans auteur nommé, sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation, non repris ici.

**Positionnement à connaître** : Meta arrive sur le terrain de l'agent de codage en terminal **après** Claude Code, Codex, Gemini CLI, Grok Build et Antigravity CLI, et le dit — *« our next step toward the frontier »*. L'annonce couple un **produit** (Muse Code, distribué par `curl … | bash`) et un **modèle** (Muse Spark 1.2, disponible dans Muse Code et dans **Meta Model API** avec *« expanded global access »*), les deux ayant été entraînés ensemble.

## Ton

**Perfil**: un anuncio de producto de laboratorio de investigación, formato corto, registro técnico sobrio. Sin hipérboles, sin reivindicación de superioridad, sin superlativos — algo **inusual para un lanzamiento** y que resulta informativo en sí mismo.

**Estilo**: el texto avanza **describiendo mecanismos**, sección por sección, cada una limitada a un párrafo y nombrando una decisión de ingeniería precisa — persistencia de subagentes, el registro de eventos, el co-entrenamiento, la compactación. No hay caso de cliente, ni cita de directivo, ni promesa de productividad. La única demostración narrativa es una viñeta: un usuario suelta en el terminal un vídeo `mp4` de la visita de una casa, Muse Code lo interpreta y produce una página de reserva de alquiler de corta duración.

**El rasgo más destacable es la modestia del planteamiento**, expuesta ya desde la segunda frase: *"Esto marca nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces en camino."* Meta anuncia un hito y advierte que lo mejor está aún por llegar. La conclusión repite la misma postura: *"Tenemos mucho en el horizonte, incluidas nuevas funciones de harness y modelos más potentes."*

**Esta modestia se confirma en los gráficos**, y eso es lo que hace singular al anuncio: Meta publica cuatro comparaciones en las que nunca gana. Pocos lanzamientos están dispuestos a mostrar a un competidor en cabeza en su propia página — y menos aún en su **propio benchmark interno**.

**Frases marcadoras**: *"nuestro siguiente paso hacia la frontera"*, *"en lugar de crearse para tareas individuales"*, *"exacto en la repetición y seguro ante reinicios"*, *"/grill pone a prueba ese plan hasta que se sostiene"*, *"para maximizar la compatibilidad con el harness"*.

## Pense-betes

- **Qué se lanza**: **Muse Code** (beta), un agente de codificación de terminal que se instala mediante `curl -fsSL https://dev.meta.ai/install.sh | bash` en macOS y Linux, y **Muse Spark 1.2**, un modelo disponible en Muse Code y en **Meta Model API**.
- **⭐⭐ El resultado global, ausente del texto y legible solo en las imágenes** — Meta pierde las cuatro comparaciones: | Comparación | Ganador | Muse Spark 1.2 | Posición | |---|---|---|---| | Terminal-Bench 2.1 | Opus 5 + Claude Code — **86.7%** | 82.9% | 2.º / 6 | | DeepSWE 1.1 | Opus 5 + Claude Code — **65.0%** | 59.3% | 3.º / 6 | | **Meta Internal Coding Bench** | Opus 5 — **79.4%** | 70.6% | 2.º / 5 | | Caso de estudio KDA (speedup) | Opus 5 — **+74.0%** | +68.7% | **4.º / 6** | → **En su propio benchmark propietario, Meta se sitúa 8.8 puntos por detrás de Opus 5.** Y en el caso de estudio que eligió como muestra, también queda por detrás de GPT 5.6 Sol (+71.2%) y de **la generación anterior de Anthropic**, Opus 4.8 (+69.6%). Este es el hecho central del anuncio, y hay que ir a leer los PNG para encontrarlo.
- **⭐⭐ La ganancia del modelo es menor de lo anunciado, y el harness explica el resto** — la lectura más útil de estas cifras:
- En **Terminal-Bench** y **DeepSWE**, 1.1 se evalúa con **`mini-swe-agent`** y 1.2 con **Muse Code**. La diferencia mostrada (76.2 → 82.9, es decir **+6.7 puntos**) confunde así **el progreso del modelo y el progreso del harness**.
- En el **benchmark interno**, la única tabla en la que **no se indica ningún harness**, la diferencia entre 1.1 y 1.2 se reduce a **68.3 → 70.6, es decir +2.3 puntos**. → **El modelo gana alrededor de dos puntos; el resto proviene de las herramientas que lo rodean.** Meta lo admite a medias al reivindicar un co-entrenamiento *"para maximizar la compatibilidad con el harness"*. **Ninguna de estas comparaciones es modelo contra modelo: son pares de modelo + harness.**
- **⭐ Y esto valida empíricamente la tesis de Mozilla, con tres semanas de diferencia**: [[mozilla-state-of-open-source-ai-2026-07]] escribió que *"el modelo se está comiendo al harness"*, observó que *"en todos los modelos en los que ambos aparecen, el harness propio del laboratorio gana ahora"*, y planteó el mecanismo — *"un harness ajustado estrechamente a los pesos de un laboratorio se convierte en un componente integrado del producto de ese laboratorio… cuanto más ajustado esté, menos intercambiables son los pesos subyacentes. **El lock-in llega como efecto secundario de la optimización.**"* **Muse Code + Muse Spark 1.2 es exactamente ese objeto**: Meta anuncia explícitamente haber entrenado el modelo *junto con* el harness para maximizar su compatibilidad. La tabla de Terminal-Bench lo muestra implícitamente — cada modelo ahí se mide con el harness de su propio laboratorio.
- **El registro de eventos — la mejor pieza de ingeniería del post**: *"un registro de eventos local en el que se añade cada llamada al modelo, ejecución de herramienta, aprobación y edición"*, una única fuente de verdad que hace que el runtime sea *"exacto en la repetición y seguro ante reinicios"*. Tras un fallo, el agente retoma **exactamente** donde se quedó, lo que permite tareas largas. → **Convergencia directa con el run manifest y el comando `run resume` de [[skill-gibbs-hyperresearch-2026-08-03]]**, donde el manifest se describe como *"tu memoria durable"*. Dos equipos independientes llegan al mismo mecanismo: **el contexto no sobrevive, un registro en disco sí.**
- **⭐ Agentes persistentes en segundo plano — una ruptura con el modelo dominante**: en lugar de crearse para una tarea y luego destruirse, *"permanecen activos durante toda la sesión"*, lo que evita *"la recopilación redundante de información"*, les permite decidir **por sí mismos** cuándo informar al agente principal, y reduce *"la latencia y la necesidad de dirección"*. → A comparar con la observación opuesta de Hugo Lassiège sobre los subagentes desechables — *"los uso cada vez menos, los agentes recientes delegan por sí solos un trabajo bastante específico"* ([[lassiege-usine-logicielle-heure-ia-2026-07-28]]). **Dos respuestas opuestas al mismo problema**: Lassiège delega menos, Meta delega a agentes que ya no mueren.
- **⭐ `/grill` viene incluida de fábrica, y el nombre no es casual**: *"/grill pone a prueba ese plan hasta que se sostiene"*. Es exactamente la función de la skill `grill-with-docs` de Matt Pocock, archivada en este corpus desde junio ([[skill-pocock-grill-with-docs-2026-06]]) — una entrevista adversarial que somete un plan a prueba antes de la implementación. **Un patrón nacido en la comunidad de skills llega preinstalado en un laboratorio de frontera.** Una señal de madurez: las buenas prácticas de harness se están convirtiendo en primitivas de producto.
- **El tríptico entregado** — `/plan` (un plan **enviado para aprobación**), `/grill` (puesta a prueba), `/goal` (persecución del objetivo) — describe un bucle **plan → desafío → ejecución** con una **puerta humana** en el primer paso. Es la forma canónica documentada por [[osmani-agent-harness-engineering-2026-04-19]], ahora empaquetada.
- **Automejora, leída con precisión**: *"También usamos Muse Spark 1.1 para generar entornos de codificación desafiantes y plantillas de seguimiento de instrucciones. El modelo luego calificó las soluciones candidatas… produciendo un conjunto de entrenamiento escalable para Muse Spark 1.2."* → **Es 1.1 quien genera los entornos *y* califica**, siendo 1.2 el producto de este conjunto de datos. ⚠️ El sujeto de *"el modelo"* es ambiguo, y algunas relecturas lo han interpretado como 1.2; la lectura natural es 1.1, el único nombrado. **Un bucle de destilación de una generación sobre sí misma**, cuya limitación conocida es que solo puede enseñar lo que la generación anterior ya sabe evaluar.
- **Caso de estudio de kernels GPU — el protocolo es más interesante que el resultado**: optimización iterativa a lo largo de **más de 1000 llamadas a herramientas, hasta 24 horas**, sobre los kernels **KDA** y **MLA** para GPU **NVIDIA Hopper**. El modelo escribe, compila, perfila y mejora progresivamente. ⭐ **Restricción notable**: *"Se prohibió a los modelos importar directamente bibliotecas de kernels de terceros como FLA"* — el algoritmo tenía que reimplementarse en Triton, no envolverse en torno a una implementación existente. **Esto es lo que hace honesta la prueba**, y es el tipo de salvaguarda que falta en muchas demostraciones de agentes.
- En **KDA**: un kernel de preparación en paralelo por bloques más un barrido secuencial entre bloques, con un recentrado acumulativo de decaimiento en el punto medio del bloque.
- En **MLA**: un pipeline Triton de dos kernels, que reutiliza el latente KV compartido como K y V a la vez, medido con un tamaño de lote de 1, 64 cabezas, longitud de secuencia de 8192 y dimensión latente de 512.
- ⚠️ **KDA es la atención lineal de Kimi** (cf. [[sfeir-kimi-k3-moonshot-frontier-open-weights-2026-07-16]]): Meta hace así que su agente optimice el kernel de una arquitectura competidora de pesos abiertos. Un detalle revelador y sabroso de cómo circulan las arquitecturas.
- **⚠️ Tres reservas metodológicas sobre los gráficos**: 1. **Ninguna cifra aparece en el texto.** Las cuatro comparaciones son **imágenes rasterizadas** sin datos textuales ni etiquetas numéricas de accesibilidad. Un lector apurado, un agregador o un agente que lea la página **no ve ningún resultado**. Los valores de esta fiche se leyeron visualmente en los PNG. 2. **El eje Y del gráfico de KDA no es lineal**, algo que Meta señala honestamente (*"Eje espaciado linealmente en X"*, líneas de cuadrícula en 0-27-43-53-60-65-69-72-75%). La escala **estira la parte superior del rango**, lo que amplifica visualmente las diferencias entre los modelos líderes — en este caso, en detrimento de Meta. 3. **Las configuraciones comparadas no son homogéneas**: `max` para Opus 5 y GPT 5.6 Terra, `high` para Grok 4.5 y Gemini 3.6 Flash, nada indicado para Muse Spark. Y Grok está ausente del benchmark interno, GPT 5.6 Sol solo aparece en el caso de estudio. **La composición del panel cambia de un gráfico a otro.**
- **⚠️ El benchmark interno es inverificable**: *"Meta Internal Coding Bench"* no es público, su composición no se describe en el post, y Meta lo usa para medir a sus competidores. El hecho de que **pierda** en él hace que la cifra sea más creíble que una puntuación halagadora — pero un benchmark propietario sigue siendo irreproducible.
- **Lo que el anuncio no dice**: sin precios, sin límites de uso, sin licencia del modelo, sin publicación de los pesos — una ruptura notable con la tradición Llama de Meta, sobre la que el post guarda silencio. Tampoco nada sobre los idiomas admitidos, el tamaño de contexto o las garantías de confidencialidad para el código enviado.
- **Meta / relacionados**: confirmación empírica del mecanismo de lock-in por optimización descrito en [[mozilla-state-of-open-source-ai-2026-07]]; registro de eventos y reanudación a comparar con [[skill-gibbs-hyperresearch-2026-08-03]]; `/grill` preinstalada frente a [[skill-pocock-grill-with-docs-2026-06]]; doctrina de harness en [[osmani-agent-harness-engineering-2026-04-19]] y [[lassiege-usine-logicielle-heure-ia-2026-07-28]]; competidores citados en [[sfeir-gpt56-sol-terra-luna-coding-agentique-pricing-2026-07-13]] y [[cherny-wu-reflecting-year-claude-code-2026-07-17]]; kernel KDA y arquitectura Kimi en [[sfeir-kimi-k3-moonshot-frontier-open-weights-2026-07-16]].

## RésuméDe400mots

Anuncio de **Meta AI Research** del **5 de agosto de 2026**: **Muse Code** en beta, un agente de codificación de terminal, y **Muse Spark 1.2**, el modelo que lo impulsa. La propia Meta enmarca el lanzamiento — *"nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces en camino"*.

**Del lado del harness, tres decisiones.** **Agentes asíncronos en segundo plano** que *"permanecen activos durante toda la sesión, en lugar de crearse para tareas individuales"*, evitando la recopilación redundante de información y decidiendo por sí mismos cuándo informar al agente principal. Un **registro de eventos local** que registra cada llamada al modelo, ejecución de herramienta, aprobación y edición, lo que hace que el runtime sea *"exacto en la repetición y seguro ante reinicios"*: tras un fallo, el agente retoma exactamente donde se quedó. Y tres **skills incluidas de fábrica**: `/plan` (un plan enviado para aprobación), **`/grill`** (pone a prueba el plan hasta que se sostiene), y `/goal`.

**Del lado del modelo**, Meta afirma haber realizado un **co-entrenamiento con el harness** *"para maximizar la compatibilidad con el harness"*, entrenamiento de largo horizonte (repositorio completo, proyectos de extremo a extremo, autoinvestigación, compactación de contexto), y un bucle de automejora en el que la versión 1.1 genera los entornos y califica las soluciones, produciendo el conjunto de entrenamiento para 1.2.

**El hecho central de este anuncio no aparece escrito en ningún lugar del texto.** Las cuatro comparaciones publicadas existen solo como imágenes, y sitúan a Muse Spark 1.2 **por detrás de Opus 5 en los cuatro casos**: 82.9% frente a 86.7% en Terminal-Bench 2.1, 59.3% frente a 65.0% en DeepSWE 1.1, **70.6% frente a 79.4% en el propio benchmark interno de Meta**, y +68.7% frente a +74.0% en el caso de estudio de optimización de kernels GPU, donde el modelo termina **cuarto de seis**, por detrás de GPT 5.6 Sol y de la generación anterior de Anthropic.

**Y la ganancia propia del modelo es menor de lo que parece.** En los dos benchmarks públicos, la versión 1.1 se evalúa con `mini-swe-agent` y la 1.2 con Muse Code: la diferencia de 6.7 puntos confunde modelo y harness. En el benchmark interno, la única comparación sin harness indicado, se reduce a **2.3 puntos**.

Por tanto, el anuncio se sostiene principalmente como **confirmación empírica** de una tesis ya planteada: el valor se está desplazando hacia el harness, y un harness co-entrenado con sus propios pesos hace que esos pesos sean aún menos intercambiables.

## GrapheDeConnaissance

- Meta AI Research —publie→ Muse Code (TECHNOLOGIE, 0.97)
- Meta AI Research —publie→ Muse Spark 1.2 (TECHNOLOGIE, 0.97)
- Muse Spark 1.2 —est_variante_de→ Muse Spark 1.1 (TECHNOLOGIE, 0.95)
- Muse Code —utilise→ Muse Spark 1.2 (TECHNOLOGIE, 0.96)
- Muse Spark 1.2 —est_basé_sur→ un co-entraînement avec le harnais Muse Code pour maximiser leur compatibilité (AFFIRMATION, 0.95)
- co-entraînement d'un modèle avec son harnais —réduit→ l'interchangeabilité des poids sous-jacents (AFFIRMATION, 0.85)
- journal d'événements local —permet→ de reprendre exactement où l'agent s'est arrêté après un plantage (AFFIRMATION, 0.95)
- agents d'arrière-plan persistants —s_oppose_à→ les sous-agents créés puis détruits pour chaque tâche (AFFIRMATION, 0.94)
- agents d'arrière-plan persistants —réduit→ la collecte d'information redondante et le besoin de pilotage (AFFIRMATION, 0.93)
- Muse Code —utilise→ une skill de mise à l'épreuve du plan avant implémentation (AFFIRMATION, 0.93)
- Muse Spark 1.1 —permet→ de générer les environnements et de noter les solutions ayant servi à entraîner Muse Spark 1.2 (AFFIRMATION, 0.9)
- Opus 5 —surpasse→ Muse Spark 1.2 (TECHNOLOGIE, 0.95)
- Muse Spark 1.2 —mesure→ 82,9 % sur Terminal-Bench 2.1 contre 86,7 % pour Opus 5 avec Claude Code (MESURE, 0.93)
- Muse Spark 1.2 —mesure→ 59,3 % sur DeepSWE 1.1 contre 65,0 % pour Opus 5 et 64,8 % pour GPT 5.6 Terra (MESURE, 0.93)
- Muse Spark 1.2 —mesure→ 70,6 % sur le benchmark interne de Meta contre 79,4 % pour Opus 5 (MESURE, 0.92)
- Muse Spark 1.2 —mesure→ une accélération de noyau KDA de +68,7 %, quatrième derrière Opus 5, GPT 5.6 Sol et Opus 4.8 (MESURE, 0.92)
- comparaison de paires modèle et harnais —s_oppose_à→ une comparaison de modèles isolés, les deux benchmarks publics évaluant chaque modèle avec le harnais de son laboratoire (AFFIRMATION, 0.9)
- gain de Muse Spark 1.1 à 1.2 —mesure→ 2,3 points sur le seul comparatif sans harnais indiqué, contre 6,7 points sur les comparatifs avec harnais (MESURE, 0.88)
- Muse Code —s_applique_à→ l'optimisation itérative de noyaux GPU sur plus de 1 000 appels d'outils et jusqu'à 24 heures (AFFIRMATION, 0.93)
- interdiction d'importer une bibliothèque de noyaux tierce —permet→ de tester la réimplémentation d'un algorithme plutôt que l'enveloppement d'une implémentation existante (AFFIRMATION, 0.92)
- Meta AI Research —affirme_que→ ce lancement est une étape vers la frontière, des modèles plus grands et plus capables étant à venir (CITATION, 0.95)
- benchmarks publiés uniquement en image —s_oppose_à→ la lisibilité des résultats par un agrégateur ou un agent lisant la page (AFFIRMATION, 0.88)

---
Canonical: https://www.thekb.eu/es/fiches/meta-muse-code-muse-spark-1-2-2026-08-05/
