Anuncio de Meta AI Research publicado el 5 de agosto de 2026 (tiempo de lectura indicado: 4 minutos, sin firma individual): Muse Code en beta, "un agente de codificación de terminal", y el modelo que lo impulsa, Muse Spark 1.2.
Por **Meta AI Research** — publication institutionnelle sans auteur nommé// Fuente research.meta.ai ↗/Lectura 2 min/.md// Traducción verificada automáticamente
#Meta AI Research#Muse Code#Muse Spark 1.2#agente de codificación de terminal#beta#harness#agentes asíncronos en segundo plano#subagentes persistentes
Anuncio de Meta AI Research del 5 de agosto de 2026: Muse Code en beta, un agente de codificación de terminal, y Muse Spark 1.2, el modelo que lo impulsa. La propia Meta enmarca el lanzamiento — "nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces en camino".
Del lado del harness, tres decisiones.Agentes asíncronos en segundo plano que "permanecen activos durante toda la sesión, en lugar de crearse para tareas individuales", evitando la recopilación redundante de información y decidiendo por sí mismos cuándo informar al agente principal. Un registro de eventos local que registra cada llamada al modelo, ejecución de herramienta, aprobación y edición, lo que hace que el runtime sea "exacto en la repetición y seguro ante reinicios": tras un fallo, el agente retoma exactamente donde se quedó. Y tres skills incluidas de fábrica: /plan (un plan enviado para aprobación), /grill (pone a prueba el plan hasta que se sostiene), y /goal.
Del lado del modelo, Meta afirma haber realizado un co-entrenamiento con el harness"para maximizar la compatibilidad con el harness", entrenamiento de largo horizonte (repositorio completo, proyectos de extremo a extremo, autoinvestigación, compactación de contexto), y un bucle de automejora en el que la versión 1.1 genera los entornos y califica las soluciones, produciendo el conjunto de entrenamiento para 1.2.
El hecho central de este anuncio no aparece escrito en ningún lugar del texto. Las cuatro comparaciones publicadas existen solo como imágenes, y sitúan a Muse Spark 1.2 por detrás de Opus 5 en los cuatro casos: 82.9% frente a 86.7% en Terminal-Bench 2.1, 59.3% frente a 65.0% en DeepSWE 1.1, 70.6% frente a 79.4% en el propio benchmark interno de Meta, y +68.7% frente a +74.0% en el caso de estudio de optimización de kernels GPU, donde el modelo termina cuarto de seis, por detrás de GPT 5.6 Sol y de la generación anterior de Anthropic.
Y la ganancia propia del modelo es menor de lo que parece. En los dos benchmarks públicos, la versión 1.1 se evalúa con mini-swe-agent y la 1.2 con Muse Code: la diferencia de 6.7 puntos confunde modelo y harness. En el benchmark interno, la única comparación sin harness indicado, se reduce a 2.3 puntos.
Por tanto, el anuncio se sostiene principalmente como confirmación empírica de una tesis ya planteada: el valor se está desplazando hacia el harness, y un harness co-entrenado con sus propios pesos hace que esos pesos sean aún menos intercambiables.
Puntos clave
Qué se lanza.Muse Code (beta), un agente de codificación de terminal que se instala mediante curl -fsSL https://dev.meta.ai/install.sh | bash en macOS y Linux, y Muse Spark 1.2, un modelo disponible en Muse Code y en Meta Model API.
⭐⭐ El resultado global, ausente del texto y legible solo en las imágenes. — Meta pierde las cuatro comparaciones: | Comparación | Ganador | Muse Spark 1.2 | Posición | |---|---|---|---| | Terminal-Bench 2.1 | Opus 5 + Claude Code — 86.7% | 82.9% | 2.º / 6 | | DeepSWE 1.1 | Opus 5 + Claude Code — 65.0% | 59.3% | 3.º / 6 | | Meta Internal Coding Bench | Opus 5 — 79.4% | 70.6% | 2.º / 5 | | Caso de estudio KDA (speedup) | Opus 5 — +74.0% | +68.7% | 4.º / 6 | → En su propio benchmark propietario, Meta se sitúa 8.8 puntos por detrás de Opus 5. Y en el caso de estudio que eligió como muestra, también queda por detrás de GPT 5.6 Sol (+71.2%) y de la generación anterior de Anthropic, Opus 4.8 (+69.6%). Este es el hecho central del anuncio, y hay que ir a leer los PNG para encontrarlo.
⭐⭐ La ganancia del modelo es menor de lo anunciado, y el harness explica el resto. — la lectura más útil de estas cifras:
En Terminal-Bench y DeepSWE, 1.1 se evalúa con mini-swe-agent y 1.2 con Muse Code. La diferencia mostrada (76.2 → 82.9, es decir +6.7 puntos) confunde así el progreso del modelo y el progreso del harness.
En el benchmark interno, la única tabla en la que no se indica ningún harness, la diferencia entre 1.1 y 1.2 se reduce a 68.3 → 70.6, es decir +2.3 puntos. → El modelo gana alrededor de dos puntos; el resto proviene de las herramientas que lo rodean. Meta lo admite a medias al reivindicar un co-entrenamiento "para maximizar la compatibilidad con el harness". Ninguna de estas comparaciones es modelo contra modelo: son pares de modelo + harness.
⭐ Y esto valida empíricamente la tesis de Mozilla, con tres semanas de diferencia. [[mozilla-state-of-open-source-ai-2026-07]] escribió que "el modelo se está comiendo al harness", observó que "en todos los modelos en los que ambos aparecen, el harness propio del laboratorio gana ahora", y planteó el mecanismo — "un harness ajustado estrechamente a los pesos de un laboratorio se convierte en un componente integrado del producto de ese laboratorio… cuanto más ajustado esté, menos intercambiables son los pesos subyacentes. El lock-in llega como efecto secundario de la optimización."Muse Code + Muse Spark 1.2 es exactamente ese objeto: Meta anuncia explícitamente haber entrenado el modelo junto con el harness para maximizar su compatibilidad. La tabla de Terminal-Bench lo muestra implícitamente — cada modelo ahí se mide con el harness de su propio laboratorio.
El registro de eventos — la mejor pieza de ingeniería del post."un registro de eventos local en el que se añade cada llamada al modelo, ejecución de herramienta, aprobación y edición", una única fuente de verdad que hace que el runtime sea "exacto en la repetición y seguro ante reinicios". Tras un fallo, el agente retoma exactamente donde se quedó, lo que permite tareas largas. → Convergencia directa con el run manifest y el comando run resume de [[skill-gibbs-hyperresearch-2026-08-03]], donde el manifest se describe como "tu memoria durable". Dos equipos independientes llegan al mismo mecanismo: el contexto no sobrevive, un registro en disco sí.
⭐ Agentes persistentes en segundo plano — una ruptura con el modelo dominante. en lugar de crearse para una tarea y luego destruirse, "permanecen activos durante toda la sesión", lo que evita "la recopilación redundante de información", les permite decidir por sí mismos cuándo informar al agente principal, y reduce "la latencia y la necesidad de dirección". → A comparar con la observación opuesta de Hugo Lassiège sobre los subagentes desechables — "los uso cada vez menos, los agentes recientes delegan por sí solos un trabajo bastante específico" ([[lassiege-usine-logicielle-heure-ia-2026-07-28]]). Dos respuestas opuestas al mismo problema: Lassiège delega menos, Meta delega a agentes que ya no mueren.
⭐ /grill viene incluida de fábrica, y el nombre no es casual."/grill pone a prueba ese plan hasta que se sostiene". Es exactamente la función de la skill grill-with-docs de Matt Pocock, archivada en este corpus desde junio ([[skill-pocock-grill-with-docs-2026-06]]) — una entrevista adversarial que somete un plan a prueba antes de la implementación. Un patrón nacido en la comunidad de skills llega preinstalado en un laboratorio de frontera. Una señal de madurez: las buenas prácticas de harness se están convirtiendo en primitivas de producto.
El tríptico entregado. — /plan (un plan enviado para aprobación), /grill (puesta a prueba), /goal (persecución del objetivo) — describe un bucle plan → desafío → ejecución con una puerta humana en el primer paso. Es la forma canónica documentada por [[osmani-agent-harness-engineering-2026-04-19]], ahora empaquetada.
Automejora, leída con precisión."También usamos Muse Spark 1.1 para generar entornos de codificación desafiantes y plantillas de seguimiento de instrucciones. El modelo luego calificó las soluciones candidatas… produciendo un conjunto de entrenamiento escalable para Muse Spark 1.2." → Es 1.1 quien genera los entornos y califica, siendo 1.2 el producto de este conjunto de datos. ⚠️ El sujeto de "el modelo" es ambiguo, y algunas relecturas lo han interpretado como 1.2; la lectura natural es 1.1, el único nombrado. Un bucle de destilación de una generación sobre sí misma, cuya limitación conocida es que solo puede enseñar lo que la generación anterior ya sabe evaluar.
Caso de estudio de kernels GPU — el protocolo es más interesante que el resultado. optimización iterativa a lo largo de más de 1000 llamadas a herramientas, hasta 24 horas, sobre los kernels KDA y MLA para GPU NVIDIA Hopper. El modelo escribe, compila, perfila y mejora progresivamente. ⭐ Restricción notable: "Se prohibió a los modelos importar directamente bibliotecas de kernels de terceros como FLA" — el algoritmo tenía que reimplementarse en Triton, no envolverse en torno a una implementación existente. Esto es lo que hace honesta la prueba, y es el tipo de salvaguarda que falta en muchas demostraciones de agentes.
En KDA: un kernel de preparación en paralelo por bloques más un barrido secuencial entre bloques, con un recentrado acumulativo de decaimiento en el punto medio del bloque.
En MLA: un pipeline Triton de dos kernels, que reutiliza el latente KV compartido como K y V a la vez, medido con un tamaño de lote de 1, 64 cabezas, longitud de secuencia de 8192 y dimensión latente de 512.
⚠️ KDA es la atención lineal de Kimi (cf. [[sfeir-kimi-k3-moonshot-frontier-open-weights-2026-07-16]]): Meta hace así que su agente optimice el kernel de una arquitectura competidora de pesos abiertos. Un detalle revelador y sabroso de cómo circulan las arquitecturas.
⚠️ Tres reservas metodológicas sobre los gráficos. 1. Ninguna cifra aparece en el texto. Las cuatro comparaciones son imágenes rasterizadas sin datos textuales ni etiquetas numéricas de accesibilidad. Un lector apurado, un agregador o un agente que lea la página no ve ningún resultado. Los valores de esta fiche se leyeron visualmente en los PNG. 2. El eje Y del gráfico de KDA no es lineal, algo que Meta señala honestamente ("Eje espaciado linealmente en X", líneas de cuadrícula en 0-27-43-53-60-65-69-72-75%). La escala estira la parte superior del rango, lo que amplifica visualmente las diferencias entre los modelos líderes — en este caso, en detrimento de Meta. 3. Las configuraciones comparadas no son homogéneas: max para Opus 5 y GPT 5.6 Terra, high para Grok 4.5 y Gemini 3.6 Flash, nada indicado para Muse Spark. Y Grok está ausente del benchmark interno, GPT 5.6 Sol solo aparece en el caso de estudio. La composición del panel cambia de un gráfico a otro.
⚠️ El benchmark interno es inverificable."Meta Internal Coding Bench" no es público, su composición no se describe en el post, y Meta lo usa para medir a sus competidores. El hecho de que pierda en él hace que la cifra sea más creíble que una puntuación halagadora — pero un benchmark propietario sigue siendo irreproducible.
Lo que el anuncio no dice. sin precios, sin límites de uso, sin licencia del modelo, sin publicación de los pesos — una ruptura notable con la tradición Llama de Meta, sobre la que el post guarda silencio. Tampoco nada sobre los idiomas admitidos, el tamaño de contexto o las garantías de confidencialidad para el código enviado.
Meta / relacionados. confirmación empírica del mecanismo de lock-in por optimización descrito en [[mozilla-state-of-open-source-ai-2026-07]]; registro de eventos y reanudación a comparar con [[skill-gibbs-hyperresearch-2026-08-03]]; /grill preinstalada frente a [[skill-pocock-grill-with-docs-2026-06]]; doctrina de harness en [[osmani-agent-harness-engineering-2026-04-19]] y [[lassiege-usine-logicielle-heure-ia-2026-07-28]]; competidores citados en [[sfeir-gpt56-sol-terra-luna-coding-agentique-pricing-2026-07-13]] y [[cherny-wu-reflecting-year-claude-code-2026-07-17]]; kernel KDA y arquitectura Kimi en [[sfeir-kimi-k3-moonshot-frontier-open-weights-2026-07-16]].
Cifras clave
82,9 % en Terminal-Bench 2.1 frente a 86,7 % para Opus 5 con Claude Code
2,3 points sur le seul comparatif sans harnais indiqué, contre 6,7 points sur les comparatifs avec harnais
gain de Muse Spark 1.1 à 1.2 · inferido
Afirmaciones atribuidas
este lanzamiento es un paso hacia la frontera, con modelos más grandes y más capaces por venir
— Meta AI Research
El grafo de conocimiento extraído de esta ficha — 6 entidades, 22 relaciones.
En este grafo :Muse Code · Muse Spark 1.2 · Meta AI Research · agents d'arrière-plan persistants · journal d'événements d'agent · Meta Internal Coding Bench