Anuncio de Meta AI Research del 5 de agosto de 2026: Muse Code en beta, un agente de codificación de terminal, y Muse Spark 1.2, el modelo que lo impulsa. La propia Meta enmarca el lanzamiento — "nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces en camino".

Del lado del harness, tres decisiones. Agentes asíncronos en segundo plano que "permanecen activos durante toda la sesión, en lugar de crearse para tareas individuales", evitando la recopilación redundante de información y decidiendo por sí mismos cuándo informar al agente principal. Un registro de eventos local que registra cada llamada al modelo, ejecución de herramienta, aprobación y edición, lo que hace que el runtime sea "exacto en la repetición y seguro ante reinicios": tras un fallo, el agente retoma exactamente donde se quedó. Y tres skills incluidas de fábrica: /plan (un plan enviado para aprobación), /grill (pone a prueba el plan hasta que se sostiene), y /goal.

Del lado del modelo, Meta afirma haber realizado un co-entrenamiento con el harness "para maximizar la compatibilidad con el harness", entrenamiento de largo horizonte (repositorio completo, proyectos de extremo a extremo, autoinvestigación, compactación de contexto), y un bucle de automejora en el que la versión 1.1 genera los entornos y califica las soluciones, produciendo el conjunto de entrenamiento para 1.2.

El hecho central de este anuncio no aparece escrito en ningún lugar del texto. Las cuatro comparaciones publicadas existen solo como imágenes, y sitúan a Muse Spark 1.2 por detrás de Opus 5 en los cuatro casos: 82.9% frente a 86.7% en Terminal-Bench 2.1, 59.3% frente a 65.0% en DeepSWE 1.1, 70.6% frente a 79.4% en el propio benchmark interno de Meta, y +68.7% frente a +74.0% en el caso de estudio de optimización de kernels GPU, donde el modelo termina cuarto de seis, por detrás de GPT 5.6 Sol y de la generación anterior de Anthropic.

Y la ganancia propia del modelo es menor de lo que parece. En los dos benchmarks públicos, la versión 1.1 se evalúa con mini-swe-agent y la 1.2 con Muse Code: la diferencia de 6.7 puntos confunde modelo y harness. En el benchmark interno, la única comparación sin harness indicado, se reduce a 2.3 puntos.

Por tanto, el anuncio se sostiene principalmente como confirmación empírica de una tesis ya planteada: el valor se está desplazando hacia el harness, y un harness co-entrenado con sus propios pesos hace que esos pesos sean aún menos intercambiables.