Una entrada de referencia de **Block Engineering** del **6 de agosto de 2026**, firmada por **Atish Patel**, sobre **Buzz** —el espacio de trabajo humano + agentes lanzado el 21 de julio— que plantea una pregunta de costo: ¿qué equipo de agentes es **el más barato que tiene éxito de forma fiable**? Tres hallazgos. **(A) Un resultado negativo, publicado íntegramente**: en **Terminal-Bench 2.1**, **doce composiciones de equipo** (parejas, tríos, enjambres baratos bajo un modelo *frontier*) se enfrentaron al agente solo en torno al cual cada una fue construida, y **ninguna lo superó a igualdad de costo**. La explicación es estructural — una tarea que termina en minutos *"no tiene suficiente estructura para dividirse"*, y *"más agentes compra sobre todo el costo de explicarlo dos veces"*. **(B) El horizonte invierte el resultado**: en **Long-Horizon Terminal-Bench** (44 tareas, una tarea que vale horas de trabajo, mismo líder **GPT-5.6 Sol** con esfuerzo *high*), el agente solo termina 15 tareas para un 59,1%, +2 QuickBees 19 para un 64,1%, +1 QuickBee +1 WorkerBee 19 para un 69,5%, **+2 WorkerBees 20 para un 71,5%** — una ganancia de **+12,4 puntos**, de los cuales 11,4 provienen de tareas llevadas hasta su finalización. *"Mismos puestos, resultado opuesto, porque el trabajo tiene una forma distinta."* Estas ejecuciones corrieron con **3× el timeout**, incluido el agente solo. **(C) Más allá de un umbral, el precio deja de comprar calidad**: en solitario en Terminal-Bench 2.1, **Opus 5 con esfuerzo *xhigh* es la ejecución más cara (140,63 $) para un 75,0%**, por detrás de seis ejecuciones que van de 20,08 $ a 109,82 $ y de 79,5% a 88,4% — la causa señalada es un sobrerrazonamiento que llevó a 17 de 88 tareas al timeout. Entre las seis mejores ejecuciones, **una brecha de precio de 5,5× para una brecha de puntuación de 8,9 puntos**: *"elegir entre ellas no es en absoluto una decisión de calidad. Es una decisión de presupuesto."* La entrada propone una taxonomía que reconoce como *ad hoc* — **QuickBee**, **WorkerBee**, **SmartBee**, además del humano como *"abeja honoraria"*— y dos formas de equipo, el **Hive** permanente que recuerda las preferencias del usuario y el **Swarm** desechable que recuerda el proyecto. Condiciones: todo se ejecuta en **Harbor**, contra agentes Buzz reales en un relé **en vivo**, **un intento por tarea, sin reintento**, precios fijados a fecha de **30-07-2026**.
#Buzz#Block#equipos de agentes
- **Atish Patel** — *« Building AI solutions @ Block »* · auteur unique du billet · publié le **6 août 2026** sur `engineering.block.xyz`.
Anuncio de **Meta AI Research** publicado el **5 de agosto de 2026** (tiempo de lectura indicado: 4 minutos, sin firma individual): **Muse Code** en beta, *« un agente de codificación de terminal »*, y el modelo que lo impulsa, **Muse Spark 1.2**. La propia Meta enmarca el lanzamiento: *« Esto marca nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces por venir. »* **Tres elementos arquitectónicos del lado del harness.** **Agentes asíncronos en segundo plano** que *« permanecen activos durante toda la sesión, en lugar de generarse para tareas individuales »*, evitando la recopilación redundante de información y reduciendo la necesidad de dirección. Un **registro de eventos local** donde *« se añade cada llamada al modelo, ejecución de herramienta, aprobación y edición »*, lo que convierte el runtime en un sistema que es *« exacto en la reproducción (replay-exact) y seguro ante reinicios (restart-safe) »*, capaz de reanudar exactamente donde se quedó tras un fallo. Y **tres skills incluidas de fábrica**: `/plan` (convierte una tarea en un plan sometido a aprobación), **`/grill`** (somete el plan a prueba de estrés *« hasta que se sostenga »*), y `/goal`. **Del lado del modelo**, Meta reivindica **co-entrenamiento modelo-harness** (*« para maximizar la compatibilidad con el harness »*, con trayectorias de harness muestreadas mediante rejection sampling y optimizaciones de receta para objetivos, compactación y sub-agentes), entrenamiento de **largo horizonte** (generación de repositorios completos, proyectos de principio a fin, autoinvestigación, con planificación, condicionamiento por objetivo y compactación de contexto), y un **bucle de auto-mejora** en el que Muse Spark 1.1 genera los entornos y las plantillas de instrucciones y luego califica las soluciones candidatas, produciendo un conjunto de entrenamiento para la 1.2. **Lo que muestran los gráficos publicados**, sin que el texto lo comente: las cuatro comparaciones —Terminal-Bench 2.1, DeepSWE 1.1, un benchmark interno de Meta y el estudio de caso de optimización de kernels GPU— sitúan a **Muse Spark 1.2 por detrás de Opus 5 en los cuatro casos**, incluido en el propio benchmark propietario de Meta (70,6 % frente a 79,4 %) y en el estudio de caso, donde el modelo termina cuarto de seis (+68,7 % frente a +74,0 %). **Una advertencia de lectura sobre la ganancia entre versiones**: en los dos benchmarks públicos, la 1.1 se mide con `mini-swe-agent` y la 1.2 con Muse Code, por lo que la diferencia de 6,7 puntos mezcla progreso del modelo y progreso del harness. En el benchmark interno, la única comparación en la que no se menciona ningún harness, la diferencia 1.1 → 1.2 cae a **2,3 puntos**.
#Meta AI Research#Muse Code#Muse Spark 1.2
**Meta AI Research** — publication institutionnelle sans auteur nommé · sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation · non repris ici.