Saltar al contenido

root / tags / goal

#/goal

3 fiches

Agentes de codificación IA y Skills Traducción verificada automáticamente

Introducing Muse Code and Muse Spark 1.2

Anuncio de **Meta AI Research** publicado el **5 de agosto de 2026** (tiempo de lectura indicado: 4 minutos, sin firma individual): **Muse Code** en beta, *« un agente de codificación de terminal »*, y el modelo que lo impulsa, **Muse Spark 1.2**. La propia Meta enmarca el lanzamiento: *« Esto marca nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces por venir. »* **Tres elementos arquitectónicos del lado del harness.** **Agentes asíncronos en segundo plano** que *« permanecen activos durante toda la sesión, en lugar de generarse para tareas individuales »*, evitando la recopilación redundante de información y reduciendo la necesidad de dirección. Un **registro de eventos local** donde *« se añade cada llamada al modelo, ejecución de herramienta, aprobación y edición »*, lo que convierte el runtime en un sistema que es *« exacto en la reproducción (replay-exact) y seguro ante reinicios (restart-safe) »*, capaz de reanudar exactamente donde se quedó tras un fallo. Y **tres skills incluidas de fábrica**: `/plan` (convierte una tarea en un plan sometido a aprobación), **`/grill`** (somete el plan a prueba de estrés *« hasta que se sostenga »*), y `/goal`. **Del lado del modelo**, Meta reivindica **co-entrenamiento modelo-harness** (*« para maximizar la compatibilidad con el harness »*, con trayectorias de harness muestreadas mediante rejection sampling y optimizaciones de receta para objetivos, compactación y sub-agentes), entrenamiento de **largo horizonte** (generación de repositorios completos, proyectos de principio a fin, autoinvestigación, con planificación, condicionamiento por objetivo y compactación de contexto), y un **bucle de auto-mejora** en el que Muse Spark 1.1 genera los entornos y las plantillas de instrucciones y luego califica las soluciones candidatas, produciendo un conjunto de entrenamiento para la 1.2. **Lo que muestran los gráficos publicados**, sin que el texto lo comente: las cuatro comparaciones —Terminal-Bench 2.1, DeepSWE 1.1, un benchmark interno de Meta y el estudio de caso de optimización de kernels GPU— sitúan a **Muse Spark 1.2 por detrás de Opus 5 en los cuatro casos**, incluido en el propio benchmark propietario de Meta (70,6 % frente a 79,4 %) y en el estudio de caso, donde el modelo termina cuarto de seis (+68,7 % frente a +74,0 %). **Una advertencia de lectura sobre la ganancia entre versiones**: en los dos benchmarks públicos, la 1.1 se mide con `mini-swe-agent` y la 1.2 con Muse Code, por lo que la diferencia de 6,7 puntos mezcla progreso del modelo y progreso del harness. En el benchmark interno, la única comparación en la que no se menciona ningún harness, la diferencia 1.1 → 1.2 cae a **2,3 puntos**.

#Meta AI Research#Muse Code#Muse Spark 1.2

**Meta AI Research** — publication institutionnelle sans auteur nommé · sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation · non repris ici.

Transformación y Adopción Traducción verificada automáticamente

Steps of AI Adoption (tableau/artifact + post LinkedIn « I talk to engineers at other companies every day… »)

**Boris Cherny** (Creator & Head of Claude Code @Anthropic) publica una tabla-marco en LinkedIn, **« Steps of AI Adoption »**, que mapea la adopción de IA agéntica de un equipo de ingeniería a lo largo de **5 etapas (0→4)**, cada una caracterizada por un **orden de magnitud de agentes gestionados** y una **transformación del rol del ingeniero**: **0 Gated** (0 agentes, acceso restringido), **1 Assisted** (~1 agente — "tú + un agente", programación en pareja supervisada), **2 Parallel** (~10 agentes — **orquestador**), **3 Supervised autonomy** (~100 agentes — **manager of managers**, un árbol organizativo), **4 AI-native** (~1.000+ agentes — **VP que dirige por intención**). La tabla cruza cinco columnas: número de agentes, *qué aspecto tiene*, *el cuello de botella*, *los productos que ayudan*, *las salvaguardas*. **Tesis central**: consumir más tokens no te hace subir de nivel — avanzar a la siguiente etapa requiere **identificar y romper el siguiente cuello de botella** Y **construir el siguiente conjunto de salvaguardas**. En concreto: dar a Claude un **bucle de autoverificación** fiable (tests + build + lint + e2e en un entorno real), habilitar **Auto mode** (evitando los prompts de permiso bloqueantes), hacer que la **revisión de código y la revisión de seguridad sean el estándar por defecto**, adoptar interfaces multiagente (Agent view CLI, Desktop, apps iOS/Android, Tag), luego `/loop`, `/batch`, `/goal`, **flujos de trabajo dinámicos** y **worktree isolation** para subagentes. Sobre el pilotaje: el uso (dashboard) mide **actividad, no retorno**; la pregunta correcta es *"¿de todos modos habríamos dedicado esfuerzo de ingeniería a esto? si es así, ¿cuántas horas-ingeniero manuales habría costado?"* — ese es el ROI. La verdadera recompensa llega cuando **la corrección y el mantenimiento ocurren en segundo plano** y los equipos se centran en *construir*. Anthropic se sitúa en la **etapa 3, rumbo a la 4**; Boris Cherny afirma haber alcanzado personalmente el **nivel 4**.

#Boris Cherny#Claude Code#Anthropic

Boris Cherny (Creator & Head of Claude Code @Anthropic)

Agentes de codificación IA y Skills Traducción verificada automáticamente

Loop Engineering: The Guide for AI Agents

Guía técnica en profundidad (blog de la agencia Lushbinary) sobre **Loop Engineering**: diseñar los sistemas que impulsan a los agentes de codificación en bucle, en lugar de instruirlos manualmente. Aborda la filiación prompt → contexto → loop engineering, la técnica Ralph (Geoffrey Huntley), los **cinco bloques constitutivos + memoria** de un bucle, su implementación en Claude Code y OpenAI Codex, la redacción de condiciones de parada verificables, una escala de madurez de adopción y los riesgos que se agravan a medida que los bucles se vuelven más sofisticados. Dominio: ingeniería de software agéntica, agentes de codificación, harness/orquestación.

#Loop engineering#agentes de codificación#harness engineering

Lushbinary Team