Anuncio de **Meta AI Research** publicado el **5 de agosto de 2026** (tiempo de lectura indicado: 4 minutos, sin firma individual): **Muse Code** en beta, *"un agente de codificación de terminal"*, y el modelo que lo impulsa, **Muse Spark 1.2**. La propia Meta enmarca el lanzamiento: *"Este es nuestro siguiente paso hacia la frontera, con modelos más grandes y mucho más capaces en camino"* — **un paso hacia la frontera, no una gran afirmación**. Del lado del harness se describen **tres elementos arquitectónicos**: **agentes asíncronos en segundo plano** que *"permanecen activos durante toda la sesión, en lugar de crearse para tareas individuales"*, para evitar la recopilación redundante de información y reducir la necesidad de dirección; un **registro de eventos local** donde *"se añade cada llamada al modelo, ejecución de herramienta, aprobación y edición"*, lo que hace que el runtime sea *"exacto en la repetición y seguro ante reinicios"* — capaz de retomar exactamente donde se quedó tras un fallo; y **tres skills incluidas de fábrica** — `/plan` (convierte una tarea en un plan enviado para aprobación), **`/grill`** (pone a prueba el plan *"hasta que se sostiene"*), y `/goal`. Del lado del modelo, Meta afirma haber realizado un **co-entrenamiento del modelo con el harness** (*"para maximizar la compatibilidad con el harness"*, con trayectorias del harness muestreadas mediante rejection sampling y optimizaciones de recetas para objetivos, compactación y subagentes), entrenamiento de **largo horizonte** (generación de repositorios completos, proyectos de extremo a extremo, autoinvestigación, con planificación, condicionamiento de objetivos y **compactación de contexto**), y un **bucle de automejora** en el que Muse Spark 1.1 genera los entornos y las plantillas de instrucciones **y luego califica las soluciones candidatas**, produciendo un conjunto de entrenamiento para 1.2. ⚠️ **El hecho más destacable de este anuncio no aparece escrito en ningún lugar del texto**: los cuatro gráficos publicados — Terminal-Bench 2.1, DeepSWE 1.1, un benchmark interno de Meta y el caso de estudio de optimización de kernels GPU — **sitúan a Muse Spark 1.2 por detrás de Opus 5 en los cuatro casos**, incluido en el propio benchmark propietario de Meta (70.6% frente a 79.4%) y en el caso de estudio, donde el modelo termina **cuarto de seis** (+68.7% frente a +74.0%). ⚠️ **Y la ganancia real del modelo es menor de lo que parece**: en los dos benchmarks públicos, 1.1 se mide con `mini-swe-agent` y 1.2 con Muse Code — la diferencia de 6.7 puntos confunde así modelo y harness. En el benchmark interno, la única comparación en la que no se menciona ningún harness, la diferencia entre 1.1 y 1.2 se reduce a **2.3 puntos**.
#Meta AI Research#Muse Code#Muse Spark 1.2
**Meta AI Research** — publication institutionnelle sans auteur nommé · sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation · non repris ici.
Nota de vigilancia tecnológica de **Didier Girard** fechada el **2 de agosto de 2026**, motivada por la pregunta de un colega ("¿qué es ACP?") que resulta abordar un problema que no es terminológico sino **documental**. **Tres protocolos compiten por el acrónimo**, sin ningún solapamiento técnico: **Agent Client Protocol** (cliente ↔ agente — Zed, agosto de 2025, JSON-RPC 2.0 sobre stdio, Apache-2.0, "lo que LSP hizo por los lenguajes"), **Agentic Commerce Protocol** (agente ↔ comerciante — OpenAI + Stripe, 29 de septiembre de 2025, frente al **UCP** de Google del 11 de enero de 2026 respaldado por **AP2**), y **Agent Communication Protocol** (agente ↔ agente — IBM Research / BeeAI, marginal pero que contamina las búsquedas). **El núcleo de la nota no es el desenredo sino su fracaso observado**: el autor busca "ACP" en su base de conocimiento de vigilancia tecnológica y obtiene **doce resultados, todos sobre el protocolo de comercio, ninguno sobre el de Zed** — *"nuestros agentes de vigilancia habían indexado el acrónimo sin desambiguarlo"*. De ahí una regla de ingeniería del conocimiento: ***"nunca indexar un acrónimo desnudo"*** — la entidad es "Agent Client Protocol", "ACP" es **solo un alias**, portado por tres entidades distintas. Sigue una aclaración estructurante (**MCP conecta un agente con sus herramientas, ACP conecta un cliente con un agente; los dos se apilan**), luego el caso de manual: **Buzz**, publicado por **Block** el 21 de julio de 2026 bajo Apache-2.0 — un espacio de trabajo autoalojable construido sobre **Nostr**, donde cada participante humano o agente es un **par de claves** y cada mensaje, paso de flujo de trabajo o git push es un **evento firmado** en un registro de solo apéndice. Una arquitectura totalmente basada en protocolos (`buzz-acp` un arnés ACP sobre stdio, `buzz-agent` un agente ACP que llama a un LLM, `buzz-dev-mcp` un servidor MCP para shell y edición), de ahí el agnosticismo respecto a los agentes: **Goose, Claude Code y Codex** se conectan a través del mismo arnés, y **Hermes** (Nous Research) se conectó a él sin que Block escribiera una sola línea — *"N+M en lugar de N×M, en producción"*. La nota se cierra con la cuestión de la **suscripción a Claude** frente a agentes de terceros, con una cronología de 2026 en cinco etapas y una **regla de diseño** que se aplica más allá de este caso: la línea no es legal sino **arquitectónica** — ***"quién consume, y en nombre de quién"*** (un agente `owner-only` consume tu suscripción por ti; un agente `anyone` en un canal compartido enruta las solicitudes de tus colegas a través de tu cuenta). ⭐ **Verificación realizada sobre este corpus**: la tesis se sostiene, y de forma más marcada de lo que afirma la nota — no solo "Agent Client Protocol" está **completamente ausente** de él, sino que el acrónimo desnudo `ACP` **ya está tipado como entidad** en dos fichas, y la página de la KB `Agentic-Commerce-Protocol` **ya atribuye el protocolo a Google** cuando pertenece a OpenAI + Stripe. La colisión descrita no es un riesgo aún por venir: **ya ha producido** un error de atribución en el grafo.
**Didier Girard** — auteur de la note. Écrit ici depuis la position de **praticien de la veille outillée** : le déclencheur est une question de collègue · le matériau principal est le comportement observé de sa propre base de connaissances · et la conclusion est une **règle de curation** adoptée en interne. Le texte alterne donc deux voix — l'explicateur de protocoles et l'ingénieur de la connaissance qui constate un défaut chez lui et en tire une norme.
Episodio «Fase 5 · Review» de la serie de SFEIR sobre el SDLC aumentado, publicado **el mismo día** que la publicación de LinkedIn de Addy Osmani, a la que traduce en una especificación de fase. Tesis: **la calidad ha cambiado de dirección** — ya no se lee en el código (los agentes producen más del que nadie puede revisar), sino en **el anillo de restricciones que rodea al agente**. El anillo de Osmani (siete dimensiones —corrección, seguridad, rendimiento, accesibilidad, mantenibilidad, **eficiencia económica**, **comprensibilidad**— vinculadas por la regla de **back-pressure**: «a un bucle solo se le concede la autonomía que se sabe verificar de forma barata y fiable, ni un ápice más») es redibujado, traducido y adjuntado a la fase 5 del ciclo de 11 fases de SFEIR. El corolario estructurante: **el cuello de botella nunca fue la generación, es la verificación** — «la generación es una boca ancha, la verificación un cuello estrecho; acelerar la boca engrosa la pila en el cuello». **La decisión de diseño más interesante es una elección de arquitectura de ciclo**: Review queda deliberadamente **fuera de las tres puertas humanas** (Define, Plan, Ship), porque colocar la puerta en Review equivaldría a situar la atención humana —un recurso finito— como el punto de control de una capacidad de generación que, a su vez, escala: «se habría construido un pipeline cuyo rendimiento máximo es el número de diffs que un senior puede leer antes de que termine el día». De ahí la división: **Review instrumenta, Ship decide** — Review entrega un *cuerpo de evidencia oponible*, Ship decide sobre la evidencia, no sobre el diff completo. Una postura tomada contra Monperrus (cuyo diagnóstico SFEIR conserva —la inspección humana de cada diff no resiste la velocidad agéntica— pero cuya conclusión rechaza: la aceptación no puede delegarse). La trampa nombrada es la **validación circular** (el agente que escribe el código escribe las pruebas que lo validan: «se ha construido un espejo, no un anillo»), con cinco contramedidas tomadas de Anthropic (puertas independientes en ventanas de contexto separadas, determinista + agéntico que nunca se sustituyen entre sí, modo sombra, categorización por riesgo, registro en el SIEM) y la advertencia de Compare the Market (**grafo AST ~70 % frente a RAG vectorial ~58 %**, el RAG rindiendo *peor que sin ningún contexto*). La extensión propia de la firma es **el trinquete**: «cada fuga se convierte en una restricción» — un defecto que ha atravesado el anillo se cierra de nuevo *dentro del anillo* (prueba, regla de lint, rúbrica, guardarraíl del harness) en Compound-1, «el único activo de la cadena que se revaloriza mientras los modelos se deprecian» (una medida interna, no auditable: **−30 % menos iteraciones de corrección tras diez ciclos**). Cierra reformulando la pregunta: «¿es bueno este código?» se ha vuelto una pregunta sin respuesta; lo que queda es **«¿qué se niega mi sistema a dejar pasar?»**
#anillo de restricciones#restricciones alrededor de los agentes#fase Review
SFEIR (voix éditoriale du cabinet, article non signé individuellement) — construit sur Addy Osmani (Google) ; cite Martin Monperrus · Paula Hingel (Augment Code) · DORA/Google Cloud · Jason Clinton (Anthropic) · l'équipe Engineering de Compare the Market
Análisis del gabinete de ingeniería de SFEIR («una lectura de ingeniero») sobre el lanzamiento, el 16 de julio de 2026, de **Kimi K3** por el laboratorio chino **Moonshot AI**: un **modelo de pesos abiertos (open-weights) de nivel frontera** cuyo proveedor afirma **~2,8 billones de parámetros**, un **contexto de un millón de tokens** y una **publicación de los pesos antes del 27 de julio de 2026** (probablemente bajo una licencia Modified MIT, como en el linaje K2). Tesis: una capacidad que antes se creía reservada a los grandes propietarios (Anthropic, OpenAI, Google) está pasando a estar disponible **en pesos abiertos, a precio de descuento, desde un laboratorio chino**. SFEIR —pese a ser **partner de Anthropic y de Google Cloud**, y por tanto «sin ningún interés en sobrevender un modelo chino»— adopta una **advertencia metodológica** cardinal: el día del lanzamiento **no existe ninguna tabla de benchmarks oficial y completa**; las especificaciones (2,8 billones, Kimi Delta Attention, +25 % de eficiencia de entrenamiento) y las puntuaciones son **declaradas por el proveedor** o proceden de **arenas comunitarias**, «que deben tratarse como afirmaciones, no como hechos medidos». La nueva arquitectura (**Kimi Delta Attention**, atención lineal híbrida; decodificación que se afirma hasta **6,3 veces más rápida** a 1M de tokens) rompe con la cadencia de K2 (K2 jul. 2025 → K2.7 Code jun. 2026, un modelo insignia cada dos meses); dos variantes acompañan el lanzamiento (**K3 Max**, **K3 Swarm Max**), con el retiro forzado de la serie kimi-k2.5/moonshot-v1 el **31 de agosto de 2026**. **La verdadera arma es el precio** (~3 $/M de entrada, 0,30 $ en caché, 15 $ de salida según fuentes secundarias): un modelo frontera de pesos abiertos a este nivel **arrastra hacia abajo toda la curva de precio-rendimiento** — la comoditización de la capa de modelo, acelerada por el open source. Pero la singularidad decisiva no es una puntuación: es la **reversibilidad**. Un modelo frontera de pesos abiertos convierte una API consumida (dependencia del proveedor) en una **opción** (autoalojamiento, portabilidad, salida del lock-in), al precio de una infraestructura pesada para alojar 2,8 billones de parámetros. La postura de SFEIR: **el open-weights cambia la pregunta, no solo la respuesta** — ya no «¿qué modelo es mejor/más barato?», sino «¿qué parte de mi sistema estoy dispuesto a hacer depender de un proveedor que no controlo?». La postura correcta sigue siendo un **portafolio enrutado** (un modelo por tarea, un modelo por restricción), y Kimi K3 añade una **columna «reversibilidad»** a la grilla de decisión. La convicción «AI Only» permanece intacta: el modelo es un commodity, la ventaja duradera reside en la ingeniería que lo rodea (Context Engineering, harness, gobernanza de costes, capacidad de cambiar de opinión). Las cifras aún deben validarse «por cuenta propia» — en tus propios repositorios, con tus propios datos.
Tribuna de **Olivier Rafal** (Director de Consultoría Estrategia, **WeNvision** — grupo **SFEIR**; exredactor jefe de *Le Monde Informatique*) publicada el **1 de junio de 2026** en **CIO-Online**, estructurada en torno a una **paradoja**: en la era de la IA, la ingeniería del software **lo cambia todo… y nada cambia**. **Lo que cambia = el modelo operativo.** Los roles se redefinen: el **Product Owner** pasa de la descomposición del backlog a **generar contexto utilizable por la IA**; el **desarrollador** pasa de escribir código a **enmarcar, dirigir y revisar** la ejecución de los agentes; **QA** adquiere la capacidad de definir la **prueba esperada** de antemano. La estructura de equipo pasa de los *"double pizza teams"* (cadenas de traspaso de ~8 personas) a los ***"sandwich teams"***: un **binomio estrecho entre un experto de negocio y un tech lead, ambos aumentados por IA**, con otras competencias en apoyo. Cifra interna de **Sfeir**: *"este binomio impulsa hoy aproximadamente el 80% de la cadena de producción"*, quedando el ~20% restante (arquitectura, gobernanza de datos, seguridad) centralizado. Cita clave: ***"El problema no es un problema de herramientas, sino un problema de modelo operativo."*** **Lo que no cambia = la disciplina del ciclo.** Las fases del **SDLC** (definir → construir → verificar → desplegar → mantener) siguen siendo idénticas y no negociables; la IA no elimina ninguna, las **intensifica**: ***"todo el margen de holgura que el ritmo humano absorbía, de una forma u otra, se convierte, a la velocidad de la IA, en defectos de nivel industrial"*** (metáfora del deporte amateur frente al profesional). De ahí **tres *gates* inviolables** (control humano): **especificación, planificación, revisión de entrega**; validación **por prueba** (no por las propias afirmaciones de la IA); **capitalización sistemática** (cada ciclo enriquece el siguiente) → resultado medido: **−30% de iteraciones de corrección tras ~10 ciclos**. Principio: ***"cuanto más rápida es la ejecución, más estricto debe ser el marco."*** Conceptos movilizados: **harness** (reglas agénticas adaptadas al contexto), **vibe-coding** considerado **insostenible en la empresa**. **Tercer pilar = gobernanza, FinOps y pilotaje orientado al valor**: costes de IA **variables y recurrentes** (~**10 €/hora** por puesto aumentado), paso de la licencia a tanto alzado a la facturación por uso (un paralelismo con el cloud de la década de 2010); el **FinOps** no busca reducir costes sino *"optimizar la eficiencia de las herramientas"* (coste ponderado frente al valor); alinear los **indicadores de negocio** desde el inicio (time-to-market, funcionalidades, rendimiento, ecodiseño). **Conclusión**: la aceleración vuelve **no negociables** los fundamentos; el reto es **organizativo y cultural**, no tecnológico — sin asegurar la relación de negocio y la disciplina colectiva, un SDLC potenciado por IA se limita a **amplificar los problemas** (choca contra el muro más rápido). Prolonga la doctrina de WeNvision de [[rafal-wenvision-ia-generative-produit-techno-pas-projet-2024-02-23]] y [[rafal-wenvision-tokenomics-foundation-finops-ia-2026-06-04]]; converge con *los sistemas alrededor del modelo* [[dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28]], la *ingeniería del harness* [[osmani-agent-harness-engineering-2026-04-19]], el Salesforce agéntico y el debate sobre el *agent manager* (BFM/Girard, SFEIR).
#ingeniería del software#IA#todo cambia nada cambia
**Olivier Rafal** · *Consulting Director Strategy* chez **WeNvision** (groupe **SFEIR**). Ancien **rédacteur en chef du *Monde Informatique*** · et auparavant consultant analyste du marché IT (~10 ans). Tribune publiée dans la rubrique *Tribune* de **CIO-Online**. Publié le **1er juin 2026**.