Saltar al contenido

root / tags / multi-agents

#multi-agents

4 fiches

Agentes de codificación IA y Skills Traducción verificada automáticamente

Efficient Tokens & Effective Teams in Buzz

Una entrada de referencia de **Block Engineering** del **6 de agosto de 2026**, firmada por **Atish Patel**, sobre **Buzz** —el espacio de trabajo humano + agentes lanzado el 21 de julio— que plantea una pregunta de costo: ¿qué equipo de agentes es **el más barato que tiene éxito de forma fiable**? Tres hallazgos. **(A) Un resultado negativo, publicado íntegramente**: en **Terminal-Bench 2.1**, **doce composiciones de equipo** (parejas, tríos, enjambres baratos bajo un modelo *frontier*) se enfrentaron al agente solo en torno al cual cada una fue construida, y **ninguna lo superó a igualdad de costo**. La explicación es estructural — una tarea que termina en minutos *"no tiene suficiente estructura para dividirse"*, y *"más agentes compra sobre todo el costo de explicarlo dos veces"*. **(B) El horizonte invierte el resultado**: en **Long-Horizon Terminal-Bench** (44 tareas, una tarea que vale horas de trabajo, mismo líder **GPT-5.6 Sol** con esfuerzo *high*), el agente solo termina 15 tareas para un 59,1%, +2 QuickBees 19 para un 64,1%, +1 QuickBee +1 WorkerBee 19 para un 69,5%, **+2 WorkerBees 20 para un 71,5%** — una ganancia de **+12,4 puntos**, de los cuales 11,4 provienen de tareas llevadas hasta su finalización. *"Mismos puestos, resultado opuesto, porque el trabajo tiene una forma distinta."* Estas ejecuciones corrieron con **3× el timeout**, incluido el agente solo. **(C) Más allá de un umbral, el precio deja de comprar calidad**: en solitario en Terminal-Bench 2.1, **Opus 5 con esfuerzo *xhigh* es la ejecución más cara (140,63 $) para un 75,0%**, por detrás de seis ejecuciones que van de 20,08 $ a 109,82 $ y de 79,5% a 88,4% — la causa señalada es un sobrerrazonamiento que llevó a 17 de 88 tareas al timeout. Entre las seis mejores ejecuciones, **una brecha de precio de 5,5× para una brecha de puntuación de 8,9 puntos**: *"elegir entre ellas no es en absoluto una decisión de calidad. Es una decisión de presupuesto."* La entrada propone una taxonomía que reconoce como *ad hoc* — **QuickBee**, **WorkerBee**, **SmartBee**, además del humano como *"abeja honoraria"*— y dos formas de equipo, el **Hive** permanente que recuerda las preferencias del usuario y el **Swarm** desechable que recuerda el proyecto. Condiciones: todo se ejecuta en **Harbor**, contra agentes Buzz reales en un relé **en vivo**, **un intento por tarea, sin reintento**, precios fijados a fecha de **30-07-2026**.

#Buzz#Block#equipos de agentes

- **Atish Patel** — *« Building AI solutions @ Block »* · auteur unique du billet · publié le **6 août 2026** sur `engineering.block.xyz`.

Arquitectura y Construcción Traducción verificada automáticamente

The End of Code Review: Coding Agents Supersede Human Inspection

Un artículo de arXiv (cs.SE) de Martin Monperrus que defiende una tesis radical para el SDLC: los agentes de codificación han superado un umbral de capacidad tal que **la revisión de código humana ya no es un componente necesario** de un pipeline de calidad. Dos afirmaciones: (1) los sistemas autónomos basados en LLM alcanzan todos los objetivos de la revisión (detección de defectos, calidad, cumplimiento) con menor coste y mayor rendimiento; (2) el modelo híbrido "el agente escribe, el humano revisa" es insostenible — no garantiza una calidad real y no escala al ritmo de la velocidad de la IA, generando una "falsa sensación de seguridad". Monperrus contrasta la inspection de Fagan (1976) con un **pipeline de verificación adversarial multi-agente** (agente generador + agentes revisores independientes + tests/métodos formales + consenso basado en voto). El humano se reenfoca en la especificación, las decisiones arquitectónicas, la aprobación de dominios críticos y los casos límite. Recomendaciones: pilotar primero en componentes de bajo riesgo, medir agente frente a humano, hacer explícitas las decisiones de rechazo.

#code review#code review#inspection de Fagan

Martin Monperrus