# patel-block-buzz-teams-tokens-benchmarks-2026-08-06

## Veille

Una entrada de referencia de **Block Engineering** del **6 de agosto de 2026**, firmada por **Atish Patel**, sobre **Buzz** —el espacio de trabajo humano + agentes lanzado el 21 de julio— que plantea una pregunta de costo: ¿qué equipo de agentes es **el más barato que tiene éxito de forma fiable**? Tres hallazgos. **(A) Un resultado negativo, publicado íntegramente**: en **Terminal-Bench 2.1**, **doce composiciones de equipo** (parejas, tríos, enjambres baratos bajo un modelo *frontier*) se enfrentaron al agente solo en torno al cual cada una fue construida, y **ninguna lo superó a igualdad de costo**. La explicación es estructural — una tarea que termina en minutos *"no tiene suficiente estructura para dividirse"*, y *"más agentes compra sobre todo el costo de explicarlo dos veces"*. **(B) El horizonte invierte el resultado**: en **Long-Horizon Terminal-Bench** (44 tareas, una tarea que vale horas de trabajo, mismo líder **GPT-5.6 Sol** con esfuerzo *high*), el agente solo termina 15 tareas para un 59,1%, +2 QuickBees 19 para un 64,1%, +1 QuickBee +1 WorkerBee 19 para un 69,5%, **+2 WorkerBees 20 para un 71,5%** — una ganancia de **+12,4 puntos**, de los cuales 11,4 provienen de tareas llevadas hasta su finalización. *"Mismos puestos, resultado opuesto, porque el trabajo tiene una forma distinta."* Estas ejecuciones corrieron con **3× el timeout**, incluido el agente solo. **(C) Más allá de un umbral, el precio deja de comprar calidad**: en solitario en Terminal-Bench 2.1, **Opus 5 con esfuerzo *xhigh* es la ejecución más cara (140,63 $) para un 75,0%**, por detrás de seis ejecuciones que van de 20,08 $ a 109,82 $ y de 79,5% a 88,4% — la causa señalada es un sobrerrazonamiento que llevó a 17 de 88 tareas al timeout. Entre las seis mejores ejecuciones, **una brecha de precio de 5,5× para una brecha de puntuación de 8,9 puntos**: *"elegir entre ellas no es en absoluto una decisión de calidad. Es una decisión de presupuesto."* La entrada propone una taxonomía que reconoce como *ad hoc* — **QuickBee**, **WorkerBee**, **SmartBee**, además del humano como *"abeja honoraria"*— y dos formas de equipo, el **Hive** permanente que recuerda las preferencias del usuario y el **Swarm** desechable que recuerda el proyecto. Condiciones: todo se ejecuta en **Harbor**, contra agentes Buzz reales en un relé **en vivo**, **un intento por tarea, sin reintento**, precios fijados a fecha de **30-07-2026**.

## Titre Article

Efficient Tokens & Effective Teams in Buzz

## Date

2026-08-06

## URL

https://engineering.block.xyz/blog/effective-teams-buzz

## Keywords

Buzz, Block, equipos de agentes, composición de equipo, multiagente, orquestación, QuickBee, WorkerBee, SmartBee, abeja honoraria, taxonomía de niveles, Hive, Swarm, equipo permanente, equipo desechable, memoria de persona, memoria de proyecto, asiento en vez de sesión, escalado, coordinador, verificador independiente, intermediario humano, último revisor, Terminal-Bench 2.1, Long-Horizon Terminal-Bench, LHTB, Harbor, relé en vivo, resultado negativo, tareas largas, estructura divisible, sobrecarga de coordinación, timeout, sobrerrazonamiento, esfuerzo de razonamiento, esfuerzo medio, esfuerzo alto, esfuerzo xhigh, tokens de razonamiento, costo por tarea, decisión de presupuesto, rendimientos decrecientes, GPT-5.6 Luna, GPT-5.6 Terra, GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash, DeepSeek V4 Flash, Kimi K3, modelos locales, suscripción a Claude Code, Codex, multiproveedor, migración masiva, Leigh Maddock, Atish Patel, revisión de PR, triaje de tests inestables

## Authors

- **Atish Patel** — *« Building AI solutions @ Block »*, auteur unique du billet, publié le **6 août 2026** sur `engineering.block.xyz`.
- **Leigh Maddock** — Engineer @ Block, cité en encadré pour un témoignage de migration (2 000+ apps/projets).

Billet de benchmarks écrit par l'éditeur du produit mesuré. Deux éléments à porter avec cette réserve : Block publie un **résultat négatif sur sa propre fonctionnalité phare**, et rappelle trois fois que **les modèles ne sont pas les siens** (OpenAI, Anthropic, Google, DeepSeek, Moonshot AI) — la métrique optimisée, *« le moins cher qui réussit »*, étant aussi celle qui valorise un workspace multi-fournisseurs.

## Ton

**Perfil**: una entrada de referencia con finalidad prescriptiva, registro de ingeniería pragmático, estructurada como una guía de compra. Audiencia: equipos que ya ejecutan múltiples agentes y vigilan su factura de inferencia.

**Estilo**: abre con un **TL;DR de siete líneas**, cada línea combina una recomendación con su cifra, y luego alterna recomendación → gráfico → lectura del gráfico. La metáfora de las abejas se lleva hasta convertirse en una taxonomía utilizable (QuickBee, WorkerBee, SmartBee, *abeja honoraria*), con ilustraciones, y la propia entrada desactiva el efecto jerga: *"Nota: Hive y Swarm son términos específicos de este blog que hemos acuñado"*. El propósito declarado de esta tabla es explícito — *"El nivel + el esfuerzo recomendado ayuda a eliminar el ruido de los lanzamientos de modelos"*: razonar en niveles para dejar de seguir cada lanzamiento de modelo. La honestidad se escenifica y se sostiene: *"la primera respuesta no fue la que esperábamos"*, seguida del resultado negativo publicado íntegramente, y de asteriscos que anotan las anomalías en la tabla (Opus 5 llegando al timeout, Kimi K3 y DeepSeek V4 Flash sin soportar el esfuerzo *medium*). El costo se enmarca como un problema social interno: *"Pagar precios de frontera por la primera ejecución es la manera de acabar explicando una factura de inferencia en una reunión a la que no querías ir."*

**Frases distintivas**:
- ***"La abeja correcta. El equipo correcto. La tarea correcta."***
- ***"Deja de ser un intermediario"*** · ***"Deja de niñerear a la IA"***
- ***"Pagar más deja de ayudar, y luego empieza a perjudicar"***
- ***"no es en absoluto una decisión de calidad. Es una decisión de presupuesto"***
- ***"Mismos puestos, resultado opuesto, porque el trabajo tiene una forma distinta"***
- ***"más agentes compra sobre todo el costo de explicarlo dos veces"***
- ***"en un modelo barato, los tokens de razonamiento son la mejor inversión disponible"***
- ***"el modo de fallo de las herramientas de agentes no es que el trabajo sea malo, es que cada ambigüedad se convierte en una notificación"***

**Postura epistémica**: inusualmente bien delimitada para una entrada de proveedor. Se explicitan las condiciones (Harbor, agentes Buzz reales en un relé en vivo, un intento por tarea sin reintento, precios a fecha de 2026-07-30, LHTB con 3× el timeout, *"Ninguno de los resultados siguientes se midió en un banco de pruebas reducido"*), se anotan las anomalías, y una conclusión se presenta como provisional: *"Esto podría cambiar si los modelos se entrenan para colaborar mejor."* Falta, sin embargo: cualquier intervalo de confianza, el costo de equipo en LHTB, y la variación de líder en la comparación de equipos; **n=1 por tarea**.

## Pense-betes

- **Fecha / fuente**: **6 de agosto de 2026**, `engineering.block.xyz`, firmado por **Atish Patel**. Mediciones en **Harbor**, agentes Buzz reales en un relé en vivo, **un intento por tarea, sin reintento**, precios a fecha de **30-07-2026**.
- **Encuadre clave**: la pregunta planteada no es "cuál es el mejor equipo" sino "cuál es el más barato que tiene éxito de forma fiable". Todos los hallazgos se derivan de eso. ### Resultado negativo en tareas cortas En **Terminal-Bench 2.1**, doce composiciones — parejas, tríos, enjambres baratos bajo un líder *frontier* — se enfrentaron al agente solo en torno al cual cada una fue construida: **ninguna lo superó a igualdad de costo**. La razón señalada es estructural: una tarea que termina en minutos no tiene suficiente estructura para dividirse, y *"más agentes compra sobre todo el costo de explicarlo dos veces."* Regla resultante: no montar un equipo para trabajo corto y bien especificado. Contrapeso empírico a la entrada de lanzamiento [[longwell-block-buzz-workspace-agents-nostr-2026-07-21]]. ### El horizonte invierte el resultado Long-Horizon Terminal-Bench, 44 tareas, líder GPT-5.6 Sol con esfuerzo *high* para todas las alineaciones: | Alineación | Tareas terminadas /44 | Puntuación | |---|---|---| | SmartBee solo | 15 | 59,1% | | + 2 QuickBees | 19 | 64,1% | | + 1 QuickBee + 1 WorkerBee | 19 | 69,5% | | **+ 2 WorkerBees** | **20** | **71,5%** | +12,4 puntos, de los cuales **11,4 son finalizaciones adicionales**: el equipo no rinde mejor, termina el trabajo. Tres salvedades: ejecuciones con 3× el timeout (incluido el agente solo), costo de equipo no publicado, n=1 por tarea. Criterio de decisión propuesto por la entrada: el equipo justifica su costo adicional *"cuando la alternativa es que un humano retome un trabajo inacabado"*. ### El techo de rendimientos decrecientes del precio En solitario en Terminal-Bench 2.1, **Opus 5 con esfuerzo *xhigh* = 140,63 $ para un 75,0%**, la ejecución más cara, por detrás de seis ejecuciones entre 20,08 $ y 109,82 $ (79,5% a 88,4%). Causa señalada: sobrerrazonamiento, con 17 de 88 tareas alcanzando el timeout. Esto es ante todo un artefacto de tiempo real — una propiedad de la combinación modelo × harness × timeout, no una medida de capacidad bruta. Lo que sigue siendo procesable: *"Pagar más deja de ayudar, y luego empieza a perjudicar"*, y un SmartBee con esfuerzo *medium* basta para la mayoría de las tareas. Entre las seis mejores ejecuciones: **una brecha de precio de 5,5× para una brecha de puntuación de 8,9 puntos**, que la entrada trata como un empate dado este tamaño de muestra. *"Todo lo que va de Terra con esfuerzo medium hacia arriba es el mismo agente en lo que estas tareas pueden distinguir. Lo cual es una buena noticia, porque significa que elegir entre ellos no es en absoluto una decisión de calidad. Es una decisión de presupuesto."* Alcance limitado a este benchmark, estos precios y este harness. ### Esfuerzo de razonamiento: la disyuntiva se invierte según el nivel En un modelo barato, aumentar el esfuerzo es la mejor inversión: **Luna medium = 1,61 $ / 57,3%** → **Luna high = 4,98 $ / 75,0%**. En un modelo de frontera, aumentar el esfuerzo cuesta más y degrada el resultado. | Nivel | Esfuerzo recomendado | Trabajo | Ejemplos citados | |---|---|---|---| | **QuickBee** | max / xhigh / high | builds, capturas de pantalla, batería de tests, triaje de primera pasada | GPT-5.6 Luna, DeepSeek V4 Flash, modelos locales | | **WorkerBee** | high / xhigh | un subconjunto completo de extremo a extremo, sin supervisión | GPT-5.6 Terra, Gemini 3.6 Flash, modelos abiertos | | **SmartBee** | medium | visión de conjunto, compromisos, absorción de escaladas | Claude Opus 5, Kimi K3, GPT-5.6 Sol | | **Humano** | — | *"La abeja más cara del equipo, y la más lenta. También, sigue siendo la más inteligente."* | — | El punto de inversión depende de los timeouts locales: volver a probar antes de generalizar. ### Hive o Swarm: ¿qué debería recordar el equipo?
- **Hive** — un equipo **permanente** de agentes con nombre, cada uno con un rol y una memoria de **las** preferencias del usuario. Argumento acumulativo: *"La segunda vez que revisa el código de tu compañero, sabe qué detalles menores dejas pasar. La décima vez, ponerlo al día es más rápido que ponerlo al día a una persona."*
- **Swarm** — un equipo **desechable** para un proyecto con inicio y fin (migración, actualización de framework, refactor grande), que acumula una memoria **del proyecto** y luego se elimina. Criterio de elección: ¿el sujeto a recordar es el usuario, o el proyecto? Requisito previo asumido: el agente es **un asiento, no una sesión** — nombre, persona, memoria, presencia propia en el canal. ### Topología de escalado Diagnóstico: *"El modo de fallo de las herramientas de agentes no es que el trabajo sea malo, es que cada ambigüedad se convierte en una notificación."* El coordinador SmartBee absorbe la rutina (test inestable, importación ambigua, configuración movida) y **escribe las respuestas humanas en memoria**, de modo que supervisar el Swarm se vuelve más barato con el tiempo. *"El humano deja de ser un intermediario y vuelve a ser el último revisor."* Pregunta calificadora para hacer sobre cualquier herramienta multiagente: ¿adónde van las escaladas, y aprende la herramienta de las respuestas? ### Testimonio de migración **Leigh Maddock**, Ingeniero en Block: *"Migré más de 2000 aplicaciones/proyectos usando Buzz y un Swarm de agentes"*, con 1 coordinador, de 1 a 10 migradores en paralelo, y 1 verificador independiente, gestionando el coordinador la mayoría de las escaladas. Testimonio, no una medición: sin duración, sin costo, sin tasa de fallos, sin definición de "migrado". El patrón sigue siendo transferible — la misma forma que los *minions* de un solo intento descritos en [[gray-stripe-minions-coding-agents-part1-2026-02-09]], con la adición del verificador independiente y la memoria de escalado. ### Composiciones listas para usar | Caso | Composición | |---|---| | Revisión de PR | SmartBee que revisa el PR + QuickBee que compila localmente y genera capturas de pantalla | | Triaje de tests inestables | QuickBee que vuelve a ejecutar los tests y recopila evidencia + SmartBee que decide | | Trabajo corto | un único agente, posiblemente un QuickBee en tareas relacionadas pero distintas | Denominador común: el nivel caro lee y decide, el nivel barato ejecuta y recopila evidencia. ### Posicionamiento comercial Buzz acepta suscripciones a **Claude Code** y **Codex**, modelos abiertos y modelos locales: *"No estás atado a un solo proveedor ni obligado a asignar cada tarea al modelo más caro por pereza."* La composición predeterminada propuesta es explícitamente tri-proveedor. La tesis "el mejor modelo no siempre es el adecuado" es cierta y comercialmente útil para quien vende el componente en lugar del modelo. Véase también [[paymentsdive-block-dorsey-pricing-ia-2026-08-06]]. ### Condiciones experimentales, a copiar si se repite el ejercicio Harbor; agentes Buzz reales en un relé en vivo (*"Ninguno de los resultados siguientes se midió en un banco de pruebas reducido"*); un intento por tarea, sin reintento, con timeouts; LHTB con 3× el timeout, incluido el agente solo; precios a fecha de 2026-07-30; Kimi K3 y DeepSeek V4 Flash no soportan el esfuerzo *medium*. Sin intervalo de confianza, n=1 — la propia entrada reconoce el empate entre seis ejecuciones como un efecto del tamaño de muestra. Tratar estas cifras como órdenes de magnitud.

## RésuméDe400mots

Una entrada de referencia de **Block** firmada por **Atish Patel**, publicada el **6 de agosto de 2026**, que prolonga el lanzamiento de **Buzz**: dado que montar un equipo de agentes se ha vuelto trivial, *¿cuál es el más barato que tiene éxito de forma fiable?*

**Primero, el vocabulario.** La entrada propone cuatro niveles: **QuickBee** (rápida y barata — builds, capturas de pantalla, tests, triaje de primera pasada: GPT-5.6 Luna, DeepSeek V4 Flash, modelos locales, **ejecutada con esfuerzo alto**), **WorkerBee** (versátil, se encarga de un subconjunto completo sin supervisión: GPT-5.6 Terra, Gemini 3.6 Flash, modelos abiertos), **SmartBee** (visión de conjunto, compromisos, escaladas: Claude Opus 5, Kimi K3, GPT-5.6 Sol, **con esfuerzo *medium***), y el humano, *"la abeja más cara del equipo, y la más lenta. También, sigue siendo la más inteligente"*. Dos formas de equipo: el **Hive** permanente, que recuerda **las** preferencias del usuario, y el **Swarm** desechable, que recuerda **el proyecto** y luego desaparece.

**El resultado en solitario.** En **Terminal-Bench 2.1**, aumentar el esfuerzo de un **modelo barato** es la mejor inversión: Luna pasa de 1,61 $ / 57,3% (*medium*) a 4,98 $ / 75,0% (*high*). En el otro extremo, **Opus 5 con esfuerzo *xhigh* es la ejecución más cara (140,63 $) y solo obtiene un 75,0%**, tras **alcanzar el timeout en 17 de 88 tareas** por sobrerrazonamiento. Entre las seis mejores ejecuciones: **una brecha de precio de 5,5×, una brecha de puntuación de 8,9 puntos**. Conclusión: *"elegir entre ellas no es en absoluto una decisión de calidad. Es una decisión de presupuesto."*

**El resultado de equipo, en dos actos.** En Terminal-Bench 2.1 se probaron **doce composiciones** y **ninguna superó al agente solo a igualdad de costo** — una tarea corta no tiene suficiente estructura para dividirse. En **Long-Horizon Terminal-Bench** (44 tareas de varias horas, líder GPT-5.6 Sol, **3× el timeout**), la inversión es clara: solo **15 tareas / 59,1%**, +2 WorkerBees **20 / 71,5%** — **+12,4 puntos, de los cuales 11,4 provienen de finalizaciones adicionales**. El equipo cuesta más por tarea, lo cual compensa *"cuando la alternativa es que un humano retome un trabajo inacabado"*.

**La regla operativa.** Encaminar las escaladas de los agentes trabajadores a un **coordinador SmartBee** en lugar de al humano: *"cada ambigüedad se convierte en una notificación"* es el verdadero modo de fallo. Un ingeniero de Block afirma haber **migrado más de 2000 aplicaciones** con un Swarm (coordinador, de 1 a 10 migradores, verificador independiente), guardando el coordinador las respuestas humanas en memoria.

**Salvedades**: n=1 por tarea, sin intervalo de confianza, costos de equipo no publicados, y una admisión — *"esto podría cambiar si los modelos se entrenan para colaborar mejor."*

## GrapheDeConnaissance

- Block —publie→ des benchmarks d'équipes d'agents exécutés sur de vrais agents Buzz via un relais live, une tentative par tâche et sans retry (AFFIRMATION, 0.96)
- Atish Patel —travaille_chez→ Block (ORGANISATION, 0.96)
- Leigh Maddock —travaille_chez→ Block (ORGANISATION, 0.95)
- Block —mesure→ aucune des douze compositions d'équipe testées sur Terminal-Bench 2.1 n'a devancé l'agent solo équivalent en rapport qualité-prix (MESURE, 0.96)
- Block —affirme_que→ une tâche courte n'a pas assez de structure pour être divisée, et ajouter des agents ne fait qu'acheter le coût de l'expliquer deux fois (CITATION, 0.94)
- Block —mesure→ sur Long-Horizon Terminal-Bench, une équipe SmartBee + 2 WorkerBees termine 20 tâches sur 44 pour 71,5 %, contre 15 tâches et 59,1 % pour le SmartBee solo (MESURE, 0.96)
- équipe d'agents à horizon long —améliore→ le nombre de tâches menées à terme : +12,4 points de récompense moyenne, dont 11,4 points imputables aux complétions supplémentaires (MESURE, 0.94)
- équipe d'agents à horizon long —s_applique_à→ le travail qui court sur des heures ou se répète sur plusieurs jours, pas les tâches courtes et bien spécifiées (AFFIRMATION, 0.94)
- Block —mesure→ Claude Opus 5 en effort xhigh est le run solo le plus cher de Terminal-Bench 2.1 à 140,63 dollars pour 75,0 %, sous six runs facturés de 20,08 à 109,82 dollars (MESURE, 0.95)
- Claude Opus 5 —s_oppose_à→ le mur d'horloge du harness en effort xhigh : le sur-raisonnement a provoqué un timeout sur 17 des 88 tâches (AFFIRMATION, 0.93)
- effort de raisonnement élevé —améliore→ le score d'un modèle bon marché pour un coût marginal faible : GPT-5.6 Luna passe de 1,61 dollar et 57,3 % en medium à 4,98 dollars et 75,0 % en high (MESURE, 0.95)
- effort de raisonnement élevé —s_oppose_à→ le rendement d'un modèle frontier, où payer davantage cesse d'aider puis commence à nuire (AFFIRMATION, 0.92)
- Block —affirme_que→ au-delà d'un certain tier les modèles sont indiscernables sur ces tâches, si bien que choisir entre eux n'est plus une décision de qualité mais une décision de budget (CITATION, 0.95)
- Block —mesure→ un écart de prix de 5,5 fois pour 8,9 points de score entre les six meilleurs runs solo de Terminal-Bench 2.1 (MESURE, 0.94)
- Block —recommande→ de faire tourner les QuickBees et WorkerBees en effort élevé et de réserver les tokens de SmartBee à la coordination, au jugement et aux décisions difficiles (AFFIRMATION, 0.95)
- Hive —permet→ de maintenir une équipe permanente d'agents nommés dont la mémoire accumule les préférences de l'utilisateur (AFFIRMATION, 0.94)
- Swarm —permet→ de monter une équipe jetable pour un projet borné, dont la mémoire partagée retient les cas particuliers du projet et disparaît avec lui (AFFIRMATION, 0.94)
- Swarm —est_variante_de→ Hive (METHODOLOGIE, 0.85)
- escalade agent-vers-agent —résout→ le mode de défaillance de l'outillage agentique, où chaque ambiguïté devient une notification pour l'humain (AFFIRMATION, 0.95)
- escalade agent-vers-agent —réduit→ le coût de supervision d'un Swarm au fil du temps, le coordinateur écrivant les réponses humaines en mémoire (AFFIRMATION, 0.93)
- Leigh Maddock —affirme_que→ plus de 2 000 apps et projets ont été migrés chez Block avec un Swarm composé d'un coordinateur, de 1 à 10 migrateurs parallèles et d'un vérificateur indépendant (AFFIRMATION, 0.9)
- Buzz —permet→ à des agents de se déléguer du travail entre eux et de s'escalader des questions sans qu'un humain relaie quoi que ce soit (AFFIRMATION, 0.95)
- Buzz —s_applique_à→ Claude Code, Codex, modèles ouverts et modèles locaux, avec leurs abonnements existants (AFFIRMATION, 0.94)
- Buzz —permet→ de composer une équipe tri-fournisseurs : Claude Opus 5 en SmartBee, GPT-5.6 Terra en WorkerBee, un modèle local en QuickBee (AFFIRMATION, 0.93)
- Terminal-Bench 2.1 —mesure→ la performance d'agents sur des tâches de terminal courtes, achevées en minutes (AFFIRMATION, 0.9)
- Long-Horizon Terminal-Bench —mesure→ la performance d'agents sur 44 tâches dont chacune représente des heures de travail (AFFIRMATION, 0.92)
- Harbor —permet→ d'exécuter ces benchmarks contre de vrais agents Buzz sur un relais live plutôt que sur un banc d'essai simplifié (AFFIRMATION, 0.91)
- Block —prédit→ que la supériorité de l'agent solo sur les tâches courtes pourrait s'inverser si les modèles sont entraînés à mieux collaborer (AFFIRMATION, 0.9)

---
Canonical: https://www.thekb.eu/es/fiches/patel-block-buzz-teams-tokens-benchmarks-2026-08-06/
