Un post di benchmark di **Block Engineering** del **6 agosto 2026**, firmato da **Atish Patel**, su **Buzz** — lo spazio di lavoro uomo + agente lanciato il 21 luglio — che pone una domanda di costo: qual è il team di agenti **più economico che riesce in modo affidabile**? Tre risultati. **(A) Un risultato negativo, pubblicato per intero**: su **Terminal-Bench 2.1**, **dodici composizioni di team** (coppie, triadi, sciami economici sotto un modello *frontier*) sono state messe a confronto con l'agente solo attorno al quale ciascuna era costruita, e **nessuna ha battuto l'agente solo a parità di costo**. La spiegazione è strutturale — un compito che si conclude in pochi minuti *"non ha abbastanza struttura da poter essere suddiviso"*, e *"Più agenti comprano soprattutto il costo di doverlo spiegare due volte"*. **(B) L'orizzonte temporale ribalta il risultato**: su **Long-Horizon Terminal-Bench** (44 compiti, un compito equivalente a ore di lavoro, stesso modello guida **GPT-5.6 Sol** a effort *high*), il solo porta a termine 15 compiti per il 59,1%, +2 QuickBee 19 per il 64,1%, +1 QuickBee +1 WorkerBee 19 per il 69,5%, **+2 WorkerBee 20 per il 71,5%** — un guadagno di **+12,4 punti**, di cui 11,4 derivano da compiti portati a termine. *"Stessi posti, risultato opposto, perché il lavoro ha una forma diversa."* Queste esecuzioni sono girate a **3× il timeout**, solo incluso. **(C) Oltre una certa soglia, il prezzo smette di comprare qualità**: solo su Terminal-Bench 2.1, **Opus 5 a effort *xhigh* è l'esecuzione più costosa (140,63 $) per il 75,0%**, dietro a sei esecuzioni comprese tra 20,08 $ e 109,82 $ e tra il 79,5% e l'88,4% — la causa indicata è un eccesso di ragionamento che ha portato 17 compiti su 88 al timeout. Tra le sei esecuzioni migliori, **uno scarto di prezzo di 5,5× per uno scarto di punteggio di 8,9 punti**: *"scegliere tra loro non è affatto una decisione di qualità. È una decisione di budget."* Il post propone una tassonomia che dichiara *ad hoc* — **QuickBee**, **WorkerBee**, **SmartBee**, più l'essere umano come *"ape onoraria"* — e due forme di team, l'**Hive** permanente che ricorda le preferenze dell'utente e lo **Swarm** usa e getta che ricorda il progetto. Condizioni: tutto gira su **Harbor**, contro veri agenti Buzz su un relay **live**, **un solo tentativo per compito, senza retry**, prezzi fissati al **30-07-2026**.
#Buzz#Block#team di agenti
- **Atish Patel** — *« Building AI solutions @ Block »* · auteur unique du billet · publié le **6 août 2026** sur `engineering.block.xyz`.
Guida di Augment Code (Paula Hingel) che descrive come gli agenti IA stiano ristrutturando il ciclo di vita dello sviluppo software (SDLC), fase per fase. Tesi: l'IA produce **maggiore throughput in alcune fasi e maggiore rischio di instabilità in altre** — un sintomo di un'adozione disomogenea che non ridisegna i confini della revisione. Si basa su **DORA 2025**: l'adozione dell'IA è correlata positivamente al throughput di delivery e alle prestazioni di prodotto, ma **negativamente alla stabilità**. Sei fasi rilette (Requisiti, Design/Architettura, Implementazione, Testing/QA, Deployment, Manutenzione), tre rischi principali (erosione della pipeline junior, **validazione circolare** dei test generati dall'IA, lacune di governance su larga scala) e tre ruoli emergenti (**Intent Engineering**, Agentic DevOps, AI Governance/Assurance). Raccomandazioni operative: verificare una fase prima di scalare, sottoporre la governance a stress test, rendere centrale la **specifica**, definire policy di rollback esplicite, ridisegnare il ruolo junior attorno alla revisione.
#SDLC#software development lifecycle#agenti di coding
Agente semantico: la simmetria tra modello+harness e ontologia+dati, il collasso dei framework agentici, l'ontologia come unico asset non commoditizzato
Ruolo dello sviluppatore di fronte agli agenti di codifica IA, esperimento di un giorno con il metodo BMAD, evoluzione verso il supervisore di agenti - Blog tecnico