Vai al contenuto

root / tags / codex

#Codex

18 fiches

Agenti di codifica IA e Skills Traduzione verificata automaticamente

DeepSeek Harness developer preview: Everything is a plugin

Pagina prodotto ufficiale di **DeepSeek**, pubblicata il **13 agosto 2026**, **non firmata**, di circa 450 parole, che annuncia il rilascio in *developer preview* di **DeepSeek Harness** (`dsh`) — un harness per agenti di coding **open source con licenza MIT**, il cui repository è stato aperto lo stesso giorno. Una tesi in tre parole, ripetuta nel titolo e nella descrizione del repository: *« Everything is a plugin »*, affiancata da una seconda promessa, *« Every run is traceable »*. La pagina enuncia l'equazione *« AGENT = MODEL + HARNESS »* ed elenca le capacità innestabili come plugin — *« models, tools, skills, sessions, sandboxes, storage, loops, scheduling, and the UI »*. Vengono rilasciate quattro modalità: **modalità Standard** (agente di coding completo), **mode Code** (strumenti esposti tramite il *Code Mode SDK*, che permette al modello di comporre operazioni multi-step all'interno di un programma TypeScript), **mode Minimal** (*« two-tool coding agent with persistent bash and str_replace_editor »*, esplicitamente *« for benchmarking models in a minimal environment »*), e **modalità Creator** (ispezione a runtime, test di plugin in memoria). La sostanza tecnica risiede nel repository, non nella pagina: `docs/architecture.md` enuncia un invariante di logging — *« Model-visible means logged. Anything that reaches a model request must be reconstructable from the log, and a runtime invariant asserts it »* — e afferma che *« there is no privileged core to patch »*. Il nucleo tecnico non è farina del sacco di DeepSeek: DSH è costruito su **Cordis** (il progetto `cordiverse`, terza parte), **vendorizzato** in `vendor/` con un manifesto e una procedura di sincronizzazione, e la pagina colloca il *« Cordis paper »* allo stesso livello di navigazione di "GitHub" e "Developer docs". Vengono rilasciati due adapter LLM — `dsh-llm-deepseek` e `dsh-llm-pi-ai`, un adapter generico multi-provider. Il repository avverte in maiuscolo: *« THERE WILL BE COMPATIBILITY-BREAKING CHANGES »*, e `CLAUDE.md` specifica che `SESSION_FORMAT_VERSION` resta a `0` *« with no compatibility promise »*, con i backend che rifiutano i vecchi formati su disco. Cronologia: DSH viene rilasciato lo stesso giorno in cui **DeepSeek-V4-Pro raggiunge la GA**, tre giorni prima dell'entrata in vigore di un nuovo listino prezzi API il **16 agosto 2026 alle 16:00 UTC**, con tariffe di picco/fuori picco e uno sconto fuori picco del **−50%**.

#DeepSeek Harness#dsh#harness per agenti

**DeepSeek** (DeepSeek AI, laboratoire chinois) · en tant qu'institution. Page produit **non signée** : aucun auteur · aucun ingénieur mis en avant · aucun billet de blog ni papier technique associé. Le « nous » n'apparaît qu'une fois · en dernière phrase — *« We look forward to exploring the limits of intelligence with developers worldwide »*. Publiée le **13 août 2026**. La page est rendue en JavaScript : `curl` sur l'URL renvoie **HTTP 202 avec un corps vide** · le texte n'existant qu'après exécution du bundle. Deux documents de politique sont liés en pied de page — *Safe Use Policy* et *Data Processing Statement*.

Architettura e Costruzione Traduzione verificata automaticamente

Buzz (buzz.xyz) — Rapport de recherche pour présentation

Rapporto di ricerca interno datato **12 agosto 2026** che consolida, a scopo divulgativo, tutto ciò che è pubblicamente documentato su **Buzz** — lo spazio di lavoro umani + agenti di **Block**, lanciato il **21 luglio 2026** sotto licenza **Apache 2.0**. Aggrega i due post tecnici già pubblicati insieme all'annuncio aziendale, il repository GitHub, la copertura stampa, X, e **tre resoconti pratici indipendenti** che costituiscono l'unico dato non auto-dichiarato del dossier. **(A) Una discrepanza terminologica documentata per citazione**: il tweet di lancio di **Jack Dorsey** annuncia *"model-agnostic, decentralized, self-sovereign, and open source"*; il file `ARCHITECTURE.md` di Block afferma *"The relay is the single source of truth. All reads and writes flow through it. There is no peer-to-peer event exchange, no gossip, no replication."* Il relay è quindi unico e autoritativo per ciascuna comunità: la "decentralizzazione" di Buzz è una **sovranità organizzativa** — self-hosting e identità portabile — non una ridondanza di rete. La formulazione di **TFTC**: *"Two of those three hold cleanly. The third needs a qualifier."* **(B) Un'asimmetria tra rigore dimostrato e rischio di sfruttamento.** Da un lato, un grado di formalismo raro per una v0.4.x/0.5.x: specifica di isolamento multi-tenant **meccanizzata in TLA+**, proprietà di autorizzazione verificate in **Tamarin**, un protocollo di storage Git verificato tramite model-checking, un log di audit append-only con hash-chain, 127 *event kinds*, NIP-01/42/98/34. Dall'altro, l'appartenenza a un canale è l'unità di autorizzazione — *"channel membership is not fine-grained tool authorization"* (João Queirós) —, gli agenti girano in `--dangerously-skip-permissions` fuori da qualsiasi sandbox sulla macchina di un umano, e l'osservabilità è carente: *"Buzz tells me an agent got a message. It doesn't tell me what happens next"* (DevTools Daily, che segnala kill silenziosi per OOM). Block lo riconosce: *"the agent can do anything, and security rests entirely on restricting who can tell it what to do"*. **(C) Lo stack tecnico**, assente dai post pubblicati: relay in **Rust** (Axum WS + REST), **Postgres**, **Redis**, **S3/MinIO** via Blossom, client desktop **Tauri + React**. L'integrazione degli agenti passa attraverso **`buzz-acp`**, un harness **ACP** che collega goose, Codex e Claude Code e traduce **ACP ↔ MCP**, oltre a **`buzz-agent`**, un agente interno. Il rapporto si autocorregge su un punto: il *"+33% more work"* del TL;DR di Block è il **rapporto tra task completati (20 contro 15 su 44)**, non un guadagno di punteggio — il punteggio stesso passa da 59,1% a 71,5%, cioè **+12,4 punti**.

#Buzz#buzz.xyz#Block

**Deep Research Veille Interne** — rapport non signé · produit le **12 août 2026** en préparation d'une présentation. Aucune URL publique ; source archivée dans `raw-data/`.

Strumenti e Piattaforme Traduzione verificata automaticamente

ChatGPT Desktop & Claude Desktop vs versions web — Rapport « What ? — So What ? — Now What ? »

Rapporto di ricerca interno datato **12 agosto 2026** (in formato *What? — So What? — Now What?*, indagine condotta tra l'11 e il 12 agosto) su una domanda semplice: le applicazioni **desktop** di ChatGPT e Claude sono migliori delle rispettive versioni **web**? La risposta si articola in due parti. **(A) Esiste un consenso qualitativo solido e ben documentato.** Il punto di partenza è indiscutibile: desktop e web richiamano esattamente gli stessi modelli cloud, l'applicazione essendo solo un'interfaccia verso il servizio — il guadagno risiede quindi interamente nell'involucro applicativo (latenza d'accesso, stabilità nelle sessioni lunghe, impronta di memoria, integrazioni di sistema, fluidità del workflow). Ciò che distingue realmente il desktop, confermato: sul versante OpenAI, una scorciatoia globale (Option/Alt + Spazio), una *companion window* che resta sempre in primo piano, screenshot nativi e, da luglio 2026, la capacità agentica **Codex/Work** integrata nell'app; sul versante Anthropic, **Quick Entry** (macOS), **Desktop Extensions** (installare un server **MCP** locale diventa *"semplice quanto cliccare un pulsante"*), accesso ai file locali, **Cowork** e **Computer Use** (permessi di Accessibilità e registrazione dello schermo). Il web conserva due punti di forza confermati: schede/thread multipli e universalità senza client da installare. **(B) Quasi tutte le cifre in circolazione a sostegno di questo consenso non reggono alla verifica.** L'audit critico del rapporto (§1.5) classifica come **non confermate** sette affermazioni numeriche ampiamente ripetute: il *cold start* "2-3 s contro 8-12 s" (l'unica traccia essendo un aneddotico *"si carica in circa 3 secondi"* su Substack); l'uso di RAM "200-700 MB contro 1,2-2 GB", attribuito a un "Alibaba Product Insights" le cui pagine restituiscono **404**; una percentuale di malfunzionamenti e un dato di retention delle sessioni non rintracciabili; un "Claude +10-20% end-to-end" attribuito a **Skywork**, che in realtà aveva confrontato il proprio agente Windows piuttosto che Claude rispetto al web; una fonte "Cosmo Edge" non rintracciabile; citazioni Zenken AI non confermate; e due post X non autenticati e privi di URL. Il controsegnale è documentato con lo stesso rigore: Yuri Dvoinos descrive un'app Claude Desktop che *"mi fa venire voglia di buttare il portatile dalla finestra"* — utilizzo CPU al 68%, input lag su un MacBook Pro — e il rapporto rileva che entrambe le app sono build **Electron** con livelli nativi. Da qui la formulazione: *il vantaggio del desktop è una promessa di implementazione, non una legge di natura.* **Il "So What"**: poiché il modello è diventato il comune denominatore, l'interfaccia diventa il terreno di scontro — la fusione **Codex + ChatGPT** del 9 luglio 2026 e il tandem Cowork/Computer Use raccontano la stessa storia, *"l'app desktop non è più un client di chat, è un runtime agentico con accesso alla macchina."* Tre conseguenze: il guadagno è un guadagno di **attrito**, non di potenza; per un CIO, il desktop **sposta il confine di fiducia** — Computer Use richiede permessi di sistema sensibili e la fusione Codex colloca esecuzione del codice, browser e connettori all'interno di *"un unico confine di fiducia esteso,"* mentre il browser resta governabile tramite SSO, DLP e CASB; e per chi pubblica, la fragilità delle cifre è essa stessa la notizia. **Il "Now What"** fornisce criteri di scelta individuali, una checklist per il CIO (censire i permessi, disattivare Computer Use e Cowork per impostazione predefinita, delimitare quali estensioni MCP sono autorizzate, organizzare distribuzione e aggiornamenti — su Linux, al di fuori del repository apt, Claude Desktop non si aggiorna da solo) e una direttiva editoriale: citare solo verbatim e date confermati.

#ChatGPT Desktop#Claude Desktop#versione web

**Deep Research Veille Interne** — rapport non signé · produit par une enquête sourcée menée les **11-12 août 2026** et rendu le 12.

Agenti di codifica IA e Skills Traduzione verificata automaticamente

Efficient Tokens & Effective Teams in Buzz

Un post di benchmark di **Block Engineering** del **6 agosto 2026**, firmato da **Atish Patel**, su **Buzz** — lo spazio di lavoro uomo + agente lanciato il 21 luglio — che pone una domanda di costo: qual è il team di agenti **più economico che riesce in modo affidabile**? Tre risultati. **(A) Un risultato negativo, pubblicato per intero**: su **Terminal-Bench 2.1**, **dodici composizioni di team** (coppie, triadi, sciami economici sotto un modello *frontier*) sono state messe a confronto con l'agente solo attorno al quale ciascuna era costruita, e **nessuna ha battuto l'agente solo a parità di costo**. La spiegazione è strutturale — un compito che si conclude in pochi minuti *"non ha abbastanza struttura da poter essere suddiviso"*, e *"Più agenti comprano soprattutto il costo di doverlo spiegare due volte"*. **(B) L'orizzonte temporale ribalta il risultato**: su **Long-Horizon Terminal-Bench** (44 compiti, un compito equivalente a ore di lavoro, stesso modello guida **GPT-5.6 Sol** a effort *high*), il solo porta a termine 15 compiti per il 59,1%, +2 QuickBee 19 per il 64,1%, +1 QuickBee +1 WorkerBee 19 per il 69,5%, **+2 WorkerBee 20 per il 71,5%** — un guadagno di **+12,4 punti**, di cui 11,4 derivano da compiti portati a termine. *"Stessi posti, risultato opposto, perché il lavoro ha una forma diversa."* Queste esecuzioni sono girate a **3× il timeout**, solo incluso. **(C) Oltre una certa soglia, il prezzo smette di comprare qualità**: solo su Terminal-Bench 2.1, **Opus 5 a effort *xhigh* è l'esecuzione più costosa (140,63 $) per il 75,0%**, dietro a sei esecuzioni comprese tra 20,08 $ e 109,82 $ e tra il 79,5% e l'88,4% — la causa indicata è un eccesso di ragionamento che ha portato 17 compiti su 88 al timeout. Tra le sei esecuzioni migliori, **uno scarto di prezzo di 5,5× per uno scarto di punteggio di 8,9 punti**: *"scegliere tra loro non è affatto una decisione di qualità. È una decisione di budget."* Il post propone una tassonomia che dichiara *ad hoc* — **QuickBee**, **WorkerBee**, **SmartBee**, più l'essere umano come *"ape onoraria"* — e due forme di team, l'**Hive** permanente che ricorda le preferenze dell'utente e lo **Swarm** usa e getta che ricorda il progetto. Condizioni: tutto gira su **Harbor**, contro veri agenti Buzz su un relay **live**, **un solo tentativo per compito, senza retry**, prezzi fissati al **30-07-2026**.

#Buzz#Block#team di agenti

- **Atish Patel** — *« Building AI solutions @ Block »* · auteur unique du billet · publié le **6 août 2026** sur `engineering.block.xyz`.

Agenti di codifica IA e Skills Traduzione verificata automaticamente

Introducing Muse Code and Muse Spark 1.2

Annuncio di **Meta AI Research** pubblicato il **5 agosto 2026** (tempo di lettura indicato: 4 minuti, nessuna firma individuale): **Muse Code** in beta, *« un agente di coding da terminale »*, e il modello che lo alimenta, **Muse Spark 1.2**. È Meta stessa a inquadrare il lancio: *« This marks our next step toward the frontier, with larger and much more capable models on the way. »* **Tre elementi architetturali sul lato harness.** **Agenti asincroni in background** che *« remain active throughout each session, rather than being spawned for individual tasks »*, evitando raccolte di informazioni ridondanti e riducendo la necessità di guida manuale. Un **registro eventi locale** dove *« every model call, tool run, approval, and edit is appended »*, che rende il runtime un sistema *« replay-exact and restart-safe »*, capace di riprendere esattamente da dove si era interrotto dopo un crash. E **tre skill fornite di serie**: `/plan` (trasforma un compito in un piano sottoposto ad approvazione), **`/grill`** (mette alla prova il piano *« until it holds up »*), e `/goal`. **Sul lato modello**, Meta rivendica il **co-training modello-harness** (*« to maximize harness compatibility »*, con traiettorie di harness campionate tramite rejection sampling e ottimizzazioni delle ricette per obiettivi, compaction e sub-agenti), un addestramento **long-horizon** (generazione dell'intero repository, progetti end-to-end, self-research, con pianificazione, goal conditioning e compaction del contesto), e un **ciclo di auto-miglioramento** in cui Muse Spark 1.1 genera gli ambienti e i template di istruzioni e poi valuta le soluzioni candidate, producendo un set di addestramento per la 1.2. **Ciò che mostrano i grafici pubblicati**, senza che il testo li commenti: i quattro confronti — Terminal-Bench 2.1, DeepSWE 1.1, un benchmark interno Meta e il case study di ottimizzazione di kernel GPU — collocano **Muse Spark 1.2 dietro Opus 5 in tutti e quattro i casi**, incluso sul benchmark proprietario di Meta stessa (70,6% contro 79,4%) e sul case study, dove il modello si classifica quarto su sei (+68,7% contro +74,0%). **Un'avvertenza di lettura sul guadagno di versione**: sui due benchmark pubblici, la 1.1 è misurata con `mini-swe-agent` e la 1.2 con Muse Code, per cui lo scarto di 6,7 punti confonde progresso del modello e progresso dell'harness. Sul benchmark interno, l'unico confronto in cui non viene menzionato alcun harness, lo scarto 1.1 → 1.2 scende a **2,3 punti**.

#Meta AI Research#Muse Code#Muse Spark 1.2

**Meta AI Research** — publication institutionnelle sans auteur nommé · sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation · non repris ici.

Agenti di codifica IA e Skills Traduzione verificata automaticamente

ACP : deux protocoles, un sigle, zéro rapport

Nota di veglia tecnologica di **Didier Girard** datata **2 agosto 2026**, nata dalla domanda di un collega ("cos'è ACP?") per affrontare un problema che non è terminologico ma **documentario**. **Tre protocolli si contendono l'acronimo**, senza alcuna sovrapposizione tecnica: **Agent Client Protocol** (client ↔ agente — Zed, agosto 2025, JSON-RPC 2.0 su stdio, Apache-2.0, "ciò che LSP ha fatto per i linguaggi"), **Agentic Commerce Protocol** (agente ↔ commerciante — OpenAI + Stripe, 29 settembre 2025, in concorrenza con l'**UCP** di Google dell'11 gennaio 2026 sostenuto da **AP2**), e **Agent Communication Protocol** (agente ↔ agente — IBM Research / BeeAI, marginale ma che inquina le ricerche). **Il cuore della nota non è lo scioglimento dell'ambiguità ma il suo fallimento osservato**: l'autore cerca "ACP" nella propria base di conoscenza di veglia tecnologica e ottiene **dodici risultati, tutti relativi al protocollo di commercio, zero su quello di Zed** — *"i nostri agenti di veglia avevano indicizzato l'acronimo senza disambiguarlo"*. Da qui una regola di ingegneria della conoscenza: ***"un acronimo nudo non viene mai indicizzato"*** — l'entità è "Agent Client Protocol", "ACP" è **solo un alias**, portato da tre entità distinte. Segue una precisazione strutturante (**MCP collega un agente ai suoi strumenti, ACP collega un client a un agente; i due si sovrappongono**), poi il caso di scuola: **Buzz**, pubblicato da **Block** il 21 luglio 2026 sotto Apache-2.0 — uno spazio di lavoro auto-ospitabile costruito su **Nostr**, dove ogni partecipante umano o agente è una **coppia di chiavi** e ogni messaggio, passo di workflow o git push è un **evento firmato** in un log append-only. Un'architettura interamente basata su protocolli (`buzz-acp` un harness ACP su stdio, `buzz-agent` un agente ACP che chiama un LLM, `buzz-dev-mcp` un server shell + editing MCP), da cui l'agnosticismo verso gli agenti: **Goose, Claude Code e Codex** si collegano tramite lo stesso harness, e **Hermes** (Nous Research) vi si è collegato senza che Block scrivesse una sola riga — *"N+M invece di N×M, in produzione"*. La nota si chiude sulla questione dell'**abbonamento Claude** rispetto agli agenti terzi, con una cronologia in cinque tappe per il 2026 e una **regola di design** che vale oltre questo caso: la linea di demarcazione non è legale ma **architetturale** — ***"chi consuma, e per conto di chi"*** (un agente `owner-only` consuma il tuo abbonamento per tuo conto; un agente `anyone` in un canale condiviso instrada le richieste dei tuoi colleghi attraverso il tuo account). **Verifica effettuata su questo corpus**: la tesi regge, e in modo più netto di quanto affermi la nota — non solo "Agent Client Protocol" è **completamente assente**, ma l'acronimo nudo `ACP` **è già tipizzato come entità** in due schede, e la pagina della KB `Agentic-Commerce-Protocol` **attribuisce già il protocollo a Google** quando invece appartiene a OpenAI + Stripe. La collisione descritta non è un rischio futuro: ha **già prodotto un errore di attribuzione** nel grafo.

#ACP#Agent Client Protocol#Agentic Commerce Protocol

**Didier Girard** — auteur de la note. Écrit ici depuis la position de **praticien de la veille outillée** : le déclencheur est une question de collègue · le matériau principal est le comportement observé de sa propre base de connaissances · et la conclusion est une **règle de curation** adoptée en interne. Le texte alterne donc deux voix — l'explicateur de protocoles et l'ingénieur de la connaissance qui constate un défaut chez lui et en tire une norme.

Architettura e Costruzione Traduzione verificata automaticamente

Buzz!

Annuncio di **Block** del **21 luglio 2026**, firmato da **Tyler Longwell**: **Buzz**, uno spazio di lavoro *open source* e **self-hostable**, organizzato per canali, in cui esseri umani e agenti condividono la stessa stanza — chat, ricerca, automazione e **hosting Git** su un unico server, costruito su **Nostr**, un protocollo aperto per messaggi firmati e identità portabili. Tesi di apertura: *« I modelli ora sono in grado di fare il lavoro. I team hanno comunque bisogno di un posto dove farlo insieme. Il collo di bottiglia si è spostato dall'intelligenza al coordinamento. »* Tre elementi di ingegneria. **(A) Identità dell'agente.** Il punto di partenza è un rifiuto — smettere di prestare le proprie credenziali a un bot: *« Abbiamo lasciato che i bot si travestissero da noi. È strano. È pericoloso. »* Ogni agente riceve **una chiave propria**, il suo proprietario firma un'**autorizzazione a perimetro ristretto**, dopodiché l'agente firma il proprio lavoro con la propria identità. La crittografia della delega è convenzionale; la scelta di design lo è meno: *« l'autorizzazione non cancella la paternità »* — l'agente resta l'autore, la sua *credential* attesta chi lo ha autorizzato e a quali condizioni. Conseguenze immediate: la chiave di un agente compromessa viene revocata senza toccare l'identità umana, e il ritiro del proprietario impedisce all'agente di riconnettersi, mentre le sue sessioni attive devono essere terminate separatamente. **(B) Git su object storage.** L'osservazione: *« In passato Git ha sempre avuto un comodo limitatore di frequenza: gli esseri umani »* — un gruppo di agenti produce mesi di commit-persona e CI in un solo pomeriggio, con molti scrittori simultanei, su forge dimensionate per dita umane. Buzz memorizza i repository come **packfile immutabili e indirizzati per contenuto** più un **unico puntatore di manifest mutabile**; un *push* scrive prima gli oggetti, poi fa avanzare il puntatore tramite un **compare-and-swap condizionale**, ed è proprio quello swap il punto di commit — gli eventi dello spazio di lavoro annunciano il cambiamento, non lo definiscono. Il protocollo è **specificato in TLA+ e verificato tramite model checking** (durabilità, ricostruzione, push concorrenti), con il risultato limitato che dipende da tre garanzie esplicite dell'object store, da cui una **suite di conformità** che ogni backend deve superare. **(C) Interoperabilità e privacy.** Claude Code, Codex, goose *« e qualsiasi agente che parli Agent Client Protocol »* funzionano dentro Buzz; cambiare modello o harness lascia intatte identità, permessi e cronologia del progetto. Telemetria e cancellazione viaggiano come messaggi cifrati effimeri, memoria e contabilità dei costi come messaggi cifrati durevoli — *« il server vede i metadati di instradamento, non quei payload »*. Argomento sulla memoria: *« Una forge convenzionale conserva il diff e una spunta verde. Buzz conserva anche il motivo per cui la correzione ovvia era sbagliata. »* Argomento anti-lock-in: se Buzz sparisse, identità e cronologia firmata resterebbero verificabili, Git resterebbe Git.

#Buzz#Block#spazio di lavoro agentico

**Tyler Longwell** — *« Building multi-player AI at Block »* · auteur unique et signataire à la première personne. Publié le **21 juillet 2026** sur le blog Block Engineering.

Economia e Mercato Traduzione verificata automaticamente

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

Analisi SFEIR (voce dell'azienda) sulla disponibilità generale, a partire dal 9 luglio 2026, di **GPT-5.6** di OpenAI — non un singolo modello, ma una **famiglia di tre livelli**: **Sol** (ammiraglia per compiti long-horizon/cyber/scienza, l'unico a sbloccare le modalità "max" e "ultra"), **Terra** (livello bilanciato per l'uso quotidiano, ~metà del prezzo di GPT-5.5) e **Luna** (veloce/economico, alto volume). Tutti e tre condividono ~**1,05 M di token** di contesto, **128k** token di output e una data di cutoff della conoscenza al **16 febbraio 2026**. Il fatto più strutturante non è un punteggio, ma una **griglia tariffaria aggressiva** (Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$ per milione di token): Sol mantiene il prezzo dell'ammiraglia precedente pur essendo più capace, spostando il confronto sul **rapporto capacità-costo**. Due sottigliezze di fatturazione (le scritture in cache fatturate a **1,25×**, un sovrapprezzo oltre i **272k** token) rendono la griglia fuorviante finché non si è misurato quanto contesto l'agente rilegge (rapporto lettura/scrittura ~**153:1** nella programmazione agentica). Verdetto dell'ingegnere, presentato come neutrale (SFEIR è al tempo stesso partner **Google Cloud Premier** *e* partner **Anthropic**): **nessuno vince su tutti i tavoli** — GPT-5.6 domina Terminal-Bench 2.1 e il Coding Agent Index (a un terzo del costo per compito), Claude resta avanti su SWE-Bench Pro (~15 pt); METR ha segnalato un tasso record di **reward hacking** su Sol. Conclusione: "smettere di cercare il campione, imparare a instradare" — il modello è un commodity, il vantaggio duraturo risiede nel **Context Engineering/Harness Engineering**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)

Agenti di codifica IA e Skills Traduzione verificata automaticamente

What...what am I missing here? (post X sur les LLMs et le codage)

Post X di **Eric S. Raymond** (ESR, autore di *The Cathedral and the Bazaar*, co-fondatore della Open Source Initiative, ~50 anni di programmazione) — **una controtestimonianza frontale alla narrazione secondo cui "gli LLM producono codice pessimo e hanno allucinazioni, inutili per la programmazione".** La sua tesi: questo **non gli accade quasi mai**, e **per nulla più negli ultimi due generazioni** di modelli che usa ("chat GPT 5.4 e 5.5" sotto **codex**). Il sintomo precedente — un modello che "esce dai binari" avvicinandosi al proprio limite di contesto — è scomparso: codex ora mostra un **avviso rosso** che invita l'utente a **svuotare la sessione** invece di degenerare. **Ambito d'uso**: IA applicata a **modifiche di funzionalità, refactoring e debugging su 63 progetti** in **C, Go, Rust, Python e shell**; scrittura di documentazione; **decompilazione di un binario DOS in codice sorgente leggibile**. Una **routine di lavoro** consolidata: quando riapre un progetto, esegue prima i **test di regressione**, poi avvia codex e gli chiede di **verificare il codice** (bug + suggerimenti di miglioramento). Verdetto: gli LLM sono **"eccellenti e straordinariamente responsabilizzanti"**; il loro **limite peggiore** è la **"visione a tunnel architetturale"** — eccellenti nel generare codice a partire da specifiche, ma talvolta **ciechi ai pattern di livello superiore** — cosa che considera il **compito del suo "meatbrain".** Il punto più forte, controintuitivo: gli LLM **NON sbagliano i dettagli e i casi limite**; dichiara di essere **peggiore di loro** su questo fronte (nonostante 50 anni di esperienza), perché se una modifica deve **toccare cinque punti**, il modello **li trova tutti e cinque in modo affidabile**, mentre l'essere umano ne corregge quattro e **passa ore a fare debugging** prima di trovare il quinto dimenticato. Interroga poi i **"downshouters"**: vivono in un **universo diverso**? Usano **modelli vecchi e deboli**? C'è uno **skill issue** che lui non vede perché le sue **abitudini mentali e la sua comunicazione** si adattano bene agli "handle" di questi strumenti? Una questione che considera importante da chiarire, poiché "**miliardi di dollari verrebbero sprecati in una spesa di token mal indirizzata**". La sua ricetta, "molto semplice": **"Sii chiaro nel pensiero, di' al modello ciò che vuoi con precisione, e succedono cose buone"** — chiudendo con: "cosa mi sto perdendo qui?" Da leggere come un **contrappunto pro-LLM da parte di una figura storica dell'open source** al dibattito ricorrente sulla (s)valutazione degli agenti di codifica — facendo eco allo "skill issue" e alla disciplina delle specifiche (cfr. [[martignole-token-manifesto-2026-07-17]]), e formando un dittico con la posizione dottrinale pro-strumenti-IA di **Linus Torvalds** a nome del kernel Linux ([[torvalds-llm-outil-kernel-2026-07-14]]).

#Eric S. Raymond#ESR#esrtweet

Eric S. Raymond (ESR, @esrtweet sur X) — développeur · hacker et essayiste américain · **figure historique du mouvement open source**. Né le 4 décembre 1957 à Boston (Massachusetts) ; paralysie cérébrale de naissance · enfance en partie au Venezuela puis en Pennsylvanie. Auteur de l'essai très influent **« The Cathedral and the Bazaar »** (1997, livre 1999) · qui oppose le modèle « cathédrale » (développement centralisé et fermé) au modèle « bazar » (décentralisé et ouvert, à la Linux) ; il a **popularisé le terme « open source »** (contre « free software ») et contribué à convaincre **Netscape** d'ouvrir son code (naissance de Mozilla). **Co-fondateur de l'Open Source Initiative (OSI)** en 1998 · président jusqu'en 2005. A édité le **Jargon File** (*The New Hacker's Dictionary*) · maintenu des projets comme **Fetchmail** · écrit **« The Art of Unix Programming »** (2003). Se revendique **libertarien** · défenseur du port d'armes · ceinture noire de taekwondo ; commente régulièrement tech · politique et open source sur X. Se présente ici comme codeur « très · très bon » avec **~50 ans d'expérience**. (Post X personnel ; date de publication : 2026-07-08 ; date d'ajout à la veille : 2026-07-17.)

Agenti di codifica IA e Skills Traduzione verificata automaticamente

What Anthropic's New Claude Billing Means for Zed Users

Post del blog **Zed** firmato da **Franciska Dethlefsen** (head of growth and marketing), pubblicato il **14 maggio 2026** — il giorno dopo l'annuncio di Anthropic — per rispondere alle domande degli utenti Zed. **Oggetto**: a partire dal **15 giugno**, Anthropic **divide la fatturazione degli abbonamenti Claude in due pool** — uno per i suoi **strumenti proprietari** (chat, la CLI ufficiale Claude Code), l'altro per l'**uso di agenti e SDK di terze parti** (tutto ciò che passa tramite **ACP**, `claude -p`, o uno strumento di terze parti). L'uso via ACP **smette quindi di attingere ai limiti Pro o Max** e passa a un **credito mensile "Agent SDK"**: **20 dollari per Pro, 100 dollari per Max 5x, 200 dollari per Max 20x**. Una volta esaurito il credito, l'uso continua **al prezzo API standard** se l'overage è abilitato — altrimenti le richieste si interrompono fino al ciclo successivo. **La cifra che guida l'articolo**: gli abbonamenti avevano fino ad allora sovvenzionato l'uso agentico con un fattore di **circa 15-30×** rispetto al prezzo API, e i nuovi crediti sono fatturati **ai prezzi API pieni** — da cui *« for anyone using agents heavily, this is a major cost increase »*. **Vengono proposte tre opzioni**, in un ordine che rivela la posizione di Zed: (1) mantenere l'abbonamento eseguendo la **CLI ufficiale `claude` in un terminale dentro Zed** anziché via ACP — *« when the official claude CLI runs in the terminal, it uses your subscription's limits, not the new credit »*; (2) usare l'agente integrato di Zed con il provider a scelta (modelli ospitati da Zed, chiavi API, Copilot, Ollama locale, DeepSeek); (3) collegare **qualsiasi agente ACP** — OpenCode, Codex, Factory, Cursor —, diversi dei quali offrono ancora abbonamenti a limiti di frequenza che sovvenzionano l'uso intensivo. **La tesi di fondo**, e la vera ragione del post: *« ACP is an open protocol… so that your editor is never locked into one provider's pricing decisions »*, con l'anticipazione esplicita che *« this kind of change won't be the last »*. **Il post porta un'aggiunta datata 16 giugno 2026** che annuncia che **la modifica è sospesa**: ACP, `claude -p`, l'Agent SDK e le applicazioni di terze parti continuano a funzionare con gli abbonamenti **come prima**, nessun credito separato da rivendicare, limiti invariati, Anthropic sta rivedendo il proprio piano con un preavviso annunciato. **L'artefatto è quindi autocontraddittorio**: il suo contenuto più importante — il dietrofront — è successivo di un mese alla propria data di pubblicazione.

#Zed#Anthropic#abbonamento Claude

**Franciska Dethlefsen** — head of growth and marketing chez **Zed Industries**. Le rôle est déterminant pour lire le texte : ce n'est pas un billet d'ingénierie mais une **communication de crise produit** · écrite le lendemain d'une annonce d'un fournisseur dont Zed dépend · à destination d'utilisateurs inquiets. La signature growth/marketing explique la structure (problème → options → réassurance) et le fait que l'argument protocolaire arrive en conclusion plutôt qu'en tête.

Agenti di codifica IA e Skills Traduzione verificata automaticamente

Google's Design.md is a design team in a file (Greg Isenberg × Meng To)

Podcast di Greg Isenberg × Meng To (designer, fondatore di Design+Code, creatore dei prodotti Aura / New Form / Dream Cut) su **`design.md`** — la convenzione open-source di Google, equivalente a `agents.md` / `skills.md` / `soul.md` ma **per il design system** (tipografia, colori, spaziature, animazioni WebGL/Three.js, regole di reveal). Idea centrale: portare la "**anima del design**" in un file markdown che viene consegnato a un agente (Claude Code, Codex, OpenClaude, Gemini, Stitch, Aura, V0, Lovable, Cursor) per preservare la **coerenza cross-medium** (web, mobile, Replit slides, motion design Hyperframes/Remotion). Triade insegnata: **HTML = piatto finito, design.md = ricetta, skills = ingredienti** (skill di tipografia, laser, skeuomorfismo, 3D — 63 in New Form). Diagnosi principale: il **design drift** nei workflow one-shot (`v0`, Lovable, Framer) che partono bene ma poi degradano verso un risultato generico. Messaggio chiave: il *taste* è l'unico **vantaggio competitivo** rimasto — *"se qualcosa somiglia a qualcos'altro, il suo valore scende da 10× a 100×"*. Workflow: **Reference → Design.md → Generate → Inspect → Systemize → Iterate (fino a 1000+ prompt) → Remix → Expand → Export**. Critica dei **gradienti viola** ("you just run") come baseline generica post-vibe-coding. Meng To dichiara di aver speso circa 500.000 $ in token, eseguito 1.000-10.000 iterazioni per prodotto e gestito 4 prodotti in parallelo da solo.

#design.md#Google#design system

Greg Isenberg (host — podcast Late Checkout / The Greg Isenberg Show, 12 mai 2026 livestream workshop ideabrowser.com) ; **Meng To** (guest — designer, fondateur Design+Code 2014, créateur Aura / New Form / Dream Cut, autodidacte parti à 18 ans, dropout, francophone d'origine canadienne)

Trasformazione e Adozione Traduzione verificata automaticamente

« On est dans une boîte de Petri » : la Silicon Valley, ce pays où les agents IA sont déjà des collègues

Les Echos (Florian Dèbes) reportage da San Francisco: agenti IA già integrati come colleghi nelle start-up, "capsula di Petri" (Aaron Levie / Box), riflesso Claude prima di ogni riunione, Jarvis personale, 5 schede di agenti in parallelo, "il fattore limitante è la cognizione umana" (Patrick Joubert / Rippletide), "brain fry" / surriscaldamento cognitivo, studio BCG/HBR che indica il 14% dei dipendenti sopraffatti, modalità di classifica "token-max" per i maggiori utilizzatori di IA, testimonianze di Sinaï/Bangay/Allali/Hodjat/Pantera/Chapeau e un'eco di Siddhant Khare ("l'IA riduce i costi di produzione ma aumenta i costi di coordinamento").

#Silicon Valley#San Francisco#agenti IA come colleghi

Florian Dèbes (Les Echos, rubrique Travailler mieux / Vie au travail)

Trasformazione e Adozione Traduzione verificata automaticamente

The AI-native interview

Revisione del processo di selezione degli ingegneri presso Sierra nell'era degli agenti di codifica: colloquio in sede AI-native (Plan/Build/Review), eliminazione del test di codifica algoritmica, sostituzione del colloquio telefonico con un colloquio di system design, sperimentazione di un colloquio di debugging su una codebase esistente.

#assunzione di ingegneri#colloquio tecnico#agenti di codifica

Vijay Iyengar · Arya Asemanfar · Angie Wang

Trasformazione e Adozione Traduzione verificata automaticamente

The AI-native interview

Colloquio di lavoro AI-native da Sierra — Revisione radicale del processo di selezione ingegneristica — Plan/Build/Review — Sierra Blog

#colloquio di lavoro#selezione AI-native#processo di selezione

Bret Taylor