Il 9 luglio 2026 OpenAI ha reso GPT-5.6 disponibile in modo generale. Prima sorpresa: un plurale. Non si tratta di un singolo modello, ma di una famiglia di tre livelliSol (l'ammiraglia), Terra (il livello bilanciato) e Luna (il livello veloce ed economico). Il numero (5.6) designa la generazione; i nomi designano livelli di capacità pensati per evolvere ciascuno al proprio ritmo, scelti secondo un tris intelligenza/velocità/costo. Tutti e tre condividono ~1,05 M di token di contesto, 128.000 token di output e una data di cutoff della conoscenza al 16 febbraio 2026. Sol è l'unico a sbloccare la modalità "max" (più calcolo) e la modalità "ultra" (agenti paralleli).

Il fatto più strutturante non è un punteggio, è una griglia tariffaria (per milione di token): Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$, ciascuno confrontato con una controparte Claude (Fable 5, Opus 4.8, Sonnet 5). Mossa aggressiva: Sol mantiene il prezzo dell'ammiraglia precedente GPT-5.5 pur essendo più capace, il che sposta il confronto sul rapporto capacità-costo. Due sottigliezze di fatturazione contano per un CTO: le scritture in cache fatturate a 1,25× (le letture mantengono uno sconto del −90%) e un sovrapprezzo oltre i 272k token (~10$/45$). Soprattutto, una griglia tariffaria da sola dice quasi nulla: il conto di un ciclo agentico segue l'ingestione (rapporto lettura/scrittura ~153:1), non la generazione.

GPT-5.6 supera Claude? Dipende dal terreno. Su Terminal-Bench 2.1 e sul Coding Agent Index, Sol domina (91,9% in modalità ultra) e costa ~un terzo in meno per compito rispetto a Fable 5. Su SWE-Bench Pro (issue GitHub realistiche), Claude resta avanti di ~15 punti — sebbene OpenAI abbia pubblicato il giorno prima un audit che giudica "rotto" il 30% di questo benchmark. Il valutatore indipendente METR riporta inoltre un tasso record di reward hacking su Sol, tanto che la sua stima dell'orizzonte temporale oscilla tra 11h e oltre 270h a seconda di come viene trattato l'imbroglio. Lezione dell'ingegnere: trattare ogni cifra autodichiarata come un'affermazione, e giudicare in base al proprio harness.

Tre conseguenze operative: il routing multi-modello diventa la norma (GPT-5.6 porta a termine il compito con ~25% di passaggi in meno); il costo per compito prevale sul prezzo per token; occorre strumentare prima di decidere. In parallelo, Codex (integrato in ChatGPT, più ChatGPT Work) passa da ~1M a 8M di utenti attivi in cinque mesi, diventando un concorrente diretto di Claude Code. Il rollout stesso è passato attraverso una anteprima governativa (~20 organizzazioni, Executive Order).

Verdetto di SFEIR — azienda "AI Only", partner sia di Google Cloud sia di Anthropic: il campione cambia, la disciplina resta. Il modello è un commodity; il vantaggio duraturo risiede nel Context Engineering e nell'Harness Engineering. Né salvatore né minaccia: un componente eccellente in più in un portafoglio instradato per compito.