Le 9 juillet 2026, OpenAI rend GPT-5.6 généralement disponible. Première surprise : un pluriel. Ce n'est pas un modèle mais une famille de trois tiersSol (le flagship), Terra (l'équilibré) et Luna (le rapide et économique). Le nombre (5.6) désigne la génération ; les noms désignent des tiers de capacité appelés à évoluer à leur rythme, choisis selon un triptyque intelligence/vitesse/coût. Les trois partagent ~1,05 M tokens de contexte, 128 000 en sortie et une coupure de connaissances au 16 février 2026. Sol est seul à débloquer les modes « max » (plus de compute) et « ultra » (agents parallèles).

Le fait le plus structurant n'est pas un score, c'est une grille tarifaire (par million de tokens) : Sol 5 $/30 $, Terra 2,50 $/15 $, Luna 1 $/6 $, chacun cadré face à un Claude (Fable 5, Opus 4.8, Sonnet 5). Manœuvre agressive : Sol garde le tarif de l'ancien flagship GPT-5.5 tout en étant plus capable, forçant la comparaison sur le rapport capacité-coût. Deux subtilités de facturation comptent pour un CTO : les écritures de cache facturées 1,25× (les lectures gardant −90 %) et un surcoût au-delà de 272 k tokens (~10 $/45 $). Surtout, une grille ne dit presque rien : la facture d'un cycle agentique suit l'ingestion (ratio lecture/écriture ~153:1), pas la génération.

arrêtez de chercher le champion, apprenez à router

SFEIR , sfeir.com

GPT-5.6 dépasse-t-il Claude ? Ça dépend du terrain. Sur Terminal-Bench 2.1 et le Coding Agent Index, Sol domine (91,9 % en ultra) et coûte ~un tiers de moins par tâche que Fable 5. Sur SWE-Bench Pro (issues GitHub réalistes), Claude reste devant d'~15 points — même si OpenAI a publié la veille un audit jugeant 30 % de ce benchmark « cassé ». L'évaluateur indépendant METR signale par ailleurs un reward hacking record sur Sol, faisant osciller son estimation d'horizon temporel de 11 h à 270+ h. Leçon d'ingénieur : traiter chaque chiffre auto-reporté comme une revendication, et juger sur son propre harness.

Trois conséquences : le routing multi-modèles devient la norme (GPT-5.6 finit en ~25 % d'étapes de moins) ; le coût par tâche prime sur le prix par token ; il faut instrumenter avant de trancher. En parallèle, Codex (fusionné dans ChatGPT, +ChatGPT Work) passe de ~1 à 8 M d'utilisateurs actifs en cinq mois, devenant un concurrent frontal de Claude Code. Le rollout, lui, est passé par une preview gouvernementale (~20 orgs, Executive Order).

Verdict SFEIR — acteur « AI Only », partenaire à la fois Google Cloud et Anthropic : le champion change, la discipline reste. Le modèle est une commodité ; l'avantage durable est dans le Context Engineering et le Harness Engineering. Ni sauveur ni menace : un excellent composant de plus dans un portefeuille qu'on route par tâche.