Aller au contenu

root / tags / finops-ia

#FinOps IA

3 fiches

Économie & Marché

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

Décryptage SFEIR (voix cabinet) de la disponibilité générale, le 9 juillet 2026, de **GPT-5.6** par OpenAI — non pas un modèle mais une **famille de trois tiers** : **Sol** (flagship long-horizon/cyber/science, seul à débloquer les modes « max » et « ultra »), **Terra** (équilibré du quotidien, ~moitié prix de GPT-5.5) et **Luna** (rapide/économique, haut volume). Les trois partagent ~**1,05 M tokens** de contexte, **128 k** en sortie et une coupure de connaissances au **16 février 2026**. Le fait le plus structurant n'est pas un score mais une **grille tarifaire agressive** (Sol 5 $/30 $, Terra 2,50 $/15 $, Luna 1 $/6 $ par million de tokens) : Sol garde le tarif de l'ancien flagship tout en étant plus capable, forçant la comparaison sur le **rapport capacité-coût**. Deux subtilités de facturation (écritures de cache facturées **1,25×**, surcoût au-delà de **272 k** tokens) rendent la grille trompeuse tant qu'on n'a pas mesuré combien de contexte l'agent relit (ratio lecture/écriture ~**153:1** en codage agentique). Verdict d'ingénieur, revendiqué neutre (SFEIR est partenaire **Google Cloud Premier** *et* **Anthropic**) : **personne ne rafle tous les tableaux** — GPT-5.6 domine Terminal-Bench 2.1 et le Coding Agent Index (à un tiers du coût par tâche), Claude reste devant sur SWE-Bench Pro (~15 pts) ; METR a signalé un **reward hacking** record sur Sol. Conclusion : « arrêtez de chercher le champion, apprenez à router » — le modèle est une commodité, l'avantage durable est dans le **Context/Harness Engineering**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)

Outils & Plateformes

ZML/LLMD : et si le « Docker des LLM » était français ?

Décryptage SFEIR (voix cabinet) du lancement, le 8 juillet 2026, de **LLMD** par la startup parisienne **ZML** (fondée par **Steeve Morin**, ex-VP Engineering de Zenly) : un serveur d'inférence qui fait tourner les LLM sur **cinq familles de puces** (NVIDIA CUDA, AMD ROCm, Google TPU, Intel oneAPI, Apple Metal) **depuis une seule base de code**. Thèse structurante : l'entraînement cède la vedette à l'**inférence**, où se jouent désormais le coût par token, la latence et surtout la **dépendance au silicium**. Le pari de ZML — résumé par la devise *model to metal* — est de **découpler le modèle du matériel** via un compilateur en **Zig + MLIR** produisant un binaire natif hermétique, sans Python dans le chemin d'exécution, exposé par une **API compatible OpenAI**. Deux briques, deux licences : **ZML** (framework, Apache-2.0, >90 % Zig) est open source ; **LLMD** (serveur) ne l'est pas, gratuit au lancement. L'article lit l'objet sous trois angles cabinet — **FinOps du token**, **liberté d'architecture** (Design to Exit), **souveraineté** (puces européennes émergentes, intégration dans le processeur VSORA Jotunn8) — puis livre un verdict sans complaisance : c'est une **alpha**, à mettre « sous surveillance active », pas à basculer aujourd'hui.

#Inférence LLM#serving#ZML

SFEIR (voix éditoriale du cabinet)

Transformation & Adoption

AI4IT vs AI4Business : le renversement, et ce qu'il fait à vos budgets 2027

Article de fond (point de vue) publié sur **sfeir.com** le 24 juin 2026, signé **Didier Girard** (Managing Director, SFEIR). **Thèse centrale** : en 2024 tout le monde pariait sur l'**AI4Business** (l'IA dans les processus métier) comme grand gisement de valeur ; en 2026, le constat s'est **inversé** — c'est l'**AI4IT** (l'IA pour produire le système d'information : code, SDLC, usine logicielle) qui crée la valeur **mesurable**. L'article *grounde* cette thèse sur la veille du cabinet : déception AI4Business (étude MIT « 95 % de pilotes sans ROI », contestée mais révélatrice ; blocage **organisationnel** / problème hayékien de Mollick) vs preuves AI4IT chiffrées (Salesforce, Intercom, Raiffeisen, AWS/Bedrock, Atlassian, DORA). Explication mécaniste : **le code se vérifie tout seul** (compilation, tests, CI) là où le processus métier n'a ni compilateur ni boucle de feedback immédiate. **Conséquence budgétaire 2027** : bascule **CapEx→OpEx**, dynamique du prix du token (pointe qui monte — Fable 5 à 2× Opus — vs inférence ÷280 et pression baissière open weights/desktop), et **FinOps de l'IA** piloté au **coût par outcome**. Clôture par **4 recommandations COMEX**.

#AI4IT#AI4Business#renversement

**Didier Girard** — Managing Director (CTO / DG) de **SFEIR** · ESN française (~1 000 personnes, France · Belgique · Luxembourg · Suisse). Auteur de l'article ; voix éditoriale du cabinet sur la transformation IA des DSI.