Vai al contenuto

root / tags / revue-humaine

#revue humaine

2 fiches

Qualità e Sicurezza Traduzione verificata automaticamente

Shieldstral : Mistral compile sa doctrine en 3,8 milliards de paramètres

Una nota di veille di **Didier Girard** pubblicata su **X** il **7 agosto 2026**, che legge il lancio di **Shieldstral 1.0 3B** (Mistral AI, 4 agosto 2026) non come il lancio di un prodotto ma come **il dispiegamento in produzione di una dottrina**. Punto di partenza: il **13 maggio 2026**, davanti alla commissione d'inchiesta dell'Assemblea Nazionale sulle vulnerabilità digitali, **Arthur Mensch** ha rifiutato qualsiasi ruolo di supervisione per Mistral sull'uso finale dei suoi modelli — *"non abbiamo legittimità democratica"* — respingendo esplicitamente la posizione di **Anthropic**. Meno di tre mesi dopo, Mistral rilascia un **modello di moderazione**. L'autore smonta l'apparente contraddizione: **Shieldstral non porta con sé alcuna tassonomia del lecito e dell'illecito**, risponde a una **domanda che l'utente scrive**. **Il meccanismo è il cuore della nota**: un prompt in tre parti (contesto + gravità / un'unica domanda chiusa / il contenuto da giudicare), una risposta `yes` o `no`, e il **softmax su questi due token** produce un punteggio continuo tra 0 e 1. **La politica di moderazione non è nei pesi, viene letta al momento dell'inferenza** — mentre **Llama Guard 4** incorpora la tassonomia MLCommons fissata in fase di addestramento, Shieldstral legge la vostra in linguaggio naturale, modificabile **senza ri-addestramento**. Il rapporto tecnico (**arXiv:2607.25857**, 28 luglio 2026) quantifica il costo di questa scelta: fine-tuning sui soli dati pubblici = **61,1% F1** sull'adattabilità della policy; **4,4 milioni di coppie contrastive** generate da un LLM (lo stesso contenuto riscritto per violare una policy ma non la sua policy gemella) = **+23,3 punti**; **91,3%** dopo la fusione di tre checkpoint. Caratteristiche: **3,8 miliardi di parametri effettivi** (il "3B" del nome arrotonda per difetto), base **Ministral 3** + encoder visivo **Pixtral**, **12 lingue**, **16 GB di VRAM in BF16**, **Apache 2.0**. Prestazioni testuali: **84,9% F1 medio**, alla pari con **GPT-OSS-Safeguard-20B** (sette volte più grande), davanti a **Qwen3Guard-8B** (84,0) e ben davanti a **LlamaGuard-4-12B** (69,1). **Una riserva sollevata dall'autore stesso**: *tutte queste cifre provengono da Mistral, su set di test selezionati da Mistral, e al 6 agosto non esisteva alcuna valutazione di terze parti*. La tesi strutturante della nota è un'**opposizione di topologie**: in **Anthropic**, il guardrail vive **nei pesi** e l'editore arbitra chi ne è esentato (**Claude Fable 5** pubblico con misure di sicurezza / **Claude Mythos 5** senza, riservato ai cyberdifensori approvati di **Project Glasswing**, 9 giugno 2026); in **Mistral**, il guardrail **sta fuori dal modello** — un componente separato, aperto, auto-ospitabile, la cui policy appartiene al deployer. Allineamento esplicito con i clienti (ministero delle Forze Armate, BNP Paribas, amministrazioni pubbliche francesi e lussemburghesi). La nota si chiude su una **battuta d'arresto documentata in tre punti**: **auditabilità** (output binario, nessuna traccia di ragionamento, mentre il deployer eredita l'onere della giustificazione in un audit AI Act), **robustezza** (il primo capitolo del *Trattato sulla tolleranza* di Voltaire classificato come "incitamento alla violenza" da un tester nel thread di Hacker News — una confusione tra menzione ed endorsement), **disponibilità** (al 6 agosto: nessun endpoint a pagamento su La Plateforme, nessun Ollama ufficiale). Tre regole di dispiegamento a chiusura.

#Shieldstral#Shieldstral 1.0 3B#Mistral AI

**Didier Girard** — auteur de la note · publiée sur son compte X. Écrit ici en **analyste de doctrine industrielle** plutôt qu'en testeur : il n'a pas déployé le modèle · il croise une **audition parlementaire** (Mensch, 13 mai) · un **lancement produit** (Shieldstral, 4 août) · un **rapport technique** (arXiv, 28 juillet) et un **contre-exemple concurrent** (Anthropic, 9 juin) pour montrer qu'ils forment une position cohérente. Deux marqueurs de posture : il **borne explicitement la valeur des chiffres** qu'il cite (aucune évaluation tierce) et il **termine par des règles opérationnelles** — l'analyse doit sortir avec sa traduction en décisions de déploiement.

Economia e Mercato Traduzione verificata automaticamente

Announcing Cloudflare Wallets: the programmable wallet for the agentic Internet

Annuncio di prodotto pubblicato sul blog di **Cloudflare** il **4 agosto 2026** da **Will Papper**, nell'ambito di **Agents Week**: **Cloudflare Wallets**, presentato come *"il wallet programmabile per l'Internet agentico"*. **Il problema enunciato** è preciso e ben scelto: un agente che vuole provare un'API deve passare da una pagina di login **pensata per gli umani**, farsi aggiungere un metodo di pagamento da un umano, generare una chiave API, per poi capire come chiamare il servizio. Due lacune strutturali lo spiegano — *"Agents do not have a stable identifier to sign up for an API, and they do not have a native way to pay for APIs"* — con la conseguenza che *"AI agents often give up on these tasks entirely, kicking registration, payment methods, and API key generation back to humans"*. **L'architettura proposta si riduce a due tipi di wallet**: gli **Account Wallets**, destinati agli umani titolari di un account Cloudflare (finanziare, delegare, prelevare), e i **Virtual Wallets**, destinati agli agenti, **funzionanti tramite API key** e il cui limite di spesa è **fissato dal titolare dell'account**. Le protezioni annunciate sono esplicite: **allocazione, allow list, importo massimo per transazione**. **Il canale di pagamento è il protocollo x402** (pagamenti collegati alle richieste HTTP) e la valuta è la **stablecoin** — il che colloca l'offerta in un campo distinto dagli schemi costruiti sui circuiti delle carte. **L'argomento più interessante è controintuitivo e centrale**: *"These limits may seem like constraints, but counterintuitively they give agents more freedom. If an agent is responsible for $10, you can worry less about its spending than if it is responsible for $1,000."* → **il limite non è ciò che vincola l'autonomia, è ciò che la rende accettabile.** **Secondo componente, più strategico del primo**: l'identità, tramite un namespace **`cloudflare.pay`** — un agente di ricerca potrebbe vivere a `research.example.cloudflare.pay`, dando al merchant la certezza di parlare con l'agente di un'organizzazione identificata. Cloudflare rivendica un'ambizione deliberatamente minimale (*"a human-readable identifier for a not-very-readable keypair, similar to the URL and IP-address pairings used in DNS"*), costruita sui suoi mattoni esistenti (**Turnstile**, Bot Management, **Web Bot Auth** e le sue keypair), e dichiara l'intenzione di adottare gli schemi della **x402 Foundation** man mano che emergono. **Un'avvertenza decisiva sullo statuto del testo**: **quasi tutto è al futuro**. Ciò che esiste il giorno dell'annuncio è la **riserva di un handle**; pagamenti, Virtual Wallets, protezioni e le rampe per accedere ai fondi sono annunciati (*"Soon, you will be able to…"*). Si tratta di una **presa di posizione su un namespace**, più che di un servizio che entra in funzione.

#Cloudflare Wallets#commercio agentico#Agents Week

**Will Papper** — auteur de l'annonce sur le blog Cloudflare (lecture annoncée : 8 minutes). Publication rattachée à l'**Agents Week** de Cloudflare et étiquetée *Agents Week · AI · AI Bots · Developer Platform · Developers · Payments · Product News · x402*.