Una nota di veille tecnologica datata 7 agosto 2026 che legge Shieldstral 1.0 3B — il classificatore di sicurezza multimodale rilasciato da Mistral AI il 4 agosto sotto Apache 2.0 — come la traduzione prodotto di una posizione politica.

Il paradosso di partenza. Il 13 maggio 2026, davanti alla commissione d'inchiesta dell'Assemblea Nazionale francese sulle vulnerabilità digitali, Arthur Mensch rifiuta qualsiasi controllo di Mistral sull'uso finale dei propri modelli: «non abbiamo legittimità democratica», distanziandosi al contempo dalla posizione di Anthropic. Meno di tre mesi dopo, Mistral rilascia un modello di moderazione. L'autore dissolve la contraddizione: Shieldstral non porta alcuna tassonomia del lecito e dell'illecito — risponde a una domanda che chi lo distribuisce scrive.

Apache 2.0, 16 GB di VRAM, e la responsabilità spedita insieme ai pesi.

**Didier Girard** — auteur de la note , x.com

Il meccanismo. Il prompt sta in tre parti: contesto e gravità, un'unica domanda chiusa, il contenuto da giudicare. Il modello risponde yes o no e la softmax su questi due token produce un punteggio continuo. La policy non è quindi appresa: laddove Llama Guard 4 incorpora la tassonomia MLCommons congelata al momento dell'addestramento, Shieldstral legge la vostra in linguaggio naturale al momento dell'inferenza, modificabile senza riaddestramento. Il technical report (arXiv, 28 luglio) quantifica questa scelta: 61,1% F1 di adattabilità con i soli set di test pubblici, +23,3 punti grazie a 4,4 milioni di coppie contrastive generate da un LLM, 91,3% dopo il merging di tre checkpoint. L'oggetto è dimensionato per girare on-premise: 3,8 miliardi di parametri, base Ministral 3 ed encoder visivo Pixtral, 12 lingue, 16 GB di VRAM. Sul testo, 84,9% F1 medio — alla pari con GPT-OSS-Safeguard-20B, sette volte più grande. ⚠️ Riserva sollevata dall'autore: cifre del fornitore, set di test del fornitore, nessuna valutazione terza.

La tesi. Due luoghi in cui alloggiare il guardrail. Presso Anthropic (9 giugno), vive nei pesi e il fornitore arbitra chi ne è esentato — Claude Fable 5 pubblico, Claude Mythos 5 riservato ai cyberdifensori del Project Glasswing. Presso Mistral, sta fuori dal modello: un componente separato, aperto, autoospitabile. Una scelta allineata con clienti del settore sovrano e bancario, e con una sovranità che si qualifica dipendenza per dipendenza.

L'arretramento. Tre scarti documentati: auditabilità (output binario, nessuna traccia di ragionamento, mentre chi lo distribuisce porta l'onere della giustificazione in un audit AI Act), robustezza (il Trattato sulla tolleranza di Voltaire classificato come «incitamento alla violenza» — confusione tra menzione ed endorsement), disponibilità (né un endpoint a pagamento né un Ollama ufficiale al 6 agosto). Da qui tre regole: calibrare due soglie su un set di test interno, registrare la domanda di policy attiva, testare la coppia menzione/endorsement e le vostre lingue — e mantenere un rilevatore di prompt injection separato. «Apache 2.0, 16 GB di VRAM, e la responsabilità spedita insieme ai pesi.»