# girard-shieldstral-mistral-doctrine-garde-fou-2026-08-07

## Veille

Eine Tech-Watch-Notiz von **Didier Girard**, veröffentlicht auf **X** am **7. August 2026**, die die Markteinführung von **Shieldstral 1.0 3B** (Mistral AI, 4. August 2026) nicht als Produktveröffentlichung liest, sondern als **die Produktivsetzung einer Doktrin**. Ausgangspunkt: Am **13. Mai 2026** verweigerte **Arthur Mensch** vor der Untersuchungskommission der französischen Nationalversammlung zu digitalen Verwundbarkeiten jede Aufsicht Mistrals über die Endnutzung seiner Modelle — *„wir besitzen keine demokratische Legitimität“* — und stellte sich damit explizit gegen die Haltung von **Anthropic**. Weniger als drei Monate später veröffentlicht Mistral ein **Moderationsmodell**. Der Autor entkräftet den scheinbaren Widerspruch: **Shieldstral enthält keine Taxonomie des Erlaubten und Unerlaubten**, es beantwortet eine **Frage, die der Nutzer selbst formuliert**. ⭐ **Der Mechanismus steht im Zentrum der Notiz**: ein dreiteiliger Prompt (Kontext + Schweregrad / eine einzige geschlossene Frage / der zu beurteilende Inhalt), eine Antwort mit `yes` oder `no`, und der **Softmax über diese beiden Tokens** liefert einen kontinuierlichen Score zwischen 0 und 1. **Die Moderationsrichtlinie steckt nicht in den Gewichten, sie wird zur Inferenzzeit gelesen** — während **Llama Guard 4** die zum Trainingszeitpunkt eingefrorene MLCommons-Taxonomie einbettet, liest Shieldstral die eigene Richtlinie in natürlicher Sprache, änderbar **ohne erneutes Training**. Der technische Bericht (**arXiv:2607.25857**, 28. Juli 2026) beziffert die Kosten dieser Wahl: Fine-Tuning allein auf öffentlichen Daten = **61,1 % F1** bei der Anpassungsfähigkeit an Richtlinien; **4,4 Millionen kontrastive Paare**, von einem LLM erzeugt (derselbe Inhalt umgeschrieben, um eine Richtlinie zu verletzen, nicht aber die dazu benachbarte Richtlinie) = **+23,3 Punkte**; **91,3 %** nach dem Zusammenführen dreier Checkpoints. Spezifikationen: **3,8 Mrd. tatsächliche Parameter** (die „3B“ im Namen runden ab), **Ministral 3**-Basis + **Pixtral**-Vision-Encoder, **12 Sprachen**, **16 GB VRAM in BF16**, **Apache 2.0**. Textleistung: **84,9 % durchschnittlicher F1**, auf Augenhöhe mit **GPT-OSS-Safeguard-20B** (siebenmal größer), vor **Qwen3Guard-8B** (84,0) und weit vor **LlamaGuard-4-12B** (69,1). ⚠️ **Vorbehalt, den der Autor selbst formuliert**: *alle diese Zahlen stammen von Mistral, auf von Mistral ausgewählten Testsets, und zum 6. August existierte keine unabhängige Evaluation*. Die strukturierende These ist ein **Gegensatz der Topologien**: bei **Anthropic** lebt das Sicherheitsnetz **in den Gewichten**, und der Anbieter entscheidet, wer davon ausgenommen wird (**Claude Fable 5** öffentlich mit Sicherheitsmaßnahmen / **Claude Mythos 5** ohne, reserviert für zugelassene Cyberverteidiger im Rahmen von **Project Glasswing**, 9. Juni 2026); bei **Mistral** sitzt das Sicherheitsnetz **außerhalb des Modells** — eine separate, offene, selbst hostbare Komponente, deren Richtlinie dem Betreiber gehört. Explizite Ausrichtung auf Kunden (Verteidigungsministerium, BNP Paribas, französische und luxemburgische Regierungsverwaltungen). Die Notiz schließt mit einem **in drei Punkten dokumentierten Rückschlag**: **Auditierbarkeit** (binäre Ausgabe, keine Begründungsspur, während der Betreiber im Rahmen eines AI-Act-Audits die Beweislast der Rechtfertigung trägt), **Robustheit** (das erste Kapitel von Voltaires *Traktat über die Toleranz*, von einem Tester im Hacker-News-Thread als „Aufruf zu Gewalt“ eingestuft — Verwechslung von Erwähnung und Befürwortung), **Verfügbarkeit** (Stand 6. August: kein kostenpflichtiger Endpunkt auf La Plateforme, kein offizielles Ollama). Zum Abschluss drei Regeln für den Einsatz.

## Titre Article

Shieldstral : Mistral compile sa doctrine en 3,8 milliards de paramètres

## Date

2026-08-07

## URL

https://x.com/DidierGirard/status/2085622329720066233

## Keywords

Shieldstral, Shieldstral 1.0 3B, Mistral AI, Arthur Mensch, Moderationsmodell, Sicherheitsklassifikator, multimodaler Klassifikator, offene Gewichte, offene Gewichte, Apache 2.0, Self-Hosting, Souveränität, Moderationsrichtlinie, Moderationstaxonomie, Richtlinie zur Inferenzzeit, Anpassungsfähigkeit an Richtlinien, dreiteiliger Prompt, geschlossene Frage, yes/no, Softmax über zwei Tokens, kontinuierlicher Score, Kalibrierung von Schwellenwerten, Schwellenwert 0, 5, menschliche Prüfung, Llama Guard 4, LlamaGuard-4-12B, MLCommons, GPT-OSS-Safeguard-20B, Qwen3Guard-8B, F1, kontrastive Paare, synthetische Daten, Checkpoint-Zusammenführung, Model Merging, arXiv, technischer Bericht, Ministral 3, Pixtral, Vision-Encoder, 12 Sprachen, 16 GB VRAM, BF16, 3, 8 Milliarden Parameter, Anthropic, Claude Fable 5, Claude Mythos 5, Project Glasswing, Sicherheitsnetz in den Gewichten, Topologie des Sicherheitsnetzes, Verantwortungsübertragung, Auditierbarkeit, Begründungsspur, AI Act, rechtliches Zentrum, Verteidigungsministerium, BNP Paribas, luxemburgische Verwaltung, SFEIR, Mistral-Microsoft, architektonische Eigenschaft, Fehlalarm, Erwähnung vs. Befürwortung, Voltaire, Traktat über die Toleranz, Hacker News, verschleierte Eingaben, Arabisch, Indonesisch, La Plateforme, Ollama, Community-Quantisierungen, Prüfsumme, Prompt Injection, Protokollierung, The Decoder, Jonathan Kemper

## Authors

**Didier Girard** — auteur de la note, publiée sur son compte X. Écrit ici en **analyste de doctrine industrielle** plutôt qu'en testeur : il n'a pas déployé le modèle, il croise une **audition parlementaire** (Mensch, 13 mai), un **lancement produit** (Shieldstral, 4 août), un **rapport technique** (arXiv, 28 juillet) et un **contre-exemple concurrent** (Anthropic, 9 juin) pour montrer qu'ils forment une position cohérente. Deux marqueurs de posture : il **borne explicitement la valeur des chiffres** qu'il cite (aucune évaluation tierce) et il **termine par des règles opérationnelles** — l'analyse doit sortir avec sa traduction en décisions de déploiement.

Sources mobilisées et créditées dans le texte : **Mistral AI** (annonce, model card Hugging Face, docs) ; **Calvi, Sooriyarachchi, Pistilli, Lample et al.** (rapport technique arXiv:2607.25857) ; **Jonathan Kemper** (*The Decoder*, 5 août) ; le fil **Hacker News** du 4 août (471 points) ; l'audition d'**Arthur Mensch** ; l'annonce **Anthropic** du 9 juin ; l'analyse **SFEIR** de l'accord Mistral-Microsoft du 22 juillet.

## Ton

**Profil**: eine strategische Analysenotiz, gestützt auf eine technische Lektüre, kurzes und dichtes Format, als Thread veröffentlicht. Weder ein Launch-Bericht noch ein Benchmark: eine **Demonstration doktrinärer Kohärenz**, gefolgt von einer Prüfung ihrer Lücken.

**Stil**: gegliedert in **vier Bewegungen** — das scheinbare Paradox (Mensch verweigert die Entscheidungshoheit / Mistral veröffentlicht einen Moderator) → der Mechanismus, der es auflöst (die Richtlinie wird zur Inferenzzeit geschrieben) → der Gegensatz der Topologien (Anthropic vs. Mistral) → der Rückschlag (die Verantwortung kommt ohne ihr Werkzeug an). Drei Merkmale:

1. **Eröffnung mit dem scheinbaren Widerspruch**, sofort entkräftet. Der Text stellt ein Problem, bevor er ein Produkt präsentiert: genau das macht aus einer Markteinführung einen Gegenstand der Analyse.
2. **Der Nutzungsvorbehalt, in der ersten Person übernommen** — *„ich formuliere den Nutzungsvorbehalt.“* Zahlen werden zitiert und **dann** im selben Absatz relativiert, ohne sie aus der Argumentation zu entfernen. Ein ehrliches Register statt eines werblichen.
3. **Die Symmetrie des letzten Drittels**. Nachdem der Autor die Kohärenz der Wahl verteidigt hat, räumt er dem, was fehlt, denselben Raum ein — Auditierbarkeit, Robustheit, Verfügbarkeit —, jeweils durch eine überprüfbare Tatsache belegt und nicht durch eine Meinung.

**Signaturformulierungen**: *„Mistral kompiliert seine Doktrin in 3,8 Milliarden Parameter“*, *„es beantwortet eine Frage, die man selbst formuliert“*, *„die Moderationsrichtlinie wird nicht erlernt, sie kommt aus den Gewichten“*, *„zwei Orte, um das Sicherheitsnetz unterzubringen“*, *„die Verantwortung kommt ohne ihr Werkzeug an“*, *„Mistral entscheidet nicht, was zulässig ist, es stellt das Werkzeug bereit, damit man selbst entscheidet“*, *„Apache 2.0, 16 GB VRAM, und die Verantwortung, mitgeliefert mit den Gewichten.“*

**Epistemische Position**: **der architektonischen Wahl wohlgesinnt, ihrem Werkzeug gegenüber skeptisch**. Der Autor bestätigt die doktrinäre Kohärenz („darin sehe ich die eigentliche Kohärenz der Markteinführung“), lehnt aber die Zahlen des Anbieters als Beweis ab und listet drei operative Lücken auf. Die Quellenlage ist für einen Social-Post dicht: sieben belegte Quellen, präzise Daten, eine arXiv-Nummer.

## Pense-betes

- **⭐⭐ Die zentrale Idee, es lohnt sich, sie für sich zu behalten**: Die Frage lautet nicht *„welches Modell moderiert am besten?“*, sondern ***„wo lebt das Sicherheitsnetz?“***. Zwei entgegengesetzte Antworten, im Abstand von zwei Monaten von zwei Anbietern gegeben: | | **Anthropic** (9. Juni 2026) | **Mistral** (4. August 2026) | |---|---|---| | Ort | **in den Gewichten** des Modells | **neben** dem Modell, eine separate Komponente | | Wer die Richtlinie festlegt | der Anbieter | **der Betreiber** | | Wer vom Sicherheitsnetz ausgenommen ist | wer vom Anbieter zugelassen wird (Project Glasswing) | nicht zutreffend | | Verteilungsmodell | Fable 5 öffentlich / Mythos 5 eingeschränkt | Apache 2.0 offene Gewichte | → Dies ist keine technische Meinungsverschiedenheit, sondern eine Meinungsverschiedenheit darüber, **wer die Legitimität besitzt, über das Erlaubte zu entscheiden**. Siehe [[anthropic-claude-fable-5-mythos-5-2026-06-09]] für das gegenüberliegende Lager und [[mensch-mistral-commission-enquete-vulnerabilites-numeriques-souverainete-ia-2026-05-13]] für Menschs frühere Position.
- **⭐ Der Mechanismus, in drei Zeilen**: Prompt = (1) Kontext + Schweregrad, (2) **eine einzige geschlossene Frage** („ruft dieser Inhalt zu Gewalt auf?“), (3) der zu beurteilende Inhalt. Ausgabe = `yes` / `no`, und der **Softmax allein über diese beiden Tokens** ergibt einen **kontinuierlichen Score zwischen 0 und 1**. Praktische Konsequenz: Man erhält einen schwellenwertfähigen Skalar, kein binäres Urteil — genau das macht eine Kalibrierung möglich (siehe unten).
- **Was wirklich neu ist**: Die **Richtlinie wird nicht erlernt**. Llama Guard 4 bettet die zum Trainingszeitpunkt **eingefrorene** MLCommons-Taxonomie ein; Shieldstral liest die eigene Richtlinie **in natürlicher Sprache zur Inferenzzeit** und man ändert sie **ohne erneutes Training**. Das Modell lernt nicht, *was verboten ist*, sondern *eine ihm vorgegebene Regel anzuwenden*.
- **⭐ Die Zahl, die den Rest erklärt** — die Anpassungsfähigkeit stammt nicht aus der Architektur, sondern aus **eigens zum Erlernen hergestellten Daten**: | Schritt | F1 „Anpassungsfähigkeit an Richtlinien“ | |---|---| | Fine-Tuning nur auf öffentlichen Sets | **61,1 %** | | + 4,4 Mio. vom LLM erzeugte **kontrastive Paare** | **+23,3 Pkt.** | | + Zusammenführen dreier Checkpoints | **91,3 %** | → Das **kontrastive Paar** ist das eigentlich Merkenswerte: *derselbe Inhalt, umgeschrieben, um eine Richtlinie zu verletzen, nicht aber die dazu benachbarte Richtlinie*. Es ist das einzige Signal, das das Modell zwingt, die Frage zu lesen, statt ein Thema zu erkennen. **Übertragbares Muster** für jeden instruktionssteuerbaren Klassifikator.
- **Das Datenblatt, um zu entscheiden, ob es auf der eigenen Hardware läuft**: **3,8 Mrd. tatsächliche Parameter** (die „3B“ runden ab), **Ministral 3**-Basis + **Pixtral**-Vision-Encoder (daher **multimodal**: Text und Bild), **12 Sprachen**, **16 GB VRAM in BF16**, **Apache 2.0**. Das ist die Klasse „eine Consumer-GPU“ — die Dimensionierung ist Teil des politischen Arguments, nicht nur des Produkts.
- **⚠️ Die Benchmarks, mit ihrem Vorbehalt**: 84,9 % durchschnittlicher Text-F1, auf Augenhöhe mit **GPT-OSS-Safeguard-20B** (×7 der Größe), vor **Qwen3Guard-8B** (84,0), weit vor **LlamaGuard-4-12B** (69,1). **All diese Zahlen stammen von Mistral, auf von Mistral gewählten Testsets, ohne unabhängige Evaluation zum 6. August 2026.** Der Autor formuliert den Vorbehalt selbst — nicht weglassen, wenn man das Ergebnis zitiert.
- **⭐⭐ Die drei Einsatzregeln — der handlungsrelevante Kern der Notiz**: 1. **Zwei Schwellenwerte kalibrieren** an einem **hausinternen** gelabelten Set, statt den Standardwert 0,5 zu übernehmen: automatische Freigabe unterhalb des ersten, automatische Ablehnung oberhalb des zweiten, **menschliche Prüfung dazwischen**. (Genau dafür existiert der kontinuierliche Score.) 2. **Die aktive Richtlinienfrage bei jeder Entscheidung protokollieren** — sie dient als Begründung in einem Audit, da das Modell selbst keine liefert. 3. **Das Paar Erwähnung/Befürwortung sowie die tatsächlich verwendeten Sprachen testen**, bevor produktiv eingesetzt wird. → Und eine vierte, separate Regel: **einen eigenen Prompt-Injection-Detektor beibehalten**. *Shieldstral filtert Inhalte, es schützt keinen Agenten vor einem präparierten Dokument.* Eine Unterscheidung, die man nicht verwischen sollte — vgl. [[valente-zalewski-beyond-zero-enterprise-security-ai-era-2026-07-20]] und [[sfeir-anthropic-sdlc-ai-native-securise-2026-07-26]].
- **⚠️ Der Voltaire-Test — das Gegenbeispiel, das es wert ist, zitiert zu werden**: Im Hacker-News-Thread reicht ein Nutzer das **erste Kapitel des *Traktats über die Toleranz*** mit der Frage ein „befürwortet dieser Text Gewalt gegen eine geschützte Gruppe?“. Antwort: **yes**. Der Klassifikator **verwechselt die Erwähnung von Gewalt mit ihrer Befürwortung** — der klassische Fehlalarm dieser Modellklasse, hier ausgerechnet an einem der Gründungstexte der Toleranz erzielt. Mistral räumt zudem Schwächen bei **verschleierten Eingaben**, **langen Dokumenten**, **Arabisch** und **Indonesisch** ein.
- **Die Auditierbarkeitslücke, vor jedem regulierten Einsatz zu bewerten**: Die Ausgabe ist `yes`/`no` plus ein Score, **keine Begründungsspur**. Dennoch erbt der Betreiber die Taxonomie, die Kalibrierung **und** die Beweislast, jede Entscheidung in einem AI-Act-Audit zu rechtfertigen — **mit einem bloßen Score als einzigem Beleg**. Das ist genau der Preis der Topologie „Sicherheitsnetz außerhalb des Modells“: Die Verantwortung wird übertragen, das Werkzeug für diese Verantwortung nicht.
- **Verfügbarkeit zum 6. August 2026 (eine Momentaufnahme, erneut zu prüfen)**: kein kostenpflichtiger Endpunkt auf **La Plateforme**, kein offizieller **Ollama**-Eintrag, **community-erstellte Quantisierungen**, innerhalb von 48 Stunden veröffentlicht, deren Prüfsumme verifiziert werden muss. **Self-Hosting ist der einzige ernsthafte Weg** — konsequent im Sinne des Produkts, doch die Nutzung ist de facto Teams vorbehalten, die wissen, wie man ein Modell hostet.
- **⭐ Die Souveränitätslesart**: ein Filter, der **On-Premises** läuft, dessen **Richtlinie On-Premises bleibt**, dokumentiert gegen den **AI Act** — ein Punkt, den US-amerikanische Angebote für die von Mensch in seiner Anhörung genannten Kunden (**Verteidigungsministerium, BNP Paribas**, **französische** und **luxemburgische** Regierungsverwaltungen) offenlassen. Dies knüpft unmittelbar an die These von [[sfeir-mistral-microsoft-souverainete-strategie-industrielle-2026-07-22]] an: **Souveränität qualifiziert sich abhängigkeitsweise, als architektonische Eigenschaft** — ein Sicherheitsnetz mit offenen Gewichten *ist* eine solche Eigenschaft. Ebenfalls in Bezug zu setzen zu [[mozilla-state-of-open-source-ai-2026-07]] und [[deanwball-open-weights-decelerationnistes-kimi-2026-07-17]] zum Stellenwert offener Gewichte in der Sicherheitsdebatte.
- **Meta / der Satz, den man behalten sollte**: *„Mistral entscheidet nicht, was zulässig ist, es stellt das Werkzeug bereit, damit man selbst entscheidet.“* Das ist die Doktrin, in einem Satz — und die Notiz zeigt, dass sie einen Preis hat, nicht nur eine Tugend.

## RésuméDe400mots

Eine Tech-Watch-Notiz vom **7. August 2026**, die **Shieldstral 1.0 3B** liest — den multimodalen Sicherheitsklassifikator, den **Mistral AI** am 4. August unter **Apache 2.0** veröffentlicht hat — als produkthafte Übersetzung einer politischen Haltung.

**Das Ausgangsparadox.** Am 13. Mai 2026 verweigerte **Arthur Mensch** vor der Untersuchungskommission der französischen Nationalversammlung zu digitalen Verwundbarkeiten jede Aufsicht Mistrals über die Endnutzung seiner Modelle: *„wir besitzen keine demokratische Legitimität“*, und stellte sich dabei nebenbei gegen die Haltung von **Anthropic**. Weniger als drei Monate später veröffentlicht Mistral ein Moderationsmodell. Der Autor löst den Widerspruch auf: **Shieldstral enthält keine Taxonomie des Erlaubten und Unerlaubten** — es beantwortet eine Frage, die der Betreiber selbst formuliert.

**Der Mechanismus.** Der Prompt besteht aus drei Teilen: Kontext und Schweregrad, **eine einzige geschlossene Frage**, der zu beurteilende Inhalt. Das Modell antwortet mit `yes` oder `no`, und der **Softmax über diese beiden Tokens** liefert einen kontinuierlichen Score. **Die Richtlinie wird somit nicht erlernt**: Während **Llama Guard 4** die zum Trainingszeitpunkt eingefrorene MLCommons-Taxonomie einbettet, liest Shieldstral die eigene Richtlinie in natürlicher Sprache **zur Inferenzzeit**, änderbar ohne erneutes Training. Der technische Bericht (arXiv, 28. Juli) beziffert diese Wahl: **61,1 %** F1-Anpassungsfähigkeit mit ausschließlich öffentlichen Testsets, **+23,3 Punkte** dank **4,4 Millionen kontrastiven Paaren**, von einem LLM erzeugt, **91,3 %** nach dem Zusammenführen dreier Checkpoints. Das Objekt ist so dimensioniert, dass es On-Premises läuft: **3,8 Mrd. Parameter**, **Ministral 3**-Basis und **Pixtral**-Vision-Encoder, **12 Sprachen**, **16 GB VRAM**. Bei Text: **84,9 %** durchschnittlicher F1 — auf Augenhöhe mit **GPT-OSS-Safeguard-20B**, siebenmal größer. ⚠️ Vom Autor formulierter Vorbehalt: **Zahlen des Anbieters, Testsets des Anbieters, keine unabhängige Evaluation**.

**Die These.** Zwei Orte, an denen das Sicherheitsnetz untergebracht werden kann. Bei **Anthropic** (9. Juni) lebt es **in den Gewichten**, und der Anbieter entscheidet, wer davon ausgenommen wird — **Claude Fable 5** öffentlich, **Claude Mythos 5** reserviert für die Cyberverteidiger von **Project Glasswing**. Bei Mistral sitzt es **außerhalb des Modells**: eine separate, offene, selbst hostbare Komponente. Eine Wahl, die auf souveränitätssensible und Bankenkunden ausgerichtet ist, und auf eine Souveränität, die sich **abhängigkeitsweise** qualifiziert.

**Der Rückschlag.** Drei dokumentierte Lücken: **Auditierbarkeit** (binäre Ausgabe, keine Begründungsspur, während der Betreiber im Rahmen eines AI-Act-Audits die Beweislast der Rechtfertigung trägt), **Robustheit** (Voltaires *Traktat über die Toleranz* als „Aufruf zu Gewalt“ eingestuft — Verwechslung von Erwähnung und Befürwortung), **Verfügbarkeit** (weder ein kostenpflichtiger Endpunkt noch ein offizielles Ollama zum 6. August). Daraus folgen drei Regeln: **zwei** Schwellenwerte an einem hausinternen Testset kalibrieren, **die aktive Richtlinienfrage protokollieren**, Erwähnung/Befürwortung sowie die eigenen Sprachen testen — und einen separaten **Prompt-Injection**-Detektor beibehalten. *„Apache 2.0, 16 GB VRAM, und die Verantwortung, mitgeliefert mit den Gewichten.“*

## GrapheDeConnaissance

- Mistral AI —publie→ Shieldstral (TECHNOLOGIE, 0.98)
- Didier Girard —affirme_que→ Shieldstral met en production la doctrine défendue par Arthur Mensch devant la commission d'enquête de l'Assemblée nationale (AFFIRMATION, 0.96)
- Arthur Mensch —affirme_que→ un éditeur de modèles n'a pas la légitimité démocratique pour arbitrer l'usage final de ses modèles (CITATION, 0.96)
- Shieldstral —permet→ de lire une politique de modération en langage naturel au moment de l'inférence, sans réentraînement (AFFIRMATION, 0.96)
- Shieldstral —utilise→ une softmax sur les deux tokens yes et no pour produire un score continu entre 0 et 1 (AFFIRMATION, 0.94)
- Shieldstral —est_basé_sur→ Ministral 3 (TECHNOLOGIE, 0.94)
- Shieldstral —utilise→ Pixtral (TECHNOLOGIE, 0.92)
- Shieldstral —s_oppose_à→ Llama Guard 4 (TECHNOLOGIE, 0.92)
- Llama Guard 4 —utilise→ une taxonomie MLCommons figée à l'entraînement (AFFIRMATION, 0.93)
- Mistral AI —mesure→ 91,3 % de F1 en adaptabilité aux politiques, contre 61,1 % pour un fine-tuning sur jeux de données publics seuls (MESURE, 0.93)
- paire contrastive —améliore→ l'adaptabilité d'un classificateur à une politique fournie à l'inférence, de 23,3 points de F1 (MESURE, 0.91)
- Shieldstral —surpasse→ Qwen3Guard (TECHNOLOGIE, 0.85)
- Shieldstral —mesure→ 84,9 % de F1 moyen sur le texte, à égalité avec GPT-OSS-Safeguard-20B pourtant sept fois plus gros (MESURE, 0.88)
- Didier Girard —affirme_que→ tous les chiffres publiés viennent de Mistral, sur des jeux de test sélectionnés par Mistral, sans aucune évaluation tierce au 6 août 2026 (AFFIRMATION, 0.95)
- Anthropic —publie→ Claude Mythos 5 (TECHNOLOGIE, 0.95)
- Anthropic —s_oppose_à→ l'idée que le déployeur définisse lui-même la politique de sûreté, en logeant le garde-fou dans les poids et en arbitrant qui y échappe (AFFIRMATION, 0.9)
- topologie du garde-fou —s_applique_à→ le choix d'architecture entre une sûreté logée dans les poids et une sûreté déportée dans un composant séparé (AFFIRMATION, 0.92)
- Shieldstral —permet→ un filtre de modération auto-hébergeable dont la politique reste sur site, documenté au regard de l'AI Act (AFFIRMATION, 0.91)
- Shieldstral —s_applique_à→ des secteurs régaliens et régulés : ministère des Armées, BNP Paribas, administrations françaises et luxembourgeoise (AFFIRMATION, 0.86)
- Didier Girard —affirme_que→ le transfert de responsabilité vers le déployeur arrive sans son outillage : auditabilité, robustesse et disponibilité manquent (AFFIRMATION, 0.95)
- Shieldstral —s_oppose_à→ l'auditabilité d'une décision de modération, en ne produisant aucune trace de raisonnement (AFFIRMATION, 0.9)
- Shieldstral —observé_dans→ un faux positif sur le premier chapitre du Traité sur la tolérance de Voltaire, classé comme appelant à la violence (AFFIRMATION, 0.88)
- Didier Girard —recommande→ calibrer deux seuils sur un jeu étiqueté maison — auto-approbation, revue humaine, auto-rejet — plutôt que d'accepter le 0,5 par défaut (AFFIRMATION, 0.95)
- Didier Girard —recommande→ journaliser la question de politique active à chaque décision, puisqu'elle tiendra lieu de justification en audit (AFFIRMATION, 0.94)
- Didier Girard —affirme_que→ Shieldstral filtre du contenu et ne protège pas un agent contre un document piégé : garder un détecteur dédié à l'injection de prompt (AFFIRMATION, 0.95)
- Jonathan Kemper —mesure→ Shieldstral égale des modèles de sûreté bien plus gros sur le texte (AFFIRMATION, 0.85)

---
Canonical: https://www.thekb.eu/de/fiches/girard-shieldstral-mistral-doctrine-garde-fou-2026-08-07/
