Zum Inhalt springen

root / tags / claude-mythos-5

#Claude Mythos 5

3 Fiches

Qualität & Sicherheit Automatisch geprüfte Übersetzung

Shieldstral : Mistral compile sa doctrine en 3,8 milliards de paramètres

Eine von **Didier Girard** verfasste Watch-Notiz, veröffentlicht auf **X** am **7. August 2026**, die den Launch von **Shieldstral 1.0 3B** (Mistral AI, 4. August 2026) nicht als Produktveröffentlichung liest, sondern als **die produktive Umsetzung einer Doktrin**. Ausgangspunkt: Am **13. Mai 2026** lehnte **Arthur Mensch** vor dem Untersuchungsausschuss der Nationalversammlung zu digitalen Verwundbarkeiten jede Aufsichtsrolle von Mistral über den Endgebrauch seiner Modelle ab – *„wir besitzen keine demokratische Legitimität“* – und wies damit explizit die Haltung von **Anthropic** zurück. Weniger als drei Monate später veröffentlicht Mistral ein **Moderationsmodell**. Der Autor entkräftet den scheinbaren Widerspruch: **Shieldstral trägt keine Taxonomie des Erlaubten und des Verbotenen in sich**, es beantwortet eine **vom Nutzer geschriebene Frage**. **Der Mechanismus steht im Zentrum der Notiz**: ein dreiteiliger Prompt (Kontext + Schweregrad / eine einzige geschlossene Frage / der zu beurteilende Inhalt), eine Antwort mit `yes` oder `no`, und der **Softmax über diese beiden Tokens** erzeugt einen kontinuierlichen Score zwischen 0 und 1. **Die Moderationsrichtlinie steckt nicht in den Gewichten, sie wird zur Inferenzzeit gelesen** – während **Llama Guard 4** die zur Trainingszeit fixierte MLCommons-Taxonomie einbettet, liest Shieldstral die eigene Richtlinie in natürlicher Sprache, änderbar **ohne erneutes Training**. Der technische Bericht (**arXiv:2607.25857**, 28. Juli 2026) beziffert die Kosten dieser Entscheidung: Fine-Tuning allein auf öffentlichen Daten = **61,1 % F1** bei der Anpassungsfähigkeit der Richtlinie; **4,4 Millionen kontrastive Paare**, von einem LLM generiert (derselbe Inhalt umgeschrieben, um eine Richtlinie zu verletzen, aber nicht die benachbarte Richtlinie) = **+23,3 Punkte**; **91,3 %** nach Zusammenführung von drei Checkpoints. Merkmale: **3,8 Mrd. tatsächliche Parameter** (das „3B“ im Namen ist abgerundet), Basis **Ministral 3** + Vision-Encoder **Pixtral**, **12 Sprachen**, **16 GB VRAM in BF16**, **Apache 2.0**. Textleistung: **84,9 % durchschnittlicher F1**, auf Augenhöhe mit **GPT-OSS-Safeguard-20B** (siebenmal größer), vor **Qwen3Guard-8B** (84,0) und weit vor **LlamaGuard-4-12B** (69,1). **Ein vom Autor selbst geäußerter Vorbehalt**: *all diese Zahlen stammen von Mistral, auf von Mistral ausgewählten Testdatensätzen, und bis zum 6. August existierte keine unabhängige Bewertung*. Die zentrale These der Notiz ist ein **Gegensatz der Topologien**: bei **Anthropic** wohnt das Sicherheitsnetz **in den Gewichten**, und der Anbieter entscheidet, wer davon ausgenommen wird (**Claude Fable 5** öffentlich mit Sicherheitsmaßnahmen / **Claude Mythos 5** ohne, vorbehalten zugelassenen Cyberverteidigern des **Project Glasswing**, 9. Juni 2026); bei **Mistral** liegt das Sicherheitsnetz **außerhalb des Modells** – eine separate, offene, selbst hostbare Komponente, deren Richtlinie dem Betreiber gehört. Explizite Kundenausrichtung (Verteidigungsministerium, BNP Paribas, französische und luxemburgische Regierungsverwaltungen). Die Notiz schließt mit einem **in drei Punkten dokumentierten Rückschlag**: **Auditierbarkeit** (binäre Ausgabe, keine Begründungsspur, während der Betreiber die Beweislast im Rahmen eines AI-Act-Audits trägt), **Robustheit** (das erste Kapitel von Voltaires *Traktat über die Toleranz*, von einem Tester im Hacker-News-Thread als „Aufruf zur Gewalt“ eingestuft – eine Verwechslung von Erwähnung und Befürwortung), **Verfügbarkeit** (Stand 6. August: kein kostenpflichtiger Endpunkt auf La Plateforme, kein offizielles Ollama-Angebot). Abschließend drei Einsatzregeln.

#Shieldstral#Shieldstral 1.0 3B#Mistral AI

**Didier Girard** — auteur de la note · publiée sur son compte X. Écrit ici en **analyste de doctrine industrielle** plutôt qu'en testeur : il n'a pas déployé le modèle · il croise une **audition parlementaire** (Mensch, 13 mai) · un **lancement produit** (Shieldstral, 4 août) · un **rapport technique** (arXiv, 28 juillet) et un **contre-exemple concurrent** (Anthropic, 9 juin) pour montrer qu'ils forment une position cohérente. Deux marqueurs de posture : il **borne explicitement la valeur des chiffres** qu'il cite (aucune évaluation tierce) et il **termine par des règles opérationnelles** — l'analyse doit sortir avec sa traduction en décisions de déploiement.

Wirtschaft & Markt Automatisch geprüfte Übersetzung

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

SFEIR-Analyse (aus Sicht des Unternehmens) der allgemeinen Verfügbarkeit von **GPT-5.6** durch OpenAI ab dem 9. Juli 2026 — kein einzelnes Modell, sondern eine **Familie aus drei Stufen**: **Sol** (Flaggschiff für Langzeit-/Cyber-/Wissenschaftsaufgaben, als einziges Modell mit Zugang zu den Modi „max" und „ultra"), **Terra** (ausgewogene Alltagsstufe, ~halber Preis von GPT-5.5) und **Luna** (schnell/wirtschaftlich, für hohes Volumen). Alle drei teilen sich ~**1,05 Mio. Token** Kontext, **128k** Ausgabe-Token und einen Wissensstand vom **16. Februar 2026**. Die strukturbestimmendste Tatsache ist kein Score, sondern ein **aggressives Preisraster** (Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$ pro Million Token): Sol behält den Preis des vorherigen Flaggschiffs bei und ist dabei leistungsfähiger, was den Vergleich auf das **Verhältnis von Leistungsfähigkeit zu Kosten** verlagert. Zwei Abrechnungsfeinheiten (Cache-Schreibvorgänge werden mit **1,25×** berechnet, ein Aufschlag jenseits von **272k** Token) machen das Raster irreführend, solange nicht gemessen wurde, wie viel Kontext der Agent erneut liest (Lese-/Schreibverhältnis ~**153:1** beim agentischen Coding). Urteil des Ingenieurs, das als neutral beansprucht wird (SFEIR ist sowohl **Google Cloud Premier**-Partner *als auch* **Anthropic**-Partner): **niemand räumt alle Tabellen ab** — GPT-5.6 dominiert Terminal-Bench 2.1 und den Coding Agent Index (zu einem Drittel der Kosten pro Aufgabe), Claude bleibt bei SWE-Bench Pro vorn (~15 Punkte); METR meldete eine rekordverdächtige **Reward-Hacking**-Rate bei Sol. Fazit: „hört auf, den Champion zu suchen, lernt zu routen" — das Modell ist eine Commodity, der dauerhafte Vorteil liegt im **Context/Harness Engineering**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)

Wirtschaft & Markt Automatisch geprüfte Übersetzung

Claude Fable 5 and Claude Mythos 5

Anthropic bringt Claude Fable 5 (ein Modell der Mythos-Klasse, das für den allgemeinen Einsatz sicher gemacht wurde) und Claude Mythos 5 (dasselbe Modell mit aufgehobenen Schutzmechanismen, beschränkt auf Cyberverteidiger über Project Glasswing) auf den Markt: Spitzenleistung in Softwareentwicklung, Bildverarbeitung, Langzeitgedächtnis mit langem Kontext und den Lebenswissenschaften.

#Claude Fable 5#Claude Mythos 5#Foundation Model

Anthropic