The state of open source AI (v1.0.1, juillet 2026)
Wiederkehrender Bericht von Mozilla, The state of open source AI, v1.0.1, Juli 2026, eingeleitet durch einen Brief von Raffi Krikorian (CTO): sieben Abschnitte, eine interaktive Website und ein herunterladbarer Bericht.
Von **Mozilla** — éditeur du rapport// Quelle stateofopensource.ai ↗/Lesezeit 2 min/.md// Automatisch geprüfte Übersetzung
#Mozilla#state of open source AI#Open Weights#Open Weights#Open Source AI#OSI-Definition#Trainingscode#Datendokumentation
Wiederkehrender Bericht von Mozilla, The state of open source AI (v1.0.1, Juli 2026), eingeleitet von seinem CTO Raffi Krikorian.
Die These eröffnet den ersten Abschnitt: « Die Modellebene ist zur Commodity geworden. Der Wert verlagert sich auf den Harness darüber. » Inputs, die zur Commodity geworden sind, verlieren ihre Preissetzungsmacht, und die Mehrheit der Produktions-Workloads läuft weit unterhalb der Frontier-Obergrenze.
A harness tuned tightly to one lab's weights… degrades on anyone else's model, so the tighter the tuning, the less swappable the weights underneath. Lock-in arrives as a side effect of optimization.
— **Mozilla** — éditeur du rapport , stateofopensource.ai
Fähigkeitsstand. Auf dem Artificial Analysis Intelligence Index erzielt das beste geschlossene Modell 61 Punkte (Claude Opus 5), das beste offene Modell 57 (Kimi K3), Rang vier insgesamt; auf dem Epoch Capabilities Index beträgt der Abstand sechs Punkte, „etwa ein Release-Zyklus", bei überlappenden Konfidenzintervallen. Die Frontier ist sägezahnförmig: Offene Modelle führen bei Frontend-Code, liefern sich ein Kopf-an-Kopf-Rennen bei agentischer Terminalarbeit und geben bei professioneller Wissensarbeit deutlich Boden ab.
Die Nutzungsverschiebung. Der Anteil der über OpenRouter geleiteten Tokens, der an Open Weights geht, stieg von einem vernachlässigbaren Niveau auf eine Mehrheit bis Mitte 2026, wobei die sieben Modelle mit dem höchsten Volumen alle offen sind — der Bericht merkt jedoch an, dass gemessen an der Anzahl der Anfragen geschlossene Anbieter weiterhin führen, wobei der Vorsprung der offenen Modelle ein Vorsprung beim Token-Volumen ist, der sich auf Coding- und agentische Workloads konzentriert.
Das zentrale Ergebnis: « Open shippt leicht. Open deployt schwer. » 79 % der Entwickler nutzen offene Modelle gegenüber 71 % bei geschlossenen, wobei die Hälfte beides nutzt; aber nur 53 % der Teams mit offenen Modellen erreichen die Produktion gegenüber 63 %, und die Lücke wächst mit der Unternehmensgröße, was eine Erklärung durch Ressourcen ausschließt. Die Stack-Map bestätigt dies: zwei kalte Spalten über alle Schichten hinweg, Standardisierung und Enterprise Readiness.
Der Harness ist die neue Frontier.« Der agentische Harness ist ein weiterer User Agent » — die Rolle des Browsers, eine Ebene höher wiederholt. Und der Lock-in-Mechanismus wird präzise formuliert: Der Harness eines Labors, abgestimmt auf dessen eigene Gewichte, verschlechtert sich bei allen anderen, sodass « die Gewichte darunter umso weniger austauschbar sind, je enger die Abstimmung ist. Lock-in entsteht als Nebeneffekt der Optimierung. »
Souveränität wird als Austrittsrecht gerahmt, veranschaulicht durch den neunzehntägigen Blackout von Fable 5 im Zuge von Exportkontrollen: « Man kann ein Modell abschalten. Man kann keine Kopie abschalten, die bereits auf einer Maschine läuft, die man selbst besitzt. »
Mozilla misst, wofür es eintritt. Die Sorgfalt der Bildunterschriften und eine selbst deklarierte Watchlist zur Umkehrbarkeit machen die Daten nutzbar; die Rahmung bleibt eine These.
Kernpunkte
Datum / Quelle.The state of open source AI, Mozilla, v1.0.1, Juli 2026, Einleitung von Raffi Krikorian (CTO). Genannte Drittquellen (Artificial Analysis, Epoch AI, OpenRouter, LMArena) sowie eine proprietäre Erhebung mit SlashData (n = 1.410 zu Adoptionshürden).
Zentrale Einordnung.« Die Modellebene ist zur Commodity geworden. Der Wert verlagert sich auf den Harness darüber. » Begründung: « Commodity-Inputs verlieren ihre Preissetzungsmacht », und die Mehrheit der Produktions-Workloads läuft weit unterhalb der Frontier-Obergrenze. ### Die Begriffsunterscheidung, die man sich merken sollte | Begriff | Was er umfasst | |---|---| | Open Model | herunterladbare Gewichte, ausführbar und veränderbar auf selbst kontrollierter Hardware | | Open Weights | Parameter unter einer freizügigen Lizenz, ohne Trainingscode oder Datendokumentation — « was den Großteil dessen beschreibt, was dieser Bericht misst » | | Open Source AI (im Sinne der OSI) | erfordert zusätzlich Trainingscode und ausreichende Angaben zu den Daten, um das System zu rekonstruieren | Der Bericht trägt den Titel open source AI, misst aber überwiegend Open Weights. Er sagt das selbst; die Kernaussagen werden es nicht sagen. ### Fähigkeitslücke, zwei übereinstimmende Messinstrumente | Instrument | Geschlossen | Offen | Abstand | |---|---|---|---| | Artificial Analysis Intelligence Index v4.1 | 61 (Claude Opus 5) | 57 (Kimi K3) | 4 Punkte; K3 Rang 4 von 586 Modellen, 3 der Top 11 mit offenen Gewichten | | Epoch Capabilities Index | 162 (GPT-5.6 Sol) | 156 (K3) | 6 Punkte ≈ ein Release-Zyklus, überlappende Konfidenzintervalle | Preislich liegt K3 3,6 Punkte unter der Spitze — bei etwa einem Drittel des Preises. ### Die sägezahnförmige Frontier Offene Modelle führen bei Frontend-Code (K3, 1.679 Elo, sechs von sieben Domänen in der LMArena Frontend Code Arena); sie liefern sich ein Kopf-an-Kopf-Rennen bei agentischer Terminalarbeit (88,3 gegenüber 88,8 im Terminal-Bench 2.1; K3 gewinnt Program Bench, SpreadsheetBench 2 und BrowseComp, verliert bei FrontierSWE mit 81,2 gegenüber 86,6); sie geben Boden ab bei professioneller Wissensarbeit (Fable 5 führt mit 92 Elo vor K3 im GDPval-AA v2, der größte Abstand unter den gemeinsam gemessenen Benchmarks, was Moonshot einräumt). Daher: « Passt man das Modell zur Aufgabe, braucht man die Frontier seltener, als man denkt. » Der Bericht weist darauf hin, dass die Werte unterschiedliche Skalen verwenden und größtenteils aus von Anbietern durchgeführten Tests stammen — « als richtungsweisend zu betrachten ». ### Die am häufigsten falsch zitierte Zahl Open Weights stiegen von einer vernachlässigbaren Basis auf ein Drittel der OpenRouter-Tokens Ende 2025 und dann auf eine Mehrheit bis Mitte 2026, wobei die sieben Modelle mit dem höchsten Volumen alle offen gewichtet sind (72,4 % des Top-20-Volumens entfallen auf die Ränge 1–10 mit offenen Gewichten). Aber: « Gemessen an der Anzahl der Anfragen führen geschlossene US-Anbieter weiterhin. Der Vorsprung der offenen Modelle ist ein Vorsprung beim Token-Volumen, konzentriert auf Coding- und agentische Workloads », und die Anteile erfassen nur die Top 20. Eine Mehrheit der Tokens ist nicht dasselbe wie eine Mehrheit der Anwendungsfälle. ### Deployment vor Fähigkeit « Open shippt leicht. Open deployt schwer. » 79 % der Entwickler, die KI einführen, nutzen offene Modelle gegenüber 71 % bei geschlossenen, und 50 % nutzen beides (29 % nur offen, 21 % nur geschlossen): Die beiden Kategorien ergänzen sich, statt zu konkurrieren. Aber 53 % der Teams mit offenen Modellen erreichen die Produktion gegenüber 63 % bei geschlossenen, und die Lücke wächst mit der Unternehmensgröße — geschlossen 54 % → 73 %, offen 53 % → 57 %. « Die Größenordnung schließt eine Erklärung durch Ressourcen aus. Unternehmen können sich den Weg durch geschlossenes Deployment freikaufen. Offenes Deployment wartet auf Tooling, das noch unfertig ist. » Genannte Hindernisse, alle operativer Natur: Infrastrukturkosten, Sicherheit und Compliance, Wartung, Deployment-Komplexität. Die Stack-Map (48 Komponenten, 9 Schichten, 10 Kriterien) bestätigt dies aus einem anderen Blickwinkel: zwei durchgängig kalte Spalten über alle Schichten hinweg — Standardisierung und Enterprise Readiness. ### Abschnitt 5: der Harness als User Agent Die Analogie ist der Browser, « Code auf Seiten des Nutzers, der in dessen Namen mit Servern verhandelt », eine Ebene höher wiederholt. Der Harness ist « der Ort, an dem sich die Produktionsschwierigkeit konzentriert und an dem der Wettstreit offen-vs-geschlossen, Eigentümer-vs-Mieter von Neuem beginnt ». Fünf kartierte Schichten: Govern (zustandsbehaftete Policy, Registry und Lineage, Budget und Widerruf), Surface (AG-UI/A2UI, x402/AP2/UCP), Action (E2B/Daytona/Modal-Sandboxes, Berechtigung und Identität — « die ungelöste Schreib-Oberfläche » —, Eval und Observability), Reach (MCP, A2A, Memory), Control (LangGraph, CrewAI, AutoGen, LlamaIndex). Die Formulierung « die ungelöste Schreib-Oberfläche » greift die Diagnose in [[valente-zalewski-beyond-zero-enterprise-security-ai-era-2026-07-20]] auf: Lesen ist gelöst, Schreiben nicht. ### Der Lock-in-Mechanismus « Das Modell frisst den Harness. » Bei jedem Modell, bei dem der eigene Harness eines Labors und ein unabhängiger Harness nebeneinander existieren, gewinnt inzwischen ersterer, wobei sich die Lücke von 21,8 Punkten an der Spitze auf etwa 3 verringert hat. Daher: « Ein Harness, der eng auf die Gewichte eines Labors abgestimmt ist, wird zu einer passgenauen Komponente des Produkts dieses Labors. Er verschlechtert sich bei jedem anderen Modell, sodass die Gewichte darunter umso weniger austauschbar sind, je enger die Abstimmung ist. Lock-in entsteht als Nebeneffekt der Optimierung. » Lock-in muss keine Strategie sein: Optimieren genügt. Vergleiche mit dem Portabilitätsvertrag in [[janakiram-agent-platform-portability-contract-2026-07-20]]. ### Traktion und Ökonomie LangChain mit über 126.000 Stars und 60 % Entwickleranteil; MCP mit 97 Mio. monatlichen SDK-Downloads und über 10.000 aktiven Servern innerhalb eines Jahres, +4.750 % in 16 Monaten, im Dezember 2025 an die Agentic AI Foundation übergeben. Governance-Lücke: nur ~21 % der Unternehmen berichten von einer ausgereiften Agenten-Governance. Bei den Preisen fiel die Inferenz auf GPT-4-Niveau um das 50-Fache in 36 Monaten (gegenüber dem 2,6-Fachen bei Bandbreite während der Dotcom-Ära), wobei der Frontier-Preis seit den 45 $ von GPT-4 um das 112-Fache gefallen ist. Auf OpenRouter (Mai–Sept. 2025) hielten geschlossene Modelle ~80 % der Nutzung und ~96 % des Umsatzes — bei gleicher Qualität kostet ein Aufruf etwa das 6-Fache, was auf geschätzte ~24,8 Mrd. $ nicht realisierte jährliche Einsparungen hindeutet (Studie von Nagle-Yue für die Linux Foundation). ### Souveränität und das Recht auf Austritt Mehr als 70 aktive nationale Strategien, und « das strategische Argument für Open ist die Fähigkeit zu gehen », gestützt durch den Präzedenzfall Cloud (90.000–120.000 $ für den Ausstieg aus einem Petabyte bei S3, 37signals von 3,2 Mio. $ auf unter 1 Mio. $ gesunken, 80 % der Unternehmen repatriieren). « Geschlossene Modell-APIs reproduzieren dieselbe Falle … Open Weights sind Austrittsrechte. »Der neunzehntägige Blackout macht das Argument greifbar: 9. Juni, Anthropic bringt Fable 5 und Mythos 5 heraus → 12. Juni, das Handelsministerium wendet mit sofortiger Wirkung Exportkontrollen an und verwehrt jedem ausländischen Staatsangehörigen den Zugang, einschließlich Anthropics eigenen Mitarbeitern; da die Staatsangehörigkeit in Echtzeit nicht überprüfbar ist, werden beide Modelle für alle abgeschaltet → 26. Juni, teilweise Wiederherstellung von Mythos für ~100 US-Organisationen kritischer Infrastruktur → 30. Juni, aufgehoben → 1. Juli, Fable 5 wiederhergestellt. Am 16. Juli öffnet Moonshot dann die API von K3. « Zugang kann entzogen und wiederhergestellt werden. Eine Weight-Veröffentlichung kann nicht zurückgenommen werden, sobald die Dateien verteilt sind … Man kann ein Modell abschalten. Man kann keine Kopie abschalten, die bereits auf einer Maschine läuft, die man selbst besitzt. » ### China Qwen überholte bei den Hugging-Face-Downloads bis Februar 2026 die nächsten acht Organisationen zusammengenommen; chinesische Open-Weight-Modelle stiegen von unter 2 % der OpenRouter-Tokens Ende 2024 auf über 45 % des wöchentlichen Traffics bis April 2026, ~61 % unter den zehn meistgenutzten Modellen. DeepSeek gibt über 26.000 Unternehmenskonten an und war 2025 Teil des Stacks von 58 % der neuen KI-Startups, selbst während mindestens acht Rechtsräume den gehosteten Dienst einschränkten: « Unternehmen verbieten die gehostete App und übernehmen die Gewichte trotzdem. » ### Die K3-Distillation-Affäre, nach den eigenen Kategorien des Berichts | Stufe | Inhalt | |---|---| | Bestätigt | Anthropics Offenlegung vom Februar 2026 — ~24.000 betrügerische Konten, über 16 Mio. Austausche, davon 3,4 Mio. Moonshot zugeschrieben, gegen frühere Claude-Modelle; Aussagen von Kratsios (22. Juli) und Bessent (21.) | | Signal | Greenblatt (Redwood Research): K3 identifiziert sich selbst als Claude, auf eine Weise, die statistisch schwer als Rauschen zu erklären ist — nennt jedoch ein Modell, das der Affäre vorausgeht, und Selbstidentifikation ist ein bekanntes Artefakt des Trainings auf Web-Text | | Beweis | fehlt — « Keine Logs und kein forensisches Paket. Moonshot bestreitet. » | Der Bericht merkt an, dass die Veröffentlichung von Gewichten inzwischen Verhaltensforensik ermöglicht. Der Vorwurf sollte niemals als erwiesen dargestellt werden. ### Die Watchlist und ihre Methode Vier Signalfamilien (Fähigkeit/Adoption, Harness, Marktstruktur, Vertrauen/Sicherheit), jede mit einer eigenen Umkehrbedingung — « Kehrt sich um, wenn: sich der Vorsprung des Labor-Harness vergrößert oder eine geschlossene Plattform den Berechtigungsstandard zuerst setzt ». Im Voraus festzulegen, was die These widerlegen würde, unterscheidet dieses Dokument von einem gewöhnlichen Positionspapier. ### Ein Hinweis zur Vorsicht beim Zitieren Mozilla misst ein Thema, für das es selbst eintritt. Die Sorgfalt der Bildunterschriften und das Vorhandensein von Umkehrbedingungen machen die Daten nutzbar; die Rahmung — Kommodifizierung erreicht, Offenheit unausweichlich, « offen hat gewonnen » — ist eine These, keine Feststellung.
Kernzahlen
57 im Artificial Analysis Intelligence Index v4.1, gegenüber 61 für das beste geschlossene Modell
die Modellschicht ist zur Commodity geworden, und der Wert verschiebt sich hin zum agentischen Harness
— Mozilla
der Vorsprung bei offenen Gewichten ist ein Token-Volumen und keine Anzahl von Anfragen, konzentriert auf Coding und Agentic
— Mozilla
kein Protokoll und keine forensische Akte stützt den Vorwurf der Distillation, den Moonshot bestreitet
— Mozilla
Kimi K3 aurait été entraîné par extraction covert à grande échelle depuis Fable 5
— Michael Kratsios
Der aus dieser Fiche extrahierte Wissensgraph — 8 Entitäten, 25 Relationen.
In diesem Graphen :The state of open source AI · Mozilla · Raffi Krikorian · open-weights · écart opérationnel · verrouillage par optimisation · surface d'écriture non résolue · droit de sortie