Zum Inhalt springen

root / tags / terminal-bench

#Terminal Bench

4 Fiches

Tools & Plattformen Automatisch geprüfte Übersetzung

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

SFEIRs Analyse aus dem Ingenieur-Kabinett ("die Lesart eines Ingenieurs") des Launches von **Kimi K3** am **16. Juli 2026** durch das chinesische Labor **Moonshot AI**: ein **Open-Weights-Modell der Spitzenklasse (frontier-class)**, für das der Anbieter **rund 2,8 Billionen Parameter**, einen **Ein-Millionen-Token-Kontext** und eine **Veröffentlichung der Gewichte vor dem 27. Juli 2026** beansprucht (voraussichtlich unter einer Modified-MIT-Lizenz, wie schon bei der K2-Reihe). These: Fähigkeiten, die einst proprietären Giganten (Anthropic, OpenAI, Google) vorbehalten schienen, werden **als offene Gewichte, zum Kampfpreis, aus einem chinesischen Labor** verfügbar. SFEIR – obwohl **Partner von Anthropic und Google Cloud** und damit „ohne Interesse daran, ein chinesisches Modell schönzureden" – legt einen zentralen **methodischen Vorbehalt** an: Am Launch-Tag existiert **keine offizielle, vollständige Benchmark-Tabelle**; Spezifikationen (2,8 Billionen, Kimi Delta Attention, +25% Trainingseffizienz) und Scores stammen **vom Anbieter selbst** oder aus **Community-Arenen** und sind „als Behauptungen, nicht als gemessene Fakten zu behandeln." Die neue Architektur (**Kimi Delta Attention**, hybride lineare Aufmerksamkeit; Dekodierung angeblich bis zu **6,3x schneller** bei 1M Token) bricht mit dem Takt der K2-Reihe (K2 Juli 2025 → K2.7 Code Juni 2026, alle zwei Monate ein Flaggschiff); zwei Varianten begleiten den Launch (**K3 Max**, **K3 Swarm Max**), mit erzwungenem Auslaufen der Reihe kimi-k2.5/moonshot-v1 am **31. August 2026**. **Die eigentliche Waffe ist der Preis** (~3 $/M Input, 0,30 $ gecacht, 15 $ Output laut Sekundärquellen): ein Open-Weights-Modell der Spitzenklasse auf diesem Niveau **zieht die gesamte Preis-Leistungs-Kurve nach unten** – die Kommodifizierung der Modellschicht, beschleunigt durch Open Source. Die entscheidende Singularität ist jedoch kein Score: Es ist die **Reversibilität**. Ein Open-Weights-Modell der Spitzenklasse verwandelt eine konsumierte API (Anbieterabhängigkeit) in eine **Option** (Self-Hosting, Portabilität, Ausstieg aus dem Lock-in) – um den Preis einer schweren Infrastruktur, um 2,8 Billionen Parameter zu hosten. SFEIRs Sicht: **Open Weights verändert die Frage, nicht nur die Antwort** – nicht mehr „welches Modell ist das beste/günstigste?", sondern „wie viel meines Systems bin ich bereit, von einem Anbieter abhängig zu machen, den ich nicht kontrolliere?". Die richtige Haltung bleibt ein **geroutetes Portfolio** (ein Modell pro Aufgabe, ein Modell pro Randbedingung), wobei Kimi K3 dem Entscheidungsraster eine **Spalte „Reversibilität"** hinzufügt. Die Überzeugung „AI Only" bleibt unverändert: Das Modell ist eine Commodity, der dauerhafte Vorteil liegt im Engineering drumherum (Context Engineering, Harness, Kostensteuerung, Fähigkeit, die Meinung zu ändern). Die Zahlen müssen weiterhin „selbst" validiert werden – an den eigenen Repositories, den eigenen Daten.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Wirtschaft & Markt Automatisch geprüfte Übersetzung

The state of open source AI (v1.0.1, juillet 2026)

**Wiederkehrender Bericht von Mozilla**, *The state of open source AI*, **v1.0.1, Juli 2026**, eingeleitet durch einen Brief von **Raffi Krikorian** (CTO): sieben Abschnitte, eine interaktive Website und ein herunterladbarer Bericht. These, formuliert im Titel von Abschnitt 1: *« The model layer has commoditized. Value accrues to the harness above it. »* **Fähigkeitsstand**: Auf dem *Artificial Analysis Intelligence Index v4.1* erzielt das beste geschlossene Modell **61** Punkte (Claude Opus 5) und das beste offene Modell **57** (**Kimi K3**), Rang vier insgesamt und vor drei der größten geschlossenen Labore; auf dem *Epoch Capabilities Index* beträgt der Abstand **6 Punkte** (K3 bei 156 gegenüber GPT-5.6 Sol bei 162), beschrieben als *« about one release cycle »*, bei sich überlappenden Konfidenzintervallen. **Sägezahnförmige Frontier**: Offene Modelle führen bei Frontend-Code (K3 mit 1.679 Elo in der LMArena Frontend Code Arena, sechs von sieben Domänen), liefern sich ein Kopf-an-Kopf-Rennen bei agentischer Terminalarbeit (88,3 gegenüber 88,8 im Terminal-Bench 2.1) und geben bei professioneller Wissensarbeit Boden ab (Fable 5 führt vor K3 mit 92 Elo im GDPval-AA v2). **Nutzungsverschiebung**: Der Anteil der über OpenRouter geleiteten Tokens, die an Open-Weight-Modelle gehen, stieg von einem vernachlässigbaren Niveau auf ein Drittel Ende 2025 und dann auf eine **Mehrheit bis Mitte 2026**, wobei die sieben Modelle mit dem höchsten Volumen alle offen gewichtet sind — der Bericht selbst merkt an, dass *« by request count, closed US providers still lead »*, wobei der Vorsprung der offenen Modelle ein Vorsprung beim Token-Volumen ist, der sich auf Coding- und agentische Workloads konzentriert. **Der zentrale Gegensatz**: *« Open ships easy. Open deploys hard. »* — 79 % der Entwickler, die KI einführen, nutzen offene Modelle gegenüber 71 % bei geschlossenen, aber nur **53 %** der Teams mit offenen Modellen erreichen die Produktion **gegenüber 63 %**, und die Lücke wächst mit der Organisationsgröße (geschlossen 54 % → 73 %, offen 53 % → 57 %), was *« rules out a resources explanation »*. Die Reifegradkarte des Stacks (48 Komponenten, 9 Schichten) zeigt zwei durchgängig kalte Spalten — **Standardisierung** und ***Enterprise Readiness*** — identifiziert als die operative Lücke. **Abschnitt 5**: *« The agentic harness is another user agent »*, und *« The model is eating the harness »* — bei jedem Modell, für das beide Varianten existieren, gewinnt inzwischen der Harness des jeweiligen Labors selbst, wobei sich die Lücke von 21,8 Punkten auf etwa 3 verringert hat. Daher die Formel: *« A harness tuned tightly to one lab's weights… degrades on anyone else's model, so the tighter the tuning, the less swappable the weights underneath. Lock-in arrives as a side effect of optimization. »*

#Mozilla#state of open source AI#Open Weights

**Mozilla** — éditeur du rapport · avec une introduction signée **Raffi Krikorian** · *Chief Technology Officer*. Publié en **juillet 2026** (v1.0.1). Données issues de sources tierces créditées (Artificial Analysis, Epoch AI, OpenRouter, LMArena) et d'une enquête propre menée avec **SlashData** (*Mozilla / SlashData 2026 developer survey*, n = 1 410 sur la question des freins).

KI-Coding-Agenten & Skills Automatisch geprüfte Übersetzung

Agent Harness Engineering

Synthese von Addy Osmani (Google, Chrome/Cloud) zum aufkommenden Feld des *Harness Engineering*: die Gleichung `agent = model + harness`, das *Ratchet*-Prinzip („jeder Fehler wird zu einer Regel“), die HumanLayer-Umdeutung „skill issue“, die Terminal-Bench-Belege (Top 30 → Top 5 allein durch eine Änderung des Harness), die geschichtete Claude-Code-Architektur, Anthropics Vision „Harnesses schrumpfen nicht, sie verschieben sich“ sowie Harness-as-a-Service (Claude Agent SDK, Codex SDK, OpenAI Agents SDK). Schlüsselartikel, der Trivedy, HumanLayer, Anthropic und Böckeler zu einer Doktrin verdichtet.

#harness engineering#agent harness#Addy Osmani

Addy Osmani (Software Engineer at Google, Cloud + Gemini)

KI-Coding-Agenten & Skills Automatisch geprüfte Übersetzung

The Anatomy of an Agent Harness

Anatomy of an Agent Harness: Agent = Model + Harness, grundlegende Komponenten und die Entwicklung der LangChain-Harnesses

#agent harness#harness engineering#Agent = Model + Harness

Vivek Trivedy