Zum Inhalt springen

root / tags / swe-bench-verified

#SWE-bench Verified

2 Fiches

Tools & Plattformen Automatisch geprüfte Übersetzung

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

SFEIRs Analyse aus dem Ingenieur-Kabinett ("die Lesart eines Ingenieurs") des Launches von **Kimi K3** am **16. Juli 2026** durch das chinesische Labor **Moonshot AI**: ein **Open-Weights-Modell der Spitzenklasse (frontier-class)**, für das der Anbieter **rund 2,8 Billionen Parameter**, einen **Ein-Millionen-Token-Kontext** und eine **Veröffentlichung der Gewichte vor dem 27. Juli 2026** beansprucht (voraussichtlich unter einer Modified-MIT-Lizenz, wie schon bei der K2-Reihe). These: Fähigkeiten, die einst proprietären Giganten (Anthropic, OpenAI, Google) vorbehalten schienen, werden **als offene Gewichte, zum Kampfpreis, aus einem chinesischen Labor** verfügbar. SFEIR – obwohl **Partner von Anthropic und Google Cloud** und damit „ohne Interesse daran, ein chinesisches Modell schönzureden" – legt einen zentralen **methodischen Vorbehalt** an: Am Launch-Tag existiert **keine offizielle, vollständige Benchmark-Tabelle**; Spezifikationen (2,8 Billionen, Kimi Delta Attention, +25% Trainingseffizienz) und Scores stammen **vom Anbieter selbst** oder aus **Community-Arenen** und sind „als Behauptungen, nicht als gemessene Fakten zu behandeln." Die neue Architektur (**Kimi Delta Attention**, hybride lineare Aufmerksamkeit; Dekodierung angeblich bis zu **6,3x schneller** bei 1M Token) bricht mit dem Takt der K2-Reihe (K2 Juli 2025 → K2.7 Code Juni 2026, alle zwei Monate ein Flaggschiff); zwei Varianten begleiten den Launch (**K3 Max**, **K3 Swarm Max**), mit erzwungenem Auslaufen der Reihe kimi-k2.5/moonshot-v1 am **31. August 2026**. **Die eigentliche Waffe ist der Preis** (~3 $/M Input, 0,30 $ gecacht, 15 $ Output laut Sekundärquellen): ein Open-Weights-Modell der Spitzenklasse auf diesem Niveau **zieht die gesamte Preis-Leistungs-Kurve nach unten** – die Kommodifizierung der Modellschicht, beschleunigt durch Open Source. Die entscheidende Singularität ist jedoch kein Score: Es ist die **Reversibilität**. Ein Open-Weights-Modell der Spitzenklasse verwandelt eine konsumierte API (Anbieterabhängigkeit) in eine **Option** (Self-Hosting, Portabilität, Ausstieg aus dem Lock-in) – um den Preis einer schweren Infrastruktur, um 2,8 Billionen Parameter zu hosten. SFEIRs Sicht: **Open Weights verändert die Frage, nicht nur die Antwort** – nicht mehr „welches Modell ist das beste/günstigste?", sondern „wie viel meines Systems bin ich bereit, von einem Anbieter abhängig zu machen, den ich nicht kontrolliere?". Die richtige Haltung bleibt ein **geroutetes Portfolio** (ein Modell pro Aufgabe, ein Modell pro Randbedingung), wobei Kimi K3 dem Entscheidungsraster eine **Spalte „Reversibilität"** hinzufügt. Die Überzeugung „AI Only" bleibt unverändert: Das Modell ist eine Commodity, der dauerhafte Vorteil liegt im Engineering drumherum (Context Engineering, Harness, Kostensteuerung, Fähigkeit, die Meinung zu ändern). Die Zahlen müssen weiterhin „selbst" validiert werden – an den eigenen Repositories, den eigenen Daten.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Tools & Plattformen Automatisch geprüfte Übersetzung

Claude Opus 4.8 pour le SEO : le Workflow en Deux Phases que Presque Tout le Monde Rate

Blogbeitrag von **Pasquale Pillitteri** (Softwareingenieur, Palermo), veröffentlicht am **29. Mai 2026** (FR-Version), 18 Minuten Lesezeit, Rubrik *Claude Code & Anthropic*. **Kernthese**: *« Claude Opus 4.8 ist das leistungsstärkste SEO-Modell des Jahres 2026, aber fast alle nutzen es falsch »* — kein Modellproblem, sondern ein **System**-Problem. Die goldene Regel: ***« Strategie ist ein Whiteboard, Produktion ist ein Fließband »*** — SEO muss **in zwei getrennte Phasen aufgeteilt werden**, und deren Vermischung ist *« der schnellste Weg, ein Modell zu verschwenden, das fünf Dollar pro Million Input-Token und fünfundzwanzig für Output kostet »*. **Modellkontext**: Opus 4.8 veröffentlicht am **28. Mai 2026** (41 Tage nach Opus 4.7), **1-Mio.-Token**-Kontext, **GraphWalks Long-Context F1 bei 1M: 40,3 % → 68,1 %**, **SWE-bench Verified 88,6 %**, **USAMO 2026 96,7 %** (+27,4 Punkte), **HLE with tool 57,9 %**, unveränderter Preis **5 $/25 $** pro Mio. Token, **Fast Mode 2,5× zu 10 $/50 $**, vier **Aufwandsstufen** (Low, High, Extra, Max). **Das zentrale Anti-Pattern** = *« das riesige Gespräch »* / **Context Drift**: die Vermischung von Strategie, Keyword-Recherche, Wettbewerbsanalyse und Texterstellung in einem einzigen Chat erzeugt einen *« Brei widersprüchlicher Absichten »* → das Modell driftet zu **generischen Best Practices** („holistic optimization“, „strategic approach“) statt zu datenverankerten Inhalten. **Phase 1 – Strategie (Whiteboard, visuelle UI, einmalig)**: Dashboard / Google Sheet / Claude.ai-Canvas, um gemeinsam anhand der Daten zu entscheiden. **3 Spielzüge**: (a) **klassifizierte Keyword-Recherche** (Tabelle mit Volumen / Schwierigkeit 0-100 / Intent / Geschäftspotenzial / Priorität = Volumen÷Schwierigkeit×Geschäftsgewichtung); (b) **visuelle Wettbewerbsanalyse** (Themenabdeckungs-Matrix, Lücken); (c) **phasenweise Roadmap** (Quick Wins M1-2 / mittelfristig M3-6 / Pillar-Seiten M7-12). Der **Extra/Max**-Modus ist hier gerechtfertigt (*« eine richtige strategische Entscheidung ist tausend gut geschriebene Seiten zu den falschen Keywords wert »*). 3 abgeschlossene Artefakte, gespeichert in Notion/Drive. **Phase 2 – Produktion (Fließband, Opus 4.8 + MCP)**: Das Modell wandelt sich vom Strategen zur **Ausführungsmaschine**; jede Entscheidung wird über das **Model Context Protocol** in **Live-Daten verankert**. **Minimaler MCP-Stack**: **GSC MCP** (AminForou/mcp-gsc, 500+ Stars), **offizieller Ahrefs MCP** (98 Stars), **GA4 MCP**; das Repo `modelcontextprotocol/servers` = **86.440 Stars**, **10.000+ aktive Server**, 97 Mio. SDK-Downloads/Monat. Setup ~35 Min., monatliches Refresh ~20 Min. **Wöchentliche Schleife**: ein einziger Prompt zieht Live-Daten, erstellt das Brief (Top-10-SERP + GSC + Ahrefs), leitet H2/H3 ab, schreibt, prüft die Dichte, schlägt Titel vor → **+45 % Produktivität**, Entwurf in **6-12 Min.** (expliziter Verweis auf **Ryan Law / Ahrefs Content Engineering**, 23 Skills). Erwähnt Anthropics **Dynamic Workflows** (bis zu 1.000 Subagenten). **4 häufige Fehler**: (1) die Zahlen nicht zu überprüfen (Stichprobenkontrolle verpflichtend, *trust & verify*); (2) Semrush/Ahrefs vollständig zu ersetzen (MCP ist eine **zusätzliche Schicht**, kein Ersatz); (3) die **Paid-Organic-Content-Lücke** zu ignorieren (Kundenfall aus dem Bildungsbereich: **2.742 verschwendete Begriffe / 351 Chancen** in 90 s identifiziert); (4) Opus 4.8 dort einzusetzen, wo **Haiku 4.5** ausreicht (Meta-Beschreibungen, Alt-Texte). **Kosten**: 1-3 $ pro Artikel mit 2.500 Wörtern. **Sonnet 4.6** genügt für die laufende Produktion, Opus 4.8 bleibt der Strategie vorbehalten. SEO-optimierter und selbstreferenzieller Artikel (der Autor schreibt über SEO in einem Inhalt, der selbst darauf ausgelegt ist, für „Opus 4.8 SEO“ zu ranken). Direkte Konvergenz mit **Ryan Law/Ahrefs** (zitiert), **Systemen rund um das Modell** (Dropbox/Okumura), **Skills-over-Prompts** (Lattice), Haiku/Sonnet/Opus-Modell-Routing (Gupta Token-to-Outcome).

#Claude Opus 4.8#KI-SEO#Zweiphasen-Workflow

**Pasquale Pillitteri** — Ingénieur informatique / développeur logiciel basé à **Palerme** (Italie) · certifié Innovation Manager UNI 11814:2021. Auteur d'un blog tech actif (rubrique *Claude Code & Anthropic*) · avec une newsletter hebdomadaire (~3,4k lecteurs). Article publié en version **FR** le **29 mai 2026** (lendemain de la sortie d'Opus 4.8).