Zum Inhalt springen

root / tags / validation

#validation

2 Fiches

Architektur & Konstruktion Automatisch geprüfte Übersetzung

Un SDLC piloté par l'IA : le cycle SFEIR à 11 phases (et pourquoi l'industrie y converge)

SFEIR-Artikel (auf Französisch), das einen **KI-gesteuerten SDLC in 11 Phasen (0 bis 10)** formalisiert und argumentiert, dass sich die Branche darauf zubewegt. Ausgangsbeobachtung: 2025 fügten Organisationen KI-Tools hinzu, ohne ihr Betriebsmodell zu transformieren — was ein Paradox erzeugt: « alles ändert sich… und nichts ändert sich » (die Ausführungsgeschwindigkeit vervielfacht sich ohne proportionalen Gewinn). Die eigentliche Antwort liegt nicht in der Wahl der Tools, sondern in der **Neugestaltung des Zyklus** für die maschinelle Ausführung. Der SFEIR-Zyklus stützt sich auf **drei unveränderliche menschliche Gates** (Define, Plan, Ship), automatische Phasen dazwischen sowie **zwei Kapitalisierungsmomente** (Compound-1 vor der Bereitstellung, Compound-2 in Produktion), die Lehren in wiederverwendbare Regeln umwandeln. Drei Prinzipien: **KI führt aus** (vollständige Artefakte + Ausführungsnachweis, ohne den eigenen Angaben des Agenten je zu vertrauen), der **Mensch behält die Kontrolle über die Absicht**, das **System lernt kumulativ**. Gemessene Ergebnisse (Neugestaltung 6 Monate→1 Tag, **−30 % der Iterationen** nach zehn Zyklen) sowie eine behauptete Konvergenz mit ADLC, Google und DORA 2025.

#SDLC#Entwicklungszyklus#KI

SFEIR

KI-Coding-Agenten & Skills Automatisch geprüfte Übersetzung

How Anthropic enables self-service data analytics with Claude

Fachbeitrag des Teams **Data Science & Data Engineering** von Anthropic (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry), veröffentlicht am **3. Juni 2026** im Anthropic-Blog (Kategorie *Enterprise AI*, Schwerpunkt **Claude Code**). **Kernergebnis**: ***"95% of business analytics queries are automated by Claude, with ~95% accuracy in aggregate"*** (bis zu **~99%** in bestimmten Domänen). **Kernproblem**: Analytics ist **kein** Code — *"there's often only a single correct answer using a single correct source"* — es erfordert, **eine Nutzerfrage auf präzise, aktuelle Entitäten** im Datenmodell abzubilden. Drei **Fehlermodi**: (1) **Ambiguität zwischen Konzept und Entität** (z. B. *"active users"*: welche Aktionen? Betrüger ausschließen? welches Zeitfenster?); (2) **Veralterung (Staleness)** (Assets und das Wissen des Agenten werden *"subtly wrong"*); (3) **Retrieval-Fehler** (*"80% of failed queries had the information present in the corpus"*, aber nicht auffindbar). **Lösung = ein 4-schichtiger "agentic analytics stack"**: (L1) **Data foundations** — dimensionale Modellierung, **kanonische Datensätze** *"single source-of-truth"*, Metadaten *"as a first-class product"*, Integrität via CI/CD; (L2) **Sources of truth** in absteigender Vertrauensreihenfolge — **semantic layer** (der Agent ist *"structurally required (by skill instruction) to leverage the semantic layer first"*), Lineage-Graph, **Query-Korpus** (destilliert in strukturierte Dokumente, **nicht** rohes Retrieval), Geschäftskontext (Knowledge Graph: Roadmaps, Entscheidungsprotokolle, Organisation); (L3) **Skills** — der entscheidende Hebel: ***"without skills … didn't exceed 21% … Adding skills gets these numbers consistently above 95%"***; strukturiert **in Paaren** (*Knowledge skill* = Router zu ~30 Referenzdateien; *Unbook skill* = Workflow eines Senior-Analysten: klären → Quellen finden → ausführen → **adversarial review**); Wartung **kolokiert** (*"a code-review hook flags any reporting-model change that doesn't touch a skill file"* → **~90% der Daten-PRs enthalten eine Skill-Änderung**); (L4) **Validation** — Offline-Evals (Schwellenwert ~90% zur Freigabe eines Agenten, Ziel ~100%), **Ablation-Testing** (bemerkenswertes negatives Ergebnis: rohes Grep über tausende SQL-Dateien → Genauigkeit bewegt sich *"less than a point"*), Online (Adversarial Review: **+6% Genauigkeit, +32% Tokens, +72% Latenz**), **Provenance-Footer** (Quellenstufe + Aktualität + Ownership), **aktives Correction Harvesting** (geplante Agenten durchsuchen Kanäle, um Markdown-Korrekturen zu entwerfen). **Strategische Erkenntnis**: *"documentation generated, definitions owned by humans"* — dem LLM zu überlassen, Metriken zu **definieren**, war *"net-negative"*. **Minimaler Startpunkt**: eine Handvoll kanonischer Datensätze + einige Dutzend Evals + ein *thin knowledge skill* erfassen *"most of the upside"*. Starke Konvergenz mit [[shihipar-claude-code-lessons-building-skills-2026-06-03]] (Skills = Ordner, Gotchas, Hooks), der Doktrin *systems around the model* von [[dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28]], dem **semantic layer / Ontologie**-Ansatz von talisman-modern-data-101-ontology-pipeline-refresh-2026-05-04 und seale-semantic-agent-model-harness-ontology-data-2026-04-17, dem *context development lifecycle* von debois-tessl-context-development-lifecycle-ai-coding-agents-2026-02-19 sowie der UDA/Knowledge-Graph von netflix-uda-unified-data-architecture-knowledge-graph-2025-06-12.

#self-service analytics#agentic data analytics#Claude Code

**Chen Chang · Clement Peng · Justin Leder · Johanne Jiao · Josh Cherry** — équipe **Data Science & Data Engineering d'Anthropic**. Article publié le **3 juin 2026** sur le blog Anthropic (claude.com/blog) · catégorie *Enterprise AI* · ~5 min de lecture.