Vai al contenuto

root / tags / gotchas

#gotchas

2 fiches

Agenti di codifica IA e Skills Traduzione verificata automaticamente

How Anthropic enables self-service data analytics with Claude

Approfondimento tecnico del team **Data Science & Data Engineering** di Anthropic (Chen Chang, Clement Peng, Justin Leder, Johanne Jiao, Josh Cherry) pubblicato il **3 giugno 2026** sul blog Anthropic (categoria *Enterprise AI*, incentrato su **Claude Code**). **Risultato principale**: ***"il 95% delle query di business analytics viene automatizzato da Claude, con un'accuratezza aggregata del ~95%"*** (fino al **~99%** in alcuni ambiti). **Problema di fondo**: l'analytics **non** è codice — *"spesso esiste un'unica risposta corretta a partire da un'unica fonte corretta"* — richiede di **mappare la domanda dell'utente su entità precise e aggiornate** nel modello dei dati. Tre **modalità di fallimento**: (1) **ambiguità concetto↔entità** (es. *"utenti attivi"*: quali azioni? escludere i truffatori? quale finestra temporale?); (2) **obsolescenza** (gli asset e la conoscenza dell'agente diventano *"sottilmente errati"*); (3) **fallimento del retrieval** (*"l'80% delle query fallite aveva l'informazione presente nel corpus"* ma introvabile). **Soluzione = uno "stack di analytics agentico" a 4 livelli**: (L1) **Fondamenta dei dati** — modellazione dimensionale, **dataset canonici** *"fonte unica di verità"*, metadati *"come prodotto di prima classe"*, integrità tramite CI/CD; (L2) **Fonti di verità** in ordine decrescente di affidabilità — **semantic layer** (l'agente è *"strutturalmente obbligato (per istruzione della skill) a utilizzare prima il semantic layer"*), grafo di lineage, **corpus di query** (distillato in documenti strutturati, **non** retrieval grezzo), contesto di business (grafo di conoscenza: roadmap, decision log, organizzazione); (L3) **Skills** — la leva decisiva: ***"senza skill … non si superava il 21% … Aggiungendo le skill questi numeri salgono stabilmente oltre il 95%"***; strutturate **in coppie** (*Knowledge skill* = router verso ~30 file di riferimento; *Unbook skill* = workflow da analista senior: chiarire → trovare le fonti → eseguire → **revisione avversariale**); manutenzione **colocata** (*"un hook di code review segnala qualsiasi modifica al modello di reporting che non tocchi un file di skill"* → **~90% delle PR sui dati include una modifica a una skill**); (L4) **Validazione** — eval offline (soglia ~90% per lanciare un agente, obiettivo ~100%), **ablation testing** (risultato negativo notevole: grep grezzo su migliaia di file SQL → l'accuratezza si muove *"meno di un punto"*), online (revisione avversariale: **+6% accuratezza, +32% token, +72% latenza**), **footer di provenienza** (livello della fonte + freschezza + proprietà), **raccolta attiva di correzioni** (agenti pianificati che scansionano i canali per redigere correzioni in markdown). **Intuizione strategica**: *"documentazione generata, definizioni possedute dagli esseri umani"* — lasciare che l'LLM **definisca** le metriche si è rivelato *"netamente negativo"*. **Punto di partenza minimo**: una manciata di dataset canonici + qualche decina di eval + una *knowledge skill leggera* catturano *"la maggior parte del vantaggio"*. Converge fortemente con [[shihipar-claude-code-lessons-building-skills-2026-06-03]] (skills = cartelle, Gotchas, hook), la dottrina dei *sistemi attorno al modello* di [[dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28]], il **semantic layer / ontologia** di talisman-modern-data-101-ontology-pipeline-refresh-2026-05-04 e seale-semantic-agent-model-harness-ontology-data-2026-04-17, il *context development lifecycle* di debois-tessl-context-development-lifecycle-ai-coding-agents-2026-02-19, e l'UDA/knowledge graph di netflix-uda-unified-data-architecture-knowledge-graph-2025-06-12.

#self-service analytics#agentic data analytics#Claude Code

**Chen Chang · Clement Peng · Justin Leder · Johanne Jiao · Josh Cherry** — équipe **Data Science & Data Engineering d'Anthropic**. Article publié le **3 juin 2026** sur le blog Anthropic (claude.com/blog) · catégorie *Enterprise AI* · ~5 min de lecture.

Agenti di codifica IA e Skills Traduzione verificata automaticamente

Lessons from building Claude Code: How we use skills

Post del blog di **Anthropic / claude.com** di **Thariq Shihipar** (Member of Technical Staff, team Claude Code), pubblicato il **3 giugno 2026**, che sintetizza l'**esperienza interna** di Anthropic nella progettazione e nell'uso delle **Skills**. **Tesi di inquadramento**: una Skill non è un semplice file markdown ma una **cartella** (istruzioni + script + risorse + configurazione + hook) che l'agente **esplora e manipola**; *« You should think of the entire file system as a form of context engineering and progressive disclosure. »* L'articolo apporta due contributi strutturanti. **(A) Una tassonomia di 9 categorie di skill** osservate in Anthropic: (1) **Library/API Reference** (documentazione per librerie/CLI interne con *gotchas* — es. `billing-lib`, `internal-platform-cli`, `sandbox-proxy`); (2) **Product Verification** (test/verifica tramite Playwright o tmux — `signup-flow-driver`, `checkout-verifier`, `tmux-cli-driver`); (3) **Data Fetching & Analysis** (accesso a stack di dati/monitoraggio — `funnel-query`, `cohort-compare`, `grafana`, `datadog`); (4) **Business Process Automation** (workflow ripetitivi — `standup-post`, `weekly-recap`, `create-<ticket>-ticket`); (5) **Code Scaffolding** (boilerplate di framework — `new-migration`, `create-app`); (6) **Code Quality & Review** (`adversarial-review`, `code-style`, `testing-practices`); (7) **CI/CD & Deployment** (`babysit-pr`, `deploy-<service>`, `cherry-pick-prod`); (8) **Runbooks** (diagnostica multi-tool — `<service>-debugging`, `oncall-runner`, `log-correlator`); (9) **Infrastructure Operations** (manutenzione con guardrail — `<resource>-orphans`, `cost-investigation`). **(B) Un insieme di best practice**: non ripetere l'ovvio (*« Claude already knows how to code and can read your codebase »* → puntare su ciò che **contraddice il comportamento predefinito**); curare la **sezione Gotchas** (*« the highest-signal content in any skill »*); **progressive disclosure** tramite l'albero dei file (indirizzare verso file di riferimento a seconda della situazione anziché caricare tutto in anticipo); **descrizioni scritte per il modello** (*« the description field is not a summary, it's a description of when to trigger this skill »*); **flussi di setup** (configurazione in `config.json`, altrimenti richiesta tramite `AskUserQuestion`); **memoria persistente** (log append-only / JSON tramite la variabile `${CLAUDE_PLUGIN_DATA}`); **script helper** (*« lets Claude spend its turns on composition… rather than reconstructing boilerplate »*); **hooks conditionnels** (attivati solo per la durata della skill — es. un hook di sicurezza che blocca comandi distruttivi). **Distribuzione in Anthropic**: le skill sono conservate in `./.claude/skills`, condivise informalmente via Slack in una cartella sandbox, poi promosse tramite **PR** nel **marketplace** interno una volta acquisita trazione; **misurazione dell'utilizzo** tramite un **hook PreToolUse** che registra le invocazioni (rivelando le skill popolari rispetto a quelle sottoutilizzate). Seguito diretto della fiche [[shihipar-claude-code-html-unreasonable-effectiveness-markdown-2026-05-10]] (stesso autore) e complemento concreto alle fiche sulle Skills di Anthropic/Willison/Vincent e all'*harness engineering*.

#skills#Claude Code#Anthropic

**Thariq Shihipar** (Member of Technical Staff chez Anthropic, équipe **Claude Code** ; @trq212 / @trq sur X, thariqs.github.io) · pour le blog **claude.com**. Même auteur que la fiche *Using Claude Code: The Unreasonable Effectiveness of HTML* (2026-05-10). Publié le **3 juin 2026**.