- thekb.eu
- Grafo di conoscenza
- Tecnologia
- Opus 4.7
Opus 4.7
Opus 4.7 — Tecnologia. capacità: Refactor 100k righe, find zero days — ma jagged su domande semplici · reasoning_effort_predefinito: xhigh (dopo la correzione) · score_expert_pass1: 48,6% (+-10,0%)
48.6% (+-10.0%) di pass@1 su compiti capture-the-flag di livello esperto: è qui che lo UK AI Safety Institute ha collocato Opus 4.7 nella sua valutazione del 30 aprile 2026, dietro a GPT-5.4 (52.4%) e ben dietro a GPT-5.5 (71.4%). Lo stesso modello rifattorizza 100k righe di codice e non trova zero day. Andrej Karpathy usa esattamente questo scarto come indicatore di frastagliatura: Opus 4.7 gestisce il refactoring, poi consiglia di percorrere 50m a piedi fino all'autolavaggio. La sua spiegazione del perché riguarda la verificabilità, dato che i laboratori eseguono reinforcement learning su domini in cui le risposte possono essere verificate, il che genera picchi in matematica e codice e cali altrove.
Il post-mortem di Anthropic sull'aprile 2026 mostra un comportamento che oscilla in base alla configurazione più che ai pesi. Lo sforzo di ragionamento predefinito è sceso da high a medium tra il 4 marzo e il 7 aprile per risolvere blocchi dell'interfaccia; gli utenti hanno segnalato che Claude Code sembrava meno intelligente, e Anthropic ha fatto marcia indietro, impostando xhigh per Opus 4.7 e high per gli altri. Un'istruzione separata nel system prompt che limitava la verbosità è costata il 3% di intelligenza nei test di ablazione, sia per Opus 4.6 sia per Opus 4.7. Lo stesso documento attribuisce allo strumento Code Review di Opus 4.7, caricato con il contesto completo del repository, l'identification rétrospective du bug de cache che Opus 4.6 non era riuscito a produrre.
Thariq Shihipar si basa su una proprietà diversa. L'output HTML costa più token rispetto a Markdown, e la finestra di contesto da 1MM di Opus 4.7 assorbe la differenza. La generazione resta comunque due-quattro volte più lenta.
- Tipo
- Tecnologia
- capacità
- Refactor 100k righe, find zero days — ma jagged su domande semplici
- reasoning_effort_predefinito
- xhigh (dopo la correzione)
- score_expert_pass1
- 48,6% (+-10,0%)
- relazioni
- 4
- Citata in
- 3 fiches