Zum Inhalt springen
Technologie

Opus 4.7

Opus 4.7 — Technologie. Fähigkeit: Refactort 100k Zeilen, findet Zero-Days — aber jagged (uneinheitlich) bei einfachen Fragen · reasoning_effort_standard: xhigh (nach Korrektur) · score_expert_pass1: 48,6% (+-10,0%)

48.6% (+-10.0%) bei pass@1 auf Capture-the-Flag-Aufgaben für Experten: So platzierte das UK AI Safety Institute Opus 4.7 in seiner Evaluation vom 30 April 2026, hinter GPT-5.4 (52.4%) und weit hinter GPT-5.5 (71.4%). Dasselbe Modell refaktoriert 100k Zeilen Code und findet Zero-Days. Andrej Karpathy nutzt genau diese Lücke als sein Maß für Ungleichmäßigkeit: Opus 4.7 bewältigt das Refactoring und rät anschließend, die 50m zur Waschanlage zu Fuß zurückzulegen. Seine Erklärung dafür ist die Verifizierbarkeit, da die Labore Reinforcement Learning in Domänen einsetzen, in denen sich Antworten überprüfen lassen, was Spitzenwerte in Mathematik und Code erzeugt und Einbrüche anderswo.

Anthropics Post-Mortem vom April 2026 zeigt, dass das Verhalten eher durch Konfiguration als durch die Gewichte schwankt. Der standardmäßige Reasoning-Aufwand sank zwischen 4 March und 7 April von high auf medium, um Einfrieren der Oberfläche zu beheben; Nutzer empfanden Claude Code daraufhin als weniger intelligent, und Anthropic machte die Änderung rückgängig, indem es xhigh für Opus 4.7 und high für die übrigen Modelle festlegte. Eine separate Systemprompt-Anweisung, die die Ausführlichkeit begrenzte, kostete in Ablationstests 3% Intelligenz, bei Opus 4.6 ebenso wie bei Opus 4.7. Dasselbe Dokument schreibt dem Code-Review-Tool von Opus 4.7, das mit vollem Repository-Kontext arbeitet, die identification rétrospective du bug de cache zu, die Opus 4.6 nicht hatte liefern können.

Thariq Shihipar stützt sich auf eine andere Eigenschaft. HTML-Ausgabe kostet mehr Token als Markdown, und das 1MM-Kontextfenster von Opus 4.7 fängt diesen Unterschied auf. Die Generierung läuft dennoch zwei- bis viermal langsamer.

Typ
Technologie
Fähigkeit
Refactort 100k Zeilen, findet Zero-Days — aber jagged (uneinheitlich) bei einfachen Fragen
reasoning_effort_standard
xhigh (nach Korrektur)
score_expert_pass1
48,6% (+-10,0%)
Relationen
4
Zitiert in
3 fiches

Nachbarschaft

1MM context window GPT-5.5 identification rétro… Opus 4.6

→ verwendet

1MM context window CONCEPT hohe Konfidenz stabil Quelle ↗

← übertrifft

GPT-5.5 TECHNOLOGIE hohe Konfidenz stabil Quelle ↗

→ löst

identification rétrospective du bug de cache EVENEMENT hohe Konfidenz stabil Quelle ↗

→ übertrifft

Opus 4.6 TECHNOLOGIE hohe Konfidenz stabil Quelle ↗

Zitiert in (3)