Aller au contenu
Technologie

Opus 4.7

Opus 4.7 — Technologie. capabilité : Refactor 100k lignes, find zero days — mais jagged sur questions simples · reasoning_effort_défaut : xhigh (après correction) · score_expert_pass1 : 48,6% (+-10,0%)

48.6 % (+-10,0 %) en pass@1 sur des tâches de capture-the-flag de niveau expert : c'est là que l'UK AI Safety Institute a placé Opus 4.7 dans son évaluation du 30 avril 2026, derrière GPT-5.4 (52,4 %) et loin derrière GPT-5.5 (71,4 %). Le même modèle refactore 100k lignes de code et ne trouve aucune faille zero-day. Andrej Karpathy se sert exactement de cet écart comme marqueur d'irrégularité : Opus 4.7 gère le refactoring, puis conseille de marcher 50m jusqu'au lave-auto. Son explication tient à la vérifiabilité : les laboratoires font tourner l'apprentissage par renforcement sur des domaines où les réponses sont vérifiables, ce qui crée des pics en maths et en code et des creux ailleurs.

Le post-mortem d'Anthropic sur avril 2026 montre un comportement qui oscille en fonction de la configuration plutôt que des poids. L'effort de raisonnement par défaut est passé de high à medium entre le 4 mars et le 7 avril pour corriger des gels d'interface ; les utilisateurs ont trouvé «Claude Code» moins intelligent, et Anthropic a fait marche arrière, en fixant xhigh pour «Opus 4.7» et high pour les autres. Une instruction distincte du system prompt plafonnant la verbosité a coûté 3 % d'intelligence lors des tests d'ablation, aussi bien pour «Opus 4.6» que pour «Opus 4.7». Le même document attribue à l'outil Code Review d'«Opus 4.7», chargé du contexte complet du dépôt, l'«identification rétrospective du bug de cache» qu'«Opus 4.6» n'avait pas réussi à produire.

Thariq Shihipar s'appuie sur une propriété différente. La sortie HTML coûte plus de tokens que le Markdown, et la fenêtre de contexte de 1MM d'«Opus 4.7» absorbe la différence. La génération reste deux à quatre fois plus lente.

Type
Technologie
capabilité
Refactor 100k lignes, find zero days — mais jagged sur questions simples
reasoning_effort_défaut
xhigh (après correction)
score_expert_pass1
48,6% (+-10,0%)
relations
4
Citée dans
3 fiches

Voisinage

1MM context window GPT-5.5 identification rétro… Opus 4.6

→ utilise

1MM context window CONCEPT confiance élevée stable Source ↗

← surpasse

GPT-5.5 TECHNOLOGIE confiance élevée stable Source ↗

→ résout

identification rétrospective du bug de cache EVENEMENT confiance élevée stable Source ↗

→ surpasse

Opus 4.6 TECHNOLOGIE confiance élevée stable Source ↗

Citée dans (3)