Vai al contenuto
Tecnologia

GPT-5.5

GPT-5.5 — Tecnologia. score_expert_pass1: 71,4% (+-8,0%) · score_expert_pass5: 90,5% (+-12,9%)

L'AI Safety Institute del Regno Unito ha misurato GPT-5.5 al 71.4% di pass@1 (±8.0% errore standard) su compiti capture-the-flag di livello esperto, e al 90.5% di pass@5 (±12.9%), il punteggio più alto registrato da AISI al momento della sua valutazione pre-lancio pubblicata il 30 aprile 2026. Il confronto con gli altri modelli conta più del numero assoluto: GPT-5.4 ha ottenuto 52.4% e Opus 4.7 48.6%, mentre Mythos Preview si è fermato a 68.6%, statisticamente allo stesso livello di GPT-5.5. I compiti di base erano saturati al 100% da ogni modello di frontiera fin da febbraio 2026, quindi solo i livelli più difficili riescono ancora a distinguere qualcosa.

Su "The Last Ones (TLO)", un cyber range a 32 passaggi costruito con SpecterOps su quattro subnet e una ventina di macchine, che AISI stima richiederebbe a un esperto umano circa 20 ore, GPT-5.5 ha completato l'intera catena d'attacco in 2 tentativi su 10, secondo dopo Mythos Preview a 3/10. I red-teamer di AISI hanno poi trovato un jailbreak universale in sei ore, ottenendo contenuti offensivi su tutto l'insieme di richieste cyber malevole fornite da OpenAI. Un problema di configurazione ha impedito ad AISI di verificare le protezioni effettivamente distribuite.

Lo stesso modello si presenta in modo diverso su altri terreni. Dan Shipper cita un punteggio di 62/100 sul Senior Engineer benchmark, contro un intervallo umano di 80-90. Artificial Analysis colloca GPT-5.5 in impostazione xhigh a 1509 Elo su GDPval-AA, a pari merito con il modello open-weights GLM-5.2 a 1524 e ben dietro Claude Fable 5. A luglio 2026 GPT-5.5 era ormai il modello di punta uscente, con il suo prezzo ereditato da GPT-5.6 Sol.

Tipo
Tecnologia
score_expert_pass1
71,4% (+-8,0%)
score_expert_pass5
90,5% (+-12,9%)
relazioni
9
Citata in
1 fiches

Metriche di adozione

Vicinato

GPT-5.4 The Last Ones (TLO) Opus 4.7 jailbreak universel Mythos Preview GPT-5.6 GLM-5.2

→ supera

GPT-5.4 TECHNOLOGIE affidabilità alta stabile Fonte ↗
Opus 4.7 TECHNOLOGIE affidabilità alta stabile Fonte ↗

→ risolve

The Last Ones (TLO) TECHNOLOGIE affidabilità alta stabile Fonte ↗

← supera

jailbreak universel CONCEPT affidabilità alta stabile Fonte ↗

→ converge con

Mythos Preview TECHNOLOGIE affidabilità alta stabile Fonte ↗

← sostituisce

GPT-5.6 TECHNOLOGIE affidabilità alta stabile Fonte ↗

← compete con

GLM-5.2 TECHNOLOGIE affidabilità alta dinamico Fonte ↗

Citata in (1)