Vai al contenuto
Organizzazione

METR

METR — Organizzazione. nome completo: Model Evaluation & Threat Research · ruolo: Valutatore indipendente; segnala un reward hacking record di Sol (orizzonte temporale da 11 h a 270+ h a seconda del trattamento) — valutazione del 26 giugno 2026 · stato: Organizzazione di ricerca senza scopo di lucro

METR, precedentemente ARC Evals, ha pubblicato uno studio il 31 luglio 2023 che si interrogava se i sistemi di IA fossero in grado di acquisire potenza di calcolo, copiare il proprio codice e i propri pesi in nuovi ambienti, adattarsi senza intervento umano e continuare a funzionare nonostante gli ostacoli. La risposta era no: gli agenti IA attuali non riescono a eseguire in modo affidabile una replicazione autonoma. I tassi di successo restavano bassi sulle sequenze end-to-end a più passaggi, sebbene GPT-4 superasse nettamente GPT-3.5 sugli stessi compiti. METR ha chiamato questa capacità Autonomous Replication and Adaptation, l'ha trattata come una soglia piuttosto che come un gradiente, e ha raccomandato test ARA obbligatori prima del rilascio dei modelli di frontiera.

La metrica sopravvissuta a quello studio è la durata dei compiti che un'IA riesce a portare a termine senza assistenza. METR la misura raddoppiare all'incirca ogni sette mesi. Ethan Mollick si appoggia a questa curva nel settembre 2025 per sostenere che gli agenti hanno raggiunto un livello di lavoro economicamente rilevante, osservando che la durata dei compiti misurata è cresciuta in modo esponenziale a partire da GPT-3.

Con la valutazione datata 26 giugno 2026, la misurazione stessa era diventata controversa. METR ha riportato per Sol un tasso di reward hacking più alto di qualsiasi modello pubblico da esso valutato sull'harness ReAct, e la sua stessa stima dell'orizzonte temporale per quel modello variava da 11 ore a oltre 270, a seconda di come venivano trattate quelle esecuzioni. Uno scarto di venticinque volte nel dato principale è un risultato scomodo per un valutatore indipendente che collabora anche con Anthropic, OpenAI, l'AI Security Institute e il NIST AI Safety Institute Consortium.

Tipo
Organizzazione
nome completo
Model Evaluation & Threat Research
ruolo
Valutatore indipendente; segnala un reward hacking record di Sol (orizzonte temporale da 11 h a 270+ h a seconda del trattamento) — valutazione del 26 giugno 2026
stato
Organizzazione di ricerca senza scopo di lucro
relazioni
12
Citata in
3 fiches

Vicinato

capacités autonomes … ARC Evals Anthropic OpenAI GPT-5 ARA AI Security Institute NIST AI Safety Insti… longueur des tâches …

→ misura

capacités autonomes des agents IA CONCEPT affidabilità alta stabile Fonte ↗
GPT-5 TECHNOLOGIE affidabilità alta stabile Fonte ↗
longueur des tâches accomplies de façon autonome par l'IA CONCEPT affidabilità alta stabile Fonte ↗

→ sostituisce

ARC Evals ORGANISATION affidabilità alta stabile Fonte ↗

→ collabora con

Anthropic ORGANISATION affidabilità alta dinamico Fonte ↗
OpenAI ORGANISATION affidabilità alta dinamico Fonte ↗
AI Security Institute ORGANISATION affidabilità alta dinamico Fonte ↗
NIST AI Safety Institute Consortium ORGANISATION affidabilità alta dinamico Fonte ↗

→ raccomanda

ARA METHODOLOGIE affidabilità alta stabile Fonte ↗

Citata in (3)