Aggiornato al 26 settembre 2026
Quanto è vicina l'IA all'intelligenza umana?
Nessuna IA è la migliore in tutto. Qui prendiamo, per ogni capacità, il miglior risultato ottenuto da qualsiasi modello, come se li fondessimo in un'unica "super IA", e lo mettiamo a confronto con il riferimento umano dello stesso test.
93%del livello umano, in media, sulle capacità che sappiamo misurare. Il riferimento umano è superato in 3 capacità su 6; 3 capacità restano fuori da ogni test.
La super IA è fatta di GPT-6 Astra Claude Fable GPT-5.5 Qwen3.8-Max Qwen3.6 Plus
Capacità per capacità
-
Risolvere problemi mai visti
Giochi interattivi nuovi in cui bisogna scoprire da soli regole e obiettivi.
persone comuni: tutti i livelli risolti 100%62,7% GPT-6 Astra (OpenAI) · ARC-AGI-3 37,3 punti sotto
Verificato da ARC Prize. Con un sistema di supporto dedicato arriva al 99,9% e usa meno mosse delle persone nel 96% dei livelli, ma ARC Prize avverte che questo non basta a parlare di AGI. ARC Prize — GPT-6 Astra su ARC-AGI-3
-
Buon senso quotidiano
Domande a trabocchetto su spazio, tempo e relazioni sociali, facili per le persone.
persone non specialiste 83,7%81,9% Claude Fable (Anthropic) · SimpleBench 1,8 punti sotto
L'unico test di questa pagina in cui le persone comuni restano davanti a tutti i modelli. Il riferimento umano viene da un campione piccolo, 9 persone. SimpleBench
-
Scienza da dottorato
Domande di biologia, chimica e fisica scritte da ricercatori, difficili anche cercando online.
esperti con dottorato 69,7%96,1% GPT-6 Astra (OpenAI) · GPQA Diamond supera il riferimento umano
Il test è quasi saturo: i primi modelli sono racchiusi in poco più di un punto. BenchLM — GPQA Diamond, settembre 2026 · Epoch AI — GPQA Diamond e riferimento umano
-
Lavoro professionale
Compiti reali di 44 professioni (report, fogli di calcolo, presentazioni), giudicati alla cieca contro il lavoro di professionisti con 14 anni di esperienza media.
parità con i professionisti 50%84,9% GPT-5.5 (OpenAI) · GDPval supera il riferimento umano
La percentuale indica quante volte il lavoro dell'IA è giudicato migliore o pari a quello dei professionisti: il 50% significherebbe parità. Dato dichiarato da OpenAI. OpenAI — GPT-5.5
-
Usare un computer
369 compiti reali su un sistema operativo, da svolgere guardando lo schermo e usando mouse e tastiera.
persone al computer 72,4%86,1% Qwen3.8-Max (Alibaba) · OSWorld supera il riferimento umano
Risultato dichiarato dal produttore: tra un test e l'altro cambiano condizioni e strumenti a disposizione. Steel.dev — classifica OSWorld
-
Capire immagini e grafici
Domande universitarie con diagrammi, tabelle, grafici e immagini in 30 materie.
i migliori esperti umani 88,6%86% Qwen3.6 Plus (Alibaba) · MMMU 2,6 punti sotto
Rispetto agli esperti medi del test (82,6%) l'IA è già avanti; resta dietro solo ai più bravi. LLM Stats — classifica MMMU · MMMU — riferimenti umani
Senza riferimento umano
Domande ai confini del sapere
2.500 domande scritte da esperti ai limiti delle loro discipline.
54,8% GPT-6 Astra (OpenAI) · Humanity's Last Exam
Non esiste un riferimento umano: nessuna persona è esperta di tutte le materie. I modelli restano spesso troppo sicuri delle risposte sbagliate. Scale AI — classifica Humanity's Last Exam
Cosa nessun test misura ancora
Imparare dall'esperienza
Un modello non impara da quello che fa dopo l'addestramento: ogni conversazione riparte da capo, salvo le memorie che gli vengono fornite. Non esiste un test condiviso per misurarlo.
Sapere di non sapere
Quando non conosce la risposta, un modello spesso la inventa. Anche GPT-6 Astra, che ha ridotto molto il problema, sbaglia invece di ammettere di non sapere nel 51% dei casi in cui non conosce la risposta (Artificial Analysis). Fonte
Agire nel mondo fisico
Muoversi, manipolare oggetti, cavarsela in ambienti imprevisti: la robotica non ha ancora un confronto standard con le persone.
Metodo
- Per ogni capacità scegliamo un test pubblico che abbia un riferimento umano misurato dagli stessi autori.
- Prendiamo il miglior risultato di qualsiasi modello, anche se viene da laboratori diversi: è la "super IA" teorica, non un prodotto che esiste.
- L'indice è la media, capacità per capacità, di quanto l'IA arriva vicino al riferimento umano (massimo 100% per capacità: superarlo non compensa le altre).
- Molti risultati sono dichiarati dai produttori e condizioni di test diverse li rendono solo in parte confrontabili. Le capacità più difficili da misurare restano fuori dall'indice: per questo le elenchiamo a parte.
I benchmark misurano compiti precisi, non l'intelligenza in generale. Questa pagina è un modo per orientarsi, non una misura dell'AGI.