Sabato 26 settembre 2026Osservatorio indipendente sull'intelligenza artificialeAggiornato ogni mattina
Radar IA

Aggiornato al 26 settembre 2026

Quanto è vicina l'IA all'intelligenza umana?

Nessuna IA è la migliore in tutto. Qui prendiamo, per ogni capacità, il miglior risultato ottenuto da qualsiasi modello, come se li fondessimo in un'unica "super IA", e lo mettiamo a confronto con il riferimento umano dello stesso test.

93%del livello umano, in media, sulle capacità che sappiamo misurare. Il riferimento umano è superato in 3 capacità su 6; 3 capacità restano fuori da ogni test.

La super IA è fatta di GPT-6 Astra Claude Fable GPT-5.5 Qwen3.8-Max Qwen3.6 Plus

La super IA a confronto con il riferimento umano, capacità per capacità Risolvere problemi mai visti (ARC-AGI-3): IA 62,7%, riferimento umano 100% — GPT-6 AstraProblemi nuovi63% del livello umanoBuon senso quotidiano (SimpleBench): IA 81,9%, riferimento umano 83,7% — Claude FableBuon senso98% del livello umanoScienza da dottorato (GPQA Diamond): IA 96,1%, riferimento umano 69,7% — GPT-6 AstraScienzaoltre il livello umanoLavoro professionale (GDPval): IA 84,9%, riferimento umano 50% — GPT-5.5Lavorooltre il livello umanoUsare un computer (OSWorld): IA 86,1%, riferimento umano 72,4% — Qwen3.8-MaxComputeroltre il livello umanoCapire immagini e grafici (MMMU): IA 86%, riferimento umano 88,6% — Qwen3.6 PlusImmagini e grafici97% del livello umanoImparare dall'esperienza: non misurabile con un test condivisoImpararenon misuratoSapere di non sapere: non misurabile con un test condivisoSapere di non saperenon misuratoAgire nel mondo fisico: non misurabile con un test condivisoMondo fisiconon misurato livello umano
Ogni spicchio è una capacità. Il cerchio tratteggiato è il livello umano dello stesso test: dove lo spicchio esce dal cerchio, la super IA fa meglio. Gli spicchi a righe sono capacità che nessun test condiviso misura ancora.

Capacità per capacità

  1. Risolvere problemi mai visti

    Giochi interattivi nuovi in cui bisogna scoprire da soli regole e obiettivi.

    Verificato da ARC Prize. Con un sistema di supporto dedicato arriva al 99,9% e usa meno mosse delle persone nel 96% dei livelli, ma ARC Prize avverte che questo non basta a parlare di AGI. ARC Prize — GPT-6 Astra su ARC-AGI-3

  2. Buon senso quotidiano

    Domande a trabocchetto su spazio, tempo e relazioni sociali, facili per le persone.

    L'unico test di questa pagina in cui le persone comuni restano davanti a tutti i modelli. Il riferimento umano viene da un campione piccolo, 9 persone. SimpleBench

  3. Scienza da dottorato

    Domande di biologia, chimica e fisica scritte da ricercatori, difficili anche cercando online.

    Il test è quasi saturo: i primi modelli sono racchiusi in poco più di un punto. BenchLM — GPQA Diamond, settembre 2026 · Epoch AI — GPQA Diamond e riferimento umano

  4. Lavoro professionale

    Compiti reali di 44 professioni (report, fogli di calcolo, presentazioni), giudicati alla cieca contro il lavoro di professionisti con 14 anni di esperienza media.

    La percentuale indica quante volte il lavoro dell'IA è giudicato migliore o pari a quello dei professionisti: il 50% significherebbe parità. Dato dichiarato da OpenAI. OpenAI — GPT-5.5

  5. Usare un computer

    369 compiti reali su un sistema operativo, da svolgere guardando lo schermo e usando mouse e tastiera.

    Risultato dichiarato dal produttore: tra un test e l'altro cambiano condizioni e strumenti a disposizione. Steel.dev — classifica OSWorld

  6. Capire immagini e grafici

    Domande universitarie con diagrammi, tabelle, grafici e immagini in 30 materie.

    Rispetto agli esperti medi del test (82,6%) l'IA è già avanti; resta dietro solo ai più bravi. LLM Stats — classifica MMMU · MMMU — riferimenti umani

Senza riferimento umano

Domande ai confini del sapere

2.500 domande scritte da esperti ai limiti delle loro discipline.

54,8% GPT-6 Astra (OpenAI) · Humanity's Last Exam

Non esiste un riferimento umano: nessuna persona è esperta di tutte le materie. I modelli restano spesso troppo sicuri delle risposte sbagliate. Scale AI — classifica Humanity's Last Exam

Cosa nessun test misura ancora

Imparare dall'esperienza

Un modello non impara da quello che fa dopo l'addestramento: ogni conversazione riparte da capo, salvo le memorie che gli vengono fornite. Non esiste un test condiviso per misurarlo.

Sapere di non sapere

Quando non conosce la risposta, un modello spesso la inventa. Anche GPT-6 Astra, che ha ridotto molto il problema, sbaglia invece di ammettere di non sapere nel 51% dei casi in cui non conosce la risposta (Artificial Analysis). Fonte

Agire nel mondo fisico

Muoversi, manipolare oggetti, cavarsela in ambienti imprevisti: la robotica non ha ancora un confronto standard con le persone.

Metodo

  1. Per ogni capacità scegliamo un test pubblico che abbia un riferimento umano misurato dagli stessi autori.
  2. Prendiamo il miglior risultato di qualsiasi modello, anche se viene da laboratori diversi: è la "super IA" teorica, non un prodotto che esiste.
  3. L'indice è la media, capacità per capacità, di quanto l'IA arriva vicino al riferimento umano (massimo 100% per capacità: superarlo non compensa le altre).
  4. Molti risultati sono dichiarati dai produttori e condizioni di test diverse li rendono solo in parte confrontabili. Le capacità più difficili da misurare restano fuori dall'indice: per questo le elenchiamo a parte.

I benchmark misurano compiti precisi, non l'intelligenza in generale. Questa pagina è un modo per orientarsi, non una misura dell'AGI.