Sabato 26 settembre 2026Osservatorio indipendente sull'intelligenza artificialeAggiornato ogni mattina
Radar IA

Aggiornato al 26 settembre 2026

A che punto è l'IA

I modelli che contano, cosa sanno fare e quanto costano. I risultati nei benchmark sono spesso dichiarati dai produttori: li riportiamo come tali.

Settembre affollato

Nella sola prima settimana del mese Anthropic, Google, OpenAI e Meta hanno presentato nuovi modelli; il 21 e il 22 settembre sono seguiti Grok 4.7, Claude Opus 5.5, GPT-6 Sol e Luna e MiMo-V2.6. Il ritmo è ormai di un aggiornamento importante ogni poche settimane per laboratorio.

I prezzi scendono

Opus 5.5 costa circa il 40% in meno di Opus 5 sui carichi tipici, GPT-6 Sol e Luna dimezzano il listino dei predecessori, Gemini 3.8 Flash parte con un prezzo introduttivo. Per chi usa le API, rifare i conti ogni trimestre conviene.

L'open source insegue da vicino

MiMo-V2.6-Pro di Xiaomi e GLM-5.3 di Z.ai sono pubblicati con licenza MIT, che consente l'uso commerciale. Per molte aziende significa poter far girare un modello competitivo sui propri server.

La sicurezza entra nei prodotti

GPT-6 Astra è il primo modello OpenAI classificato a rischio "Critical" per la cybersicurezza: alcune funzioni sono bloccate. Anthropic distribuisce la variante meno limitata, Mythos 5.1, solo a organizzazioni verificate.

I modelli da conoscere

ModelloUscitoPrezzo API (input / output per milione di token)DoveIn breve
Claude Opus 5.5
Anthropic
22 set4 / 20 $API, app ClaudePunto di riferimento per programmazione e lavoro d'ufficio con agenti. Terminal-Bench 4.0: 66,4% (dato del produttore). Fonte
Claude Fable 5.1
Anthropic
1 set10 / 50 $API, app ClaudeL'ammiraglia per compiti lunghi e complessi; la variante Mythos 5.1 è riservata a programmi verificati. Fonte
GPT-6 Astra
OpenAI
3 set10 / 50 $API, ChatGPT a pagamentoNuova ammiraglia. OpenAI dichiara lo stato dell'arte in codice, matematica e uso del computer; funzioni cyber avanzate bloccate. Fonte
GPT-6 Sol / Luna
OpenAI
22 set2 / 10 $ · 0,10 / 0,50 $API, ChatGPT; Luna anche gratis (app desktop)Le versioni economiche della generazione 6. Sol: 68,8% su DeepSWE v1.1 secondo OpenAI. Fonte
Gemini 3.8 Flash
Google
2 set0,75 / 3,75 $*API, app GeminiVeloce ed economico, orientato a codice e agenti. *Prezzo introduttivo fino al 31 dicembre, poi raddoppia. Il Pro più recente resta Gemini 3.1 Pro. Fonte
Grok 4.7
xAI
21 set2 / 6 $API, Grok, Cursor, GitHub CopilotContesto da 500 mila token, quattro livelli di ragionamento. Forte sui benchmark legali (Harvey Legal Agent). Fonte
Muse Spark 1.3
Meta
2 set—App MetaMultimodale con contesto oltre il milione di token; Meta dichiara il 20% di chiamate a strumenti in meno a parità di compito. Fonte
MiMo-V2.6-Pro
Xiaomi
22 setPesi aperti (MIT)Download, APIPrimo tra i modelli open sull'Intelligence Index di Artificial Analysis (46 punti). Fonte
GLM-5.3
Z.ai
28 agoPesi aperti (MIT)Download, API753 miliardi di parametri, pesi pubblicati dopo due settimane di verifiche di sicurezza. Fonte
DeepSeek V4.1 Flash
DeepSeek
10 setListino ridottoAPI, app DeepSeekIl più piccolo della nuova architettura, con visione nativa. Sostituisce V4 Flash. Fonte

Come leggere i benchmark

Terminal-Bench
Quanto bene un modello porta a termine compiti reali di programmazione e amministrazione di sistema lavorando da terminale.
OSWorld
Uso del computer: il modello deve completare compiti in un vero sistema operativo, cliccando e digitando come una persona.
ARC-AGI
Rompicapi visivi nuovi, facili per le persone e difficili per le macchine: misura la capacità di generalizzare.
FrontierMath
Problemi di matematica inediti scritti da ricercatori; il livello 4 è quello più difficile.
Humanity's Last Exam
Migliaia di domande di livello specialistico in decine di discipline.
Arena
Classifica basata su voti umani alla cieca: chi vota confronta due risposte senza sapere quale modello le ha scritte.

Vuoi vedere il meglio di tutti i modelli messo insieme? Guarda quanto è vicina l'IA all'intelligenza umana.

Un punteggio alto su un benchmark non garantisce che un modello sia il migliore per il tuo lavoro: per scegliere, guarda la pagina Lo strumento giusto.

Fonti

  1. BenchLM — classifica dei modelli di frontiera
  2. Digital Applied — registro dei rilasci di agosto e settembre 2026
  3. Arena — classifica con voti umani
  4. Artificial Analysis — indici e confronti