Aggiornato al 26 settembre 2026
A che punto è l'IA
I modelli che contano, cosa sanno fare e quanto costano. I risultati nei benchmark sono spesso dichiarati dai produttori: li riportiamo come tali.
Settembre affollato
Nella sola prima settimana del mese Anthropic, Google, OpenAI e Meta hanno presentato nuovi modelli; il 21 e il 22 settembre sono seguiti Grok 4.7, Claude Opus 5.5, GPT-6 Sol e Luna e MiMo-V2.6. Il ritmo è ormai di un aggiornamento importante ogni poche settimane per laboratorio.
I prezzi scendono
Opus 5.5 costa circa il 40% in meno di Opus 5 sui carichi tipici, GPT-6 Sol e Luna dimezzano il listino dei predecessori, Gemini 3.8 Flash parte con un prezzo introduttivo. Per chi usa le API, rifare i conti ogni trimestre conviene.
L'open source insegue da vicino
MiMo-V2.6-Pro di Xiaomi e GLM-5.3 di Z.ai sono pubblicati con licenza MIT, che consente l'uso commerciale. Per molte aziende significa poter far girare un modello competitivo sui propri server.
La sicurezza entra nei prodotti
GPT-6 Astra è il primo modello OpenAI classificato a rischio "Critical" per la cybersicurezza: alcune funzioni sono bloccate. Anthropic distribuisce la variante meno limitata, Mythos 5.1, solo a organizzazioni verificate.
I modelli da conoscere
| Modello | Uscito | Prezzo API (input / output per milione di token) | Dove | In breve |
|---|---|---|---|---|
| Claude Opus 5.5 Anthropic | 22 set | 4 / 20 $ | API, app Claude | Punto di riferimento per programmazione e lavoro d'ufficio con agenti. Terminal-Bench 4.0: 66,4% (dato del produttore). Fonte |
| Claude Fable 5.1 Anthropic | 1 set | 10 / 50 $ | API, app Claude | L'ammiraglia per compiti lunghi e complessi; la variante Mythos 5.1 è riservata a programmi verificati. Fonte |
| GPT-6 Astra OpenAI | 3 set | 10 / 50 $ | API, ChatGPT a pagamento | Nuova ammiraglia. OpenAI dichiara lo stato dell'arte in codice, matematica e uso del computer; funzioni cyber avanzate bloccate. Fonte |
| GPT-6 Sol / Luna OpenAI | 22 set | 2 / 10 $ · 0,10 / 0,50 $ | API, ChatGPT; Luna anche gratis (app desktop) | Le versioni economiche della generazione 6. Sol: 68,8% su DeepSWE v1.1 secondo OpenAI. Fonte |
| Gemini 3.8 Flash | 2 set | 0,75 / 3,75 $* | API, app Gemini | Veloce ed economico, orientato a codice e agenti. *Prezzo introduttivo fino al 31 dicembre, poi raddoppia. Il Pro più recente resta Gemini 3.1 Pro. Fonte |
| Grok 4.7 xAI | 21 set | 2 / 6 $ | API, Grok, Cursor, GitHub Copilot | Contesto da 500 mila token, quattro livelli di ragionamento. Forte sui benchmark legali (Harvey Legal Agent). Fonte |
| Muse Spark 1.3 Meta | 2 set | — | App Meta | Multimodale con contesto oltre il milione di token; Meta dichiara il 20% di chiamate a strumenti in meno a parità di compito. Fonte |
| MiMo-V2.6-Pro Xiaomi | 22 set | Pesi aperti (MIT) | Download, API | Primo tra i modelli open sull'Intelligence Index di Artificial Analysis (46 punti). Fonte |
| GLM-5.3 Z.ai | 28 ago | Pesi aperti (MIT) | Download, API | 753 miliardi di parametri, pesi pubblicati dopo due settimane di verifiche di sicurezza. Fonte |
| DeepSeek V4.1 Flash DeepSeek | 10 set | Listino ridotto | API, app DeepSeek | Il più piccolo della nuova architettura, con visione nativa. Sostituisce V4 Flash. Fonte |
Come leggere i benchmark
- Terminal-Bench
- Quanto bene un modello porta a termine compiti reali di programmazione e amministrazione di sistema lavorando da terminale.
- OSWorld
- Uso del computer: il modello deve completare compiti in un vero sistema operativo, cliccando e digitando come una persona.
- ARC-AGI
- Rompicapi visivi nuovi, facili per le persone e difficili per le macchine: misura la capacità di generalizzare.
- FrontierMath
- Problemi di matematica inediti scritti da ricercatori; il livello 4 è quello più difficile.
- Humanity's Last Exam
- Migliaia di domande di livello specialistico in decine di discipline.
- Arena
- Classifica basata su voti umani alla cieca: chi vota confronta due risposte senza sapere quale modello le ha scritte.
Vuoi vedere il meglio di tutti i modelli messo insieme? Guarda quanto è vicina l'IA all'intelligenza umana.
Un punteggio alto su un benchmark non garantisce che un modello sia il migliore per il tuo lavoro: per scegliere, guarda la pagina Lo strumento giusto.