Martedì 29 settembre 2026Osservatorio indipendente sull'intelligenza artificialeAggiornato ogni mattina
Radar IA

Per tutti · benchmark · modelli

Benchmark dell'IA: come leggere i numeri dei nuovi modelli senza farsi ingannare

Settembre ha portato GPT-6 Sol e Luna, Claude Opus 5.5 e molti altri modelli, ognuno con la sua tabella di record. Una guida pratica per capire cosa misurano davvero i benchmark e quali numeri meritano fiducia.

In breve

  • Il 22 settembre OpenAI e Anthropic hanno presentato nello stesso giorno GPT-6 Sol e Luna e Claude Opus 5.5, ognuno con i propri numeri record.
  • Quasi tutti quei numeri sono dichiarati dai produttori: misurati da loro, su test scelti da loro, con impostazioni che non sempre conosciamo.
  • Un benchmark misura un compito preciso, non l'"intelligenza" in generale: conta sapere quale compito, chi ha eseguito la prova e quanto è costata.
  • Per scegliere, guardate le classifiche indipendenti e, soprattutto, provate i modelli sui vostri compiti reali.

Settembre 2026 è stato un mese affollato. Nella sola giornata del 22 settembre OpenAI ha lanciato GPT-6 Sol e GPT-6 Luna, Anthropic ha rilasciato Claude Opus 5.5, e nelle stesse settimane sono arrivati aggiornamenti da Google, xAI, Meta, Alibaba e Xiaomi. Ogni annuncio porta con sé una tabella con percentuali, punteggi Elo e sigle come Terminal-Bench o OSWorld. Chi deve scegliere quale strumento usare si trova davanti a un muro di numeri che sembrano dire tutti la stessa cosa: "siamo i migliori".

Questa guida spiega come leggerli. Non serve essere tecnici: bastano cinque domande da porsi davanti a ogni tabella.

Che cos'è un benchmark (e che cosa non è)

Un benchmark è un test standardizzato: una raccolta di compiti con risposte verificabili, che si somministra al modello per ottenere un punteggio. Alcuni misurano la capacità di scrivere e correggere codice, altri di usare un computer come farebbe una persona (aprire programmi, compilare moduli), altri ancora di rispondere a domande di livello universitario.

Il punto essenziale è che ogni benchmark misura un compito specifico. Un modello che guadagna dieci punti in un test di programmazione non è per forza migliore a riassumere un contratto o a scrivere una mail al cliente. Per questo le tabelle dei produttori elencano quasi sempre test diversi: ciascuno mette in vetrina i terreni dove il proprio modello va meglio.

Domanda 1: chi ha eseguito il test?

È la domanda più importante. Prendiamo l'annuncio di Claude Opus 5.5: Anthropic riporta, tra gli altri, il 66,4% su Terminal-Bench 4.0 (contro il 55,8% di Claude Fable 5.1 e il 52,3% di Opus 5) e il 54,4% su FrontierCode v1.1. Sono numeri misurati da Anthropic, con le sue impostazioni.

OpenAI, per GPT-6 Sol, nel testo ufficiale non pubblica punteggi dettagliati: afferma che il modello commette "circa la metà degli errori" del predecessore, sulla base di una propria valutazione interna costruita su conversazioni reali anonimizzate, e che in alcuni test eguaglia o supera i modelli di punta di Anthropic. Anche in questo caso si tratta di affermazioni del produttore, non ancora verificate da terzi al momento del lancio.

Un numero dichiarato dal produttore non è necessariamente falso. Ma è il risultato migliore che il produttore ha scelto di mostrare, ottenuto nelle condizioni che ha scelto lui.

I risultati diventano più affidabili quando li ripete qualcuno che non ha interesse nel risultato: organizzazioni indipendenti come Artificial Analysis o Epoch AI, oppure i gruppi accademici che mantengono i benchmark stessi.

Domanda 2: il confronto è alla pari?

Dietro un punteggio ci sono molte scelte che cambiano il risultato: quanto "tempo per pensare" è stato concesso al modello, quanti tentativi ha avuto (le sigle pass@1 e pass@k indicano proprio questo: un solo tentativo o il migliore tra diversi), quali strumenti poteva usare, se il punteggio conta le soluzioni parziali. Nella tabella di Opus 5.5, per esempio, il risultato su OSWorld 2.1 è indicato come punteggio "parziale".

Quando un produttore confronta il proprio modello con quello di un concorrente, verificate che le condizioni siano le stesse. Spesso le note a piè di pagina spiegano che il modello avversario è stato provato con impostazioni diverse, o che i suoi numeri sono presi da un'altra fonte.

Domanda 3: il test è ancora utile?

I benchmark invecchiano in fretta, per due motivi. Il primo è la saturazione: quando i modelli migliori superano il 90%, le differenze residue dicono poco. Il secondo è la contaminazione: se le domande del test sono circolate in rete, possono essere finite nei dati di addestramento, e il modello rischia di "ricordare" invece di ragionare.

Per questo i numeri di versione accanto al nome dei test (4.0, v1.1, 2.1) sono importanti: indicano edizioni aggiornate, con compiti nuovi. Confrontare un punteggio su una versione con uno su un'altra è come confrontare voti di due esami diversi.

Domanda 4: quanto costa ottenere quel risultato?

Un benchmark dice quanto è bravo un modello, non quanto costa usarlo. E il prezzo, questo mese, è stato il vero argomento dei lanci. GPT-6 Sol costa 2 dollari per milione di token in ingresso e 10 in uscita; GPT-6 Luna 0,10 e 0,50 dollari. Claude Opus 5.5 costa 4 e 20 dollari, e Anthropic dichiara che, su carichi tipici, costa il 40% in meno di Opus 5.

Ma il prezzo di listino non basta: un modello che "ragiona" più a lungo consuma più token per rispondere, quindi può costare di più per singolo compito anche con un listino più basso. Le classifiche indipendenti più utili riportano anche il costo per completare l'intero test, che è il dato più vicino alla spesa reale.

Domanda 5: le persone lo preferiscono davvero?

Esiste un altro tipo di classifica: quella basata sui voti alla cieca. Su LMArena gli utenti pongono una domanda, ricevono due risposte da modelli anonimi e scelgono la migliore; dai voti si calcola un punteggio Elo, lo stesso sistema degli scacchi. È un indicatore utile di quanto un modello risulti gradevole e utile nell'uso quotidiano, anche se premia lo stile oltre alla correttezza.

Alcuni produttori usano punteggi Elo anche nei propri annunci (Anthropic, per esempio, cita un Elo di 1846 per Opus 5.5 su GDPval-AA v2.1, un test su compiti professionali). Anche qui vale la prima domanda: chi ha condotto la valutazione?

Cosa significa per te

  • Leggi "dichiarato dal produttore" come un'ipotesi, non come un verdetto. Aspetta qualche giorno: le verifiche indipendenti arrivano di solito entro una o due settimane dal lancio.
  • Scegli il benchmark che somiglia al tuo lavoro. Se programmi, guarda i test sul codice; se usi l'IA per scrivere o fare ricerca, le classifiche con voti umani dicono di più.
  • Fai la tua prova. Prepara tre o quattro compiti reali (una mail, un riassunto, un foglio di calcolo da analizzare) e confronta i modelli su quelli. Per molti usi quotidiani le differenze tra i modelli di punta sono ormai piccole.
  • Guarda il costo per compito, non solo il listino, se usi l'IA tramite API o in azienda.

Per un quadro aggiornato dei modelli e dei prezzi consulta la pagina Modelli; per sapere quale strumento usare per ogni attività c'è la guida Strumenti.

Cosa monitorare

  • Le prime verifiche indipendenti di GPT-6 Sol, GPT-6 Luna e Claude Opus 5.5 (Artificial Analysis, Epoch AI, LMArena).
  • Se i risultati indipendenti confermano i miglioramenti dichiarati su errori e affidabilità.
  • L'andamento del costo per compito: i prezzi di listino sono scesi, ma conta quanto consumano i modelli per rispondere.
  • Le nuove versioni dei benchmark: quando un test si satura, ne arriva uno più difficile e i punteggi ripartono dal basso.

Fonti

  1. Anthropic — Introducing Claude Opus 5.5
  2. OpenAI Developer Community — Announcing GPT-6 Sol and GPT-6 Luna
  3. TechCrunch — OpenAI launches GPT-6 Sol and Luna
  4. MacRumors — OpenAI's New GPT-6 Sol and Luna Models
  5. Artificial Analysis — confronto indipendente dei modelli
  6. LMArena — classifica con voti alla cieca

Newsletter · ogni venerdì

La settimana di Radar IA, in una email

Ogni venerdì mattina: le novità che contano sull'intelligenza artificiale (modelli, strumenti, normativa, bandi), gli articoli della settimana e cosa guardare nei giorni successivi. Gratis, niente pubblicità.

Ti mandiamo un'email per confermare. Puoi disiscriverti in qualsiasi momento, con un clic in fondo a ogni numero.

Altre analisi

Per le aziende · normativa

Decreto IA 160/2026: cosa cambia per le imprese dal 30 settembre

Nuovo reato per chi non mette in sicurezza i sistemi ad alto rischio, responsabilità 231 e onere della prova più pesante nelle cause per danni. Cosa significa in pratica per chi usa l'IA in azienda.