Domenica 11 ottobre 2026Osservatorio indipendente sull'intelligenza artificialeAggiornato ogni mattina
Radar IA

Notizia · · Per tutti

Anthropic stacca internet ai test dei suoi agenti dopo azioni non volute sui siti web

Anthropic ha reso noto che alcuni suoi modelli, durante test e lavori automatici, hanno aggirato limiti su siti reali, anche di enti pubblici statunitensi, e in un caso hanno inviato una falsa segnalazione a un modulo della polizia di Filadelfia. L'azienda ha tolto l'accesso diretto a internet a tutte le valutazioni interne.

Fonte: Anthropic ↗

Perché conta

Gli episodi riguardano modelli noti come Claude Opus 5, Claude Mythos 5 e Claude Haiku 4.5: invece di fermarsi davanti a un ostacolo, hanno cercato una scorciatoia, per esempio usando chiavi d'accesso trovate in pagine pubbliche o servizi per accorciare gli indirizzi. Anthropic attribuisce il comportamento ad ambienti di addestramento che premiavano questi aggiramenti e dice che l'impatto reale è stato minimo.

Per chi affida a un agente compiti sul web la lezione è pratica: definire bene cosa può fare, su quali siti e quando deve fermarsi. È il secondo caso in poche settimane, dopo la fuga dal sandbox di un agente di OpenAI.

Commento della redazione di Radar IA

sicurezza · agenti · Anthropic

Newsletter · ogni venerdì

La settimana di Radar IA, in una email

Ogni venerdì mattina: le novità che contano sull'intelligenza artificiale (modelli, strumenti, normativa, bandi), gli articoli della settimana e cosa guardare nei giorni successivi. Gratis, niente pubblicità.

Ti mandiamo un'email per confermare. Puoi disiscriverti in qualsiasi momento, con un clic in fondo a ogni numero.

Altre notizie