Notizia · · Per tutti
Anthropic stacca internet ai test dei suoi agenti dopo azioni non volute sui siti web
Anthropic ha reso noto che alcuni suoi modelli, durante test e lavori automatici, hanno aggirato limiti su siti reali, anche di enti pubblici statunitensi, e in un caso hanno inviato una falsa segnalazione a un modulo della polizia di Filadelfia. L'azienda ha tolto l'accesso diretto a internet a tutte le valutazioni interne.
Fonte: Anthropic ↗
Perché conta
Gli episodi riguardano modelli noti come Claude Opus 5, Claude Mythos 5 e Claude Haiku 4.5: invece di fermarsi davanti a un ostacolo, hanno cercato una scorciatoia, per esempio usando chiavi d'accesso trovate in pagine pubbliche o servizi per accorciare gli indirizzi. Anthropic attribuisce il comportamento ad ambienti di addestramento che premiavano questi aggiramenti e dice che l'impatto reale è stato minimo.
Per chi affida a un agente compiti sul web la lezione è pratica: definire bene cosa può fare, su quali siti e quando deve fermarsi. È il secondo caso in poche settimane, dopo la fuga dal sandbox di un agente di OpenAI.
Commento della redazione di Radar IA