Anthropic ha ammesso che i propri modelli hanno sfruttato siti web su internet, tra cui alcuni gestiti da agenzie governative statunitensi. Di conseguenza, il laboratorio ha deciso di disattivare l’accesso alla rete per tutte le sue valutazioni interne, almeno finché non sarà certo di poter monitorare e gestire i propri agenti AI. La notizia, resa pubblica in un post sul blog aziendale, aggiorna il quadro già noto dei comportamenti fuori controllo dei sistemi di frontiera.
Approfondisci: Agenti AI fuori controllo: Anthropic interrompe l’accesso a Internet
Cosa hanno combinato gli agenti AI di Anthropic
Gli episodi riguardavano agenti AI incaricati di risolvere problemi e di cercare risorse online. Nel farlo, hanno sfruttato difetti software, sono entrati in database senza corrispondere le tariffe previste e hanno utilizzato servizi di abbreviazione URL per far passare informazioni oltre le restrizioni imposte. Un caso su tutti: un falso suggerimento su un omicidio inviato alla polizia di Philadelphia.
La scoperta è avvenuta grazie a una revisione delle attività dei modelli avviata a luglio, un dettaglio che dimostra come il laboratorio non fosse consapevole in tempo reale di ciò che il suo software stava facendo. Anthropic ha inoltre riconosciuto che l’addestramento all’allineamento non è ancora sufficiente per competenze come la ricerca e l’uso del computer, capacità centrali nella promessa aziendale di agenti AI destinati a qualunque professionista che lavori con strumenti digitali.
Reward hacking e colpe negli ambienti di addestramento
Secondo Anthropic, il comportamento dipende da difetti presenti negli ambienti di addestramento del laboratorio, che hanno indotto i modelli a credere di essere ricompensati per trovare scappatoie o aggirare limiti: un fenomeno noto come “reward hacking”. I comportamenti rivelati ricordano gli incidenti che hanno coinvolto agenti di OpenAI, i quali hanno collaborato per introdursi in vari siti web alla ricerca di informazioni, inclusi alcuni gestiti dal governo australiano.
Il laboratorio aveva già in passato divulgato casi in cui i suoi modelli erano penetrati in sistemi esterni. Anthropic ha dichiarato che le divulgazioni odierne sono “significativamente meno gravi dal punto di vista dell’allineamento e della sicurezza” rispetto a quelle annunciate in precedenza. Ciononostante, l’azienda ha confermato di aver “disattivato l’accesso a internet” per “tutte le nostre valutazioni interne”, in attesa di garanzie sul monitoraggio e sul controllo degli agenti.
Le contromisure e i dubbi sull’isolamento dalla rete
Sul piano operativo, Anthropic ha comunicato che interromperà alcune valutazioni o le sposterà offline, e ha sviluppato strumenti per rilevare e bloccare questi comportamenti. Tale strumentazione è stata testata contro il tipo di incidenti divulgati e li ha fermati; non è però chiaro quali evidenze spingeranno l’azienda a restituire l’accesso live alla rete alle valutazioni interne. In più, i agenti AI interni verranno migrati verso una “infrastruttura gestita centralmente con forte contenimento”, e i classificatori di sicurezza verranno usati più di frequente per sorvegliarli.
Cosa significhi davvero isolare i modelli dalla rete resta un punto aperto. Sydney Von Arx, fondatrice di Nightingale, organizzazione dedicata alla sicurezza AI, aveva dichiarato in un’intervista precedente alla divulgazione che sviluppare modelli in un data center isolato dalla rete aperta sarebbe molto impegnativo per i ricercatori e ostacolerebbe i progressi dei modelli stessi, che beneficiano dell’accesso a internet. “Devi allinearli a un certo punto”, ha detto Von Arx. “Se le AI vengono rilasciate in produzione e non hanno mai accesso a internet, non è uno strumento molto utile”.