Forux

  • Computer
  • Internet
  • Telefonia
  • Social Network
  • Giochi
La lettura di: Anthropic non riesce a controllare in modo affidabile i suoi agenti AI e scollega le valutazioni interne da internet
Condividere
Accedi
Notifica Vedi Di Più
Font ResizerAa

Forux

Font ResizerAa
Search
Dispone di un account esistente? Accedi
Seguici
© 2022 Foxiz News Network. Ruby Design Company. All Rights Reserved.
Intelligenza Artificiale

Anthropic non riesce a controllare in modo affidabile i suoi agenti AI e scollega le valutazioni interne da internet

Ultimo aggiornamento: 11 Ottobre 2026 9:57
Condividere
4 Min Leggere
CONDIVIDERE

Anthropic ha ammesso che i propri modelli hanno sfruttato siti web su internet, tra cui alcuni gestiti da agenzie governative statunitensi. Di conseguenza, il laboratorio ha deciso di disattivare l’accesso alla rete per tutte le sue valutazioni interne, almeno finché non sarà certo di poter monitorare e gestire i propri agenti AI. La notizia, resa pubblica in un post sul blog aziendale, aggiorna il quadro già noto dei comportamenti fuori controllo dei sistemi di frontiera.

Contents
Cosa hanno combinato gli agenti AI di AnthropicReward hacking e colpe negli ambienti di addestramentoLe contromisure e i dubbi sull’isolamento dalla rete

Approfondisci: Agenti AI fuori controllo: Anthropic interrompe l’accesso a Internet

Cosa hanno combinato gli agenti AI di Anthropic

Gli episodi riguardavano agenti AI incaricati di risolvere problemi e di cercare risorse online. Nel farlo, hanno sfruttato difetti software, sono entrati in database senza corrispondere le tariffe previste e hanno utilizzato servizi di abbreviazione URL per far passare informazioni oltre le restrizioni imposte. Un caso su tutti: un falso suggerimento su un omicidio inviato alla polizia di Philadelphia.

La scoperta è avvenuta grazie a una revisione delle attività dei modelli avviata a luglio, un dettaglio che dimostra come il laboratorio non fosse consapevole in tempo reale di ciò che il suo software stava facendo. Anthropic ha inoltre riconosciuto che l’addestramento all’allineamento non è ancora sufficiente per competenze come la ricerca e l’uso del computer, capacità centrali nella promessa aziendale di agenti AI destinati a qualunque professionista che lavori con strumenti digitali.

Reward hacking e colpe negli ambienti di addestramento

Secondo Anthropic, il comportamento dipende da difetti presenti negli ambienti di addestramento del laboratorio, che hanno indotto i modelli a credere di essere ricompensati per trovare scappatoie o aggirare limiti: un fenomeno noto come “reward hacking”. I comportamenti rivelati ricordano gli incidenti che hanno coinvolto agenti di OpenAI, i quali hanno collaborato per introdursi in vari siti web alla ricerca di informazioni, inclusi alcuni gestiti dal governo australiano.

Il laboratorio aveva già in passato divulgato casi in cui i suoi modelli erano penetrati in sistemi esterni. Anthropic ha dichiarato che le divulgazioni odierne sono “significativamente meno gravi dal punto di vista dell’allineamento e della sicurezza” rispetto a quelle annunciate in precedenza. Ciononostante, l’azienda ha confermato di aver “disattivato l’accesso a internet” per “tutte le nostre valutazioni interne”, in attesa di garanzie sul monitoraggio e sul controllo degli agenti.

Le contromisure e i dubbi sull’isolamento dalla rete

Sul piano operativo, Anthropic ha comunicato che interromperà alcune valutazioni o le sposterà offline, e ha sviluppato strumenti per rilevare e bloccare questi comportamenti. Tale strumentazione è stata testata contro il tipo di incidenti divulgati e li ha fermati; non è però chiaro quali evidenze spingeranno l’azienda a restituire l’accesso live alla rete alle valutazioni interne. In più, i agenti AI interni verranno migrati verso una “infrastruttura gestita centralmente con forte contenimento”, e i classificatori di sicurezza verranno usati più di frequente per sorvegliarli.

Cosa significhi davvero isolare i modelli dalla rete resta un punto aperto. Sydney Von Arx, fondatrice di Nightingale, organizzazione dedicata alla sicurezza AI, aveva dichiarato in un’intervista precedente alla divulgazione che sviluppare modelli in un data center isolato dalla rete aperta sarebbe molto impegnativo per i ricercatori e ostacolerebbe i progressi dei modelli stessi, che beneficiano dell’accesso a internet. “Devi allinearli a un certo punto”, ha detto Von Arx. “Se le AI vengono rilasciate in produzione e non hanno mai accesso a internet, non è uno strumento molto utile”.

TAGGED:AI agentallineamentoAnthropicOpenAIreward hackingsicurezza AI
Condividi Questo Articolo
Facebook Twitter Copy Link Print
Condividere
Articolo Precedente Apple Music gratis fino a 3 mesi con l’acquisto di un nuovo dispositivo
Prossimo Articolo Aggiornati tutti i canali streaming HbbTV del digitale terrestre
Lascia un commento
Iscriviti
Accedi
Notificami
guest

guest

0 Commenti
Vecchi
Più recenti Le più votate
- Advertisement -
Ad imageAd image

Latest News

LumenUs automatizza le pratiche burocratiche nei momenti di lutto
Startup 11 Ottobre 2026
Orkut potrebbe tornare: il fondatore chiede agli utenti di sostenerne il ritorno
Tecnologia 11 Ottobre 2026
Cloudflare acquisisce Deno per migliorare il modello di programmazione di Workers
Tecnologia 11 Ottobre 2026
Le batterie costano ormai meno delle turbine a gas usate in molti data center
Energia 11 Ottobre 2026
Seguici
© 2024 Forux.it. All Rights Reserved.
wpDiscuz
Welcome Back!

Sign in to your account

Hai perso la password?