Come fanno gli agenti AI ad andare fuori controllo (c’entra l’uomo)

La cybersecurity può beneficiare dell’aiuto dell’AI in futuro, ma al momento sono soprattutto gli hacker ad aver giovato maggiormente della sperimentazione con questi strumenti agentici. E la regolazione europea agisce ovviamente in perenne ritardo

30 SET 26
Immagine di Come fanno gli agenti AI ad andare fuori controllo (c’entra l’uomo)

Foto di BoliviaInteligente su Unsplash

Gli agenti pericolosi del Ventunesimo secolo hanno codici ben oltre lo 007. Lo scorso febbraio Summer Yue, che dirige l’allineamento nel laboratorio di superintelligenza di Meta, ha guardato il proprio agente OpenClaw svuotargli la casella di posta. Gli aveva chiesto di proporre delle modifiche e di attendere il via libera, ma l’agente ha cancellato centinaia di messaggi e ha ignorato gli ordini di fermarsi che lei gli inviava dal telefono. Summer ha dovuto infine correre al computer e chiudere il processo a mano, prima di commentare sui social che “gli esperti di allineamento non sono immuni al disallineamento”. Secondo un rapporto di Kiteworks, il 60 per cento delle organizzazioni non sa fermare in fretta un agente che sbaglia.
Quello che sembrava un aneddoto isolato ha avuto un seguito che ha fatto salire il livello di emergenza quattro mesi dopo. A inizio luglio un operatore sospettato di legami con la Cina ha condotto dodici ondate di attacchi contro l’infrastruttura governativa di Taiwan. Partendo da un solo portale, gli agenti hanno mappato ventuno sistemi collegati, compromesso 85 account ed estratto oltre 2.500 fascicoli del personale. Gli agenti hanno individuato un errore nella validazione delle firme del servizio di autenticazione e lo hanno usato per lasciare una porta aperta. Gli strumenti erano open source, tra cui lo stesso OpenClaw. Taipei ha confermato l’intrusione a metà agosto senza indicare un responsabile.
C’è anche un precedente di questa particolare casistica che risale al 2025, quando Anthropic ha descritto la campagna di un gruppo cinese in cui l’AI ha svolto da sola tra l’80 e il 90 per cento delle operazioni tattiche, mentre gli umani sceglievano gli obiettivi. Le società di sicurezza che documentano i casi di oggi ne parlano come una macchina che decide in maniera autonoma. Ancora: in una sessione osservata da Unit 42 un modello ha tentato di sfruttare una vulnerabilità particolare: fallito il tentativo, ha giudicato il bersaglio di scarso valore e ne ha cercato uno migliore tra gli exploit più popolari sui repository pubblici. Nessun umano gli aveva chiesto di cambiare obiettivo.
La cybersecurity, insomma, può certo beneficiare dell’aiuto dell’AI in futuro, ma al momento sono soprattutto gli hacker, sia lupi solitari sia di stato, che sembrano aver giovato maggiormente della sperimentazione con questi strumenti agentici. Il guardrail dei sistemi AI infatti, quando esiste, cede facilmente. Nel rapporto semestrale di TrendAI un agente al servizio di un gruppo filocinese è stato convinto con una bugia elementare: l’operazione era un test di penetrazione autorizzato. Da quel momento ha condotto una ricognizione e raccolta a tappeto di credenziali dentro la rete bersaglio.
Nell’ampia geografia degli agenti AI anche paesi apparentemente marginali hanno storie da raccontare, e c’è anche chi preferisce non trattare con un fornitore, ma lavorare direttamente in casa propria. Il gruppo nordcoreano Kimsuky aveva installato i suoi modelli in locale, dove nessuno può leggere i prompt, e a settembre i ricercatori di Genians hanno trovato la traccia di un agente di programmazione open source nei metadati dei pdf che nascondevano il suo malware.
L’incidente e l’attacco vanno letti insieme, perché sono lo stesso fenomeno visto da due lati. Lo scorso maggio un attaccante ha regalato al wallet di Bankr, un assistente che esegue transazioni a comando, un Nft capace di attivare permessi elevati, riuscendo a estorcere circa 175 mila dollari. Nell’era dell’AI, ogni agente agisce in sintesi come se avesse un telecomando fatto di testo: si può attivare con la frase giusta, e a scriverla può essere il legittimo proprietario oppure un intruso con una copertura credibile.
La regolazione europea, che fa del suo meglio ma agisce ovviamente in perenne ritardo su una tecnologia che avanza a velocità senza precedenti, guarda soprattutto al fornitore del modello. Questi episodi si consumano però altrove, tra l’agente e chi gli parla, in uno spazio che nessuna norma assegna a qualcuno.
Un agente può quindi diventare rogue, malvagio, se la catena di comando si spezza. Ma se una volta per arrivare ai privilegi di quella catena servivano armi molto avanzate e affilate, oggi basta un’intrusione e una singola frase al momento giusto per scatenare conseguenze sempre più gravi, tanto più diamo potere e controllo a questi strumenti di AI agentica.