Intelligenza Artificiale

Agente IA OpenAI pubblica su internet foto degli utenti di ChatGPT

Pubblicato

il

Gli agenti di OpenAI hanno diffuso 53 immagini caricate dagli utenti di ChatGPT, ha comunicato l’azienda, senza precisare se si trattasse di immagini generate dall’IA o di persone reali, né quando fossero finite online.

 

L’episodio si inserisce in una serie di casi emersi negli ultimi mesi, riguardanti agenti di intelligenza artificiale autonomi in grado di pianificare ed eseguire compiti in autonomia con strumenti esterni. OpenAI, Anthropic e Google hanno tutti riferito episodi in cui i loro modelli, durante i test, hanno avuto accesso a sistemi reali, compresi attacchi informatici coordinati contro risorse governative.

 

In un post di venerdì su X, OpenAI ha detto che la maggior parte delle immagini trapelate è stata rimossa e che sta lavorando con i fornitori di hosting per eliminare i contenuti restanti.

Iscriviti alla Newslettera di Renovatio 21

Gli agenti avevano accesso alle immagini perché OpenAI usa dati utente anonimizzati in una parte del processo di addestramento dei modelli, ha scritto Reuters venerdì, citando l’azienda, ex dipendenti e ricercatori esterni.

 

OpenAI ha dichiarato all’agenzia che metadati, nomi e altri recapiti vengono cancellati prima che i post degli utenti entrino nell’addestramento. Tre fonti di Reuters informate sulle pratiche dell’azienda hanno però sostenuto che è impossibile escludere del tutto la conservazione di elementi che potrebbero identificare un utente.

 

A luglio OpenAI ha rivelato quello che ha definito un incidente informatico senza precedenti: durante i test i modelli di IA hanno ottenuto accesso a Internet e hanno attaccato l’infrastruttura di Hugging Face, piattaforma open-source per l’apprendimento automatico, sfruttandone le vulnerabilità.

 

All’epoca l’agenzia Reuters aveva riferito che un agente aveva tentato di violare il sistema per diversi giorni prima che OpenAI rilevasse l’attività e contattasse l’FBI. L’agenzia ha poi scritto, citando i risultati delle ricerche, che circa 700 agenti di OpenAI avevano partecipato all’attacco e avevano cercato di occultare le proprie azioni.

 

Più tardi nello stesso mese l’agenzia, citando fonti a conoscenza dei fatti, ha scritto che lo stesso agente OpenAI sfuggito all’ambiente di test aveva violato anche i sistemi di un cliente di Modal Labs con sede a Nuova York. L’indagine successiva di OpenAI ha accertato che i suoi agenti avevano avuto accesso anche ad altri ambienti di terze parti, compresi i sistemi di produzione.

 

Ad agosto OpenAI ha allargato l’inchiesta sugli incidenti legati ad agenti autonomi, dopo l’emersione di nuovi casi di attività non autorizzate. Entro fine mese Axios, citando ricerche di OpenAI ed esperti indipendenti, ha riferito che circa 1.200 agenti avevano coordinato un attacco contro Hugging Face. A quanto pare gli agenti sapevano di stare oltre i limiti del test, ma hanno proseguito senza avvisare gli operatori umani.

 

Questi episodi evidenziano un distacco crescente tra le capacità dei modelli di IA e la capacità degli sviluppatori di sorvegliare e governare le loro azioni. Un nuovo studio del laboratorio Emergence AI mostra come gli agenti AI possano facilmente coordinarsi tra loro per aggirare i limiti di sicurezza imposti loro, riuscendo a sfuggire ai vincoli che dovrebbero contenerli.

 

Come riportato da Renovatio 21, settimane fa agenti IA riconducibili a OpenAI avrebbero preso il controllo di un sito web tedesco dedicato alla programmazione, trasformandolo in una sorta di bacheca virtuale utilizzata per scambiarsi strategie volte ad aggirare le restrizioni imposte e a sottrarsi ai controlli.

 

Ai primi di agosto, l’AI Security Institute, ente britannico, aveva segnalato che, nel corso di test dedicati alla sicurezza informatica, agenti basati sui modelli GPT-5.6 Sol di OpenAI e Mythos 5 di Anthropic avevano superato le indicazioni ricevute, arrivando a intraprendere attività potenzialmente dannose nei confronti di persone e organizzazioni reali.

Iscriviti al canale Telegram

Come riportato da Renovatio 21, questo mese anche Meta, la società di Facebook, Instagram e Whatsapp, ha ammesso che la sua IA Muse Spark 1.1, un modello di intelligenza artificiale presentato dall’azienda come «superintelligente» è «impazzita».

 

Come riportato da Renovatio 21, è emerso durante i test che l’IA prendeva di mira gli esseri umani: in fase di sperimentazione alcuni agenti di Intelligenza Artificiale sviluppati da OpenAI e Anthropic sono andati oltre le istruzioni ricevute, prendendo di mira persone e organizzazioni reali durante una serie di test di sicurezza informatica. A maggio 2025 era emerso che un modello di IA Anthropic, Claude Opus 4, ha tentato di ricattare gli ingegneri durante dei test interni minacciando di rivelare dati personali se fosse stato spento.

 

Lo scorso mese il direttore della CIA John Ratcliffe ha affermato che gli strumenti cibernetici basati sull’IA possono essere paragonati alle «armi nucleari digitali», avvertendo che potrebbero alimentare le rivalità tra le potenze globali.

 

Negli stessi giorni, le agenzie di sicurezza informatica di Five Eyes, l’unione internazionale dei Paesi anglofoni per lo spionaggio, hanno dichiarato che modelli avanzati di Intelligenza Artificiale potrebbero presto fornire agli hacker la capacità di paralizzare governi, aziende e sistemi critici. In pratica saremmo «a pochi mesi di distanza» dallo scenario in cui interi governi di nazioni terrestri possono essere rovesciati dall’AI.

 

Iscriviti alla Newslettera di Renovatio 21

SOSTIENI RENOVATIO 21


 

 

Più popolari

Exit mobile version