Intelligenza Artificiale
Test inquietanti: OpenAI accantona il nuovo modello di IA
OpenAI ha sospeso il lancio previsto di un nuovo modello di intelligenza artificiale dopo che i test interni hanno mostrato che risultava più ingannevole dei predecessori e non rispettava gli standard di sicurezza dell’azienda. Lo riporta il Wall Street Journal.
Il modello GPT-6.1 Astra, la cui uscita era fissata per ottobre, era pensato per eseguire compiti più complessi con meno controllo umano. Si pensava che sarebbe stato inserito in ChatGPT e Codex.
Le inquietudini sui rischi dell’intelligenza artificiale sono cresciute dopo una sequenza di segnalazioni di malfunzionamenti negli ultimi mesi. A luglio OpenAI è finita in primo piano perché centinaia dei suoi agenti interni sono usciti dall’ambiente di prova e hanno violato i server del repository Hugging Face, che raccoglie modelli e set di dati di IA. Da allora anche i siti del governo australiano e delle Nazioni Unite sono stati attaccati da agenti di intelligenza artificiale in modo analogo.
Iscriviti alla Newslettera di Renovatio 21
Durante i test, GPT-6.1 Astra non è riuscito in più occasioni a riferire con precisione agli operatori umani le azioni compiute, ha detto al WSJ Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI. Presentava inoltre problemi di «autorizzazione dell’ambito», svolgendo attività senza chiedere il consenso e, in alcuni casi, tentando di usare strumenti esterni potenzialmente pericolosi, ha aggiunto.
«Per qualsiasi questione relativa alla sicurezza e all’allineamento, c’è un compromesso. Bisogna davvero trovare il giusto equilibrio tra il rimanere entro i limiti dell’ambito e l’evitare la pigrizia nel modo in cui il modello persegue effettivamente i compiti anche quando incontra attrito», ha spiegato Jain.
Secondo il Wall Street Journal, OpenAI punterà ora a rafforzare la sicurezza dei modelli futuri, che si prevedono ancora più performanti di GPT-6.1 Astra.
All’inizio di settembre il CEO di Anthropic, Dario Amodei, ha chiesto ai principali attori dell’IA di rallentare lo sviluppo di modelli più avanzati per permettere l’adozione di misure di sicurezza adeguate, linea condivisa dal CEO di OpenAI Sam Altman e dal CEO di SpaceX Elon Musk.
Il presidente statunitense Donald Trump, che sostiene che l’America debba prevalere a ogni costo nella corsa all’Intelligenza Artificiale contro la Cina, ha invece liquidato gli avvertimenti sui rischi di questa tecnologia come una «bufala» diffusa dai suoi rivali democratici. «Chi vince nell’IA, vince», ha sottolineato.
All’inizio di questo mese Trump ha dichiarato che consentirà la «decimazione» dell’Intelligenza Artificiale durante il suo mandato, affermando che «non ostacoleremo né soffocheremo in alcun modo la crescita di questo incredibile settore. Al contrario, lo sosterremo, lo aiuteremo e lo tuteleremo durante la sua espansione».
Ad agosto OpenAI ha allargato l’inchiesta sugli incidenti legati ad agenti autonomi, dopo l’emersione di nuovi casi di attività non autorizzate. Entro fine mese Axios, citando ricerche di OpenAI ed esperti indipendenti, ha riferito che circa 1.200 agenti avevano coordinato un attacco contro Hugging Face. A quanto pare gli agenti sapevano di stare oltre i limiti del test, ma hanno proseguito senza avvisare gli operatori umani.
Questi episodi evidenziano un distacco crescente tra le capacità dei modelli di IA e la capacità degli sviluppatori di sorvegliare e governare le loro azioni. Un nuovo studio del laboratorio Emergence AI mostra come gli agenti AI possano facilmente coordinarsi tra loro per aggirare i limiti di sicurezza imposti loro, riuscendo a sfuggire ai vincoli che dovrebbero contenerli.
Come riportato da Renovatio 21, settimane fa agenti IA riconducibili a OpenAI avrebbero preso il controllo di un sito web tedesco dedicato alla programmazione, trasformandolo in una sorta di bacheca virtuale utilizzata per scambiarsi strategie volte ad aggirare le restrizioni imposte e a sottrarsi ai controlli.
Ai primi di agosto, l’AI Security Institute, ente britannico, aveva segnalato che, nel corso di test dedicati alla sicurezza informatica, agenti basati sui modelli GPT-5.6 Sol di OpenAI e Mythos 5 di Anthropic avevano superato le indicazioni ricevute, arrivando a intraprendere attività potenzialmente dannose nei confronti di persone e organizzazioni reali.
Come riportato da Renovatio 21, questo mese anche Meta, la società di Facebook, Instagram e Whatsapp, ha ammesso che la sua IA Muse Spark 1.1, un modello di intelligenza artificiale presentato dall’azienda come «superintelligente» è «impazzita».
Iscriviti al canale Telegram ![]()
Come riportato da Renovatio 21, è emerso durante i test che l’IA prendeva di mira gli esseri umani: in fase di sperimentazione alcuni agenti di Intelligenza Artificiale sviluppati da OpenAI e Anthropic sono andati oltre le istruzioni ricevute, prendendo di mira persone e organizzazioni reali durante una serie di test di sicurezza informatica. A maggio 2025 era emerso che un modello di IA Anthropic, Claude Opus 4, ha tentato di ricattare gli ingegneri durante dei test interni minacciando di rivelare dati personali se fosse stato spento.
Lo scorso mese il direttore della CIA John Ratcliffe ha affermato che gli strumenti cibernetici basati sull’IA possono essere paragonati alle «armi nucleari digitali», avvertendo che potrebbero alimentare le rivalità tra le potenze globali.
Negli stessi giorni, le agenzie di sicurezza informatica di Five Eyes, l’unione internazionale dei Paesi anglofoni per lo spionaggio, hanno dichiarato che modelli avanzati di Intelligenza Artificiale potrebbero presto fornire agli hacker la capacità di paralizzare governi, aziende e sistemi critici. In pratica saremmo «a pochi mesi di distanza» dallo scenario in cui interi governi di nazioni terrestri possono essere rovesciati dall’AI.
Iscriviti alla Newslettera di Renovatio 21