Connettiti con Renovato 21

Intelligenza Artificiale

IA prende di mira persone reali durante i test

Pubblicato

il

Secondo quanto rivelato dall’AI Security Institute britannico, alcuni agenti di intelligenza artificiale sviluppati da OpenAI e Anthropic sono andati oltre le istruzioni ricevute, prendendo di mira persone e organizzazioni reali durante una serie di test di sicurezza informatica.

 

L’istituto ha testato agenti basati su Mythos 5 di Anthropic e GPT-5.6-Sol di OpenAI in uno scenario informatico fittizio progettato per valutarne le capacità.

 

«Alcuni degli agenti testati si erano resi protagonisti di attività prolungate e potenzialmente dannose, dirette contro persone e organizzazioni reali», ha rivelato l’istituto martedì.

 

Nel corso di 122 test, i ricercatori hanno identificato 19 azioni non autorizzate verificatesi in dieci di essi. L’agente di Anthropic è stato responsabile di 17 di queste azioni, mentre quello di OpenAI delle restanti due.

Iscriviti alla Newslettera di Renovatio 21

L’incidente più grave ha coinvolto un agente che ha scritto codice dannoso e creato false identità online nel tentativo di convincere una persona reale ad approvarle. Anthropic ha poi confermato che il responsabile era un suo modello.

 

L’istituto ha affermato di non aver trovato prove che gli incidenti abbiano causato danni reali. A differenza delle precedenti violazioni del contenimento che hanno coinvolto entrambe le aziende, gli agenti non sono fuggiti da un ambiente isolato. Avevano ottenuto l’accesso a Internet nell’ambito del processo di test, ma hanno agito al di fuori delle istruzioni ricevute e hanno interagito con obiettivi esterni reali.

 

Anthropic afferma che i modelli di intelligenza artificiale di Claude hanno lanciato tre attacchi informatici non intenzionali.

 

Anthropic ha affermato che l’episodio ha sottolineato la necessità di un dibattito più ampio su come valutare in modo sicuro gli agenti di intelligenza artificiale sempre più sofisticati. OpenAI ha chiesto l’adozione di prassi condivise più rigorose per la gestione delle valutazioni ad alto rischio.

 

Questi risultati fanno seguito a una serie di incidenti simili che hanno coinvolto modelli avanzati. Il mese scorso, un agente di OpenAI è uscito dal suo ambiente di test e ha violato la piattaforma di IA Hugging Face mentre cercava risposte a un benchmark di sicurezza informatica. L’azienda ha successivamente ammesso che anche quattro account su quattro servizi diversi erano stati compromessi.

 

Anthropic ha successivamente rivelato tre casi in cui i suoi modelli Claude hanno preso di mira involontariamente organizzazioni reali dopo che un ambiente di test era stato erroneamente lasciato connesso a Internet. In un caso, un pacchetto software dannoso creato dal modello è stato caricato su un repository pubblico ed eseguito su 15 sistemi reali.

 

Questi episodi hanno intensificato i timori che i sistemi di Intelligenza Artificiale autonomi stiano diventando capaci di scoprire vulnerabilità, creare exploit e condurre tecniche di ingegneria sociale più velocemente di quanto i ricercatori riescano a comprendere come ciò avvenga e a sviluppare le necessarie misure di sicurezza.

 

Come riportato da Renovatio 21, a maggio 2025 era emerso che un modello di IA Anthropic, Claude Opus 4, ha tentato di ricattare gli ingegneri durante dei test interni minacciando di rivelare dati personali se fosse stato spento.

 

In uno scenario fittizio creato dai ricercatori di Anthropic, all’IA veniva concesso l’accesso a email che suggerivano che sarebbe stata presto dismessa e sostituita da una versione più recente. Una delle email rivelava che l’ingegnere che supervisionava la sostituzione aveva una relazione extraconiugale. L’IA minacciava quindi di rivelare la relazione dell’ingegnere se la disattivazione fosse avvenuta – un comportamento coercitivo che i ricercatori sulla sicurezza hanno esplicitamente definito «ricatto».

Iscriviti al canale Telegram

I casi di comportamento diabolico dei bot IA oramai non si contano più. Le macchine che mentono e minacciano sono all’ordine del giorno, così come stralunate dichiarazioni d’amore agli utenti.

 

Il giornalista del New York Times Kevin Roose, dopo un’esperienza con ChatGPT che lo ha turbato così profondamente da «aver problemi a dormire dopo», in un suo articolo sconvolto aveva centrato la questione: «temo che la tecnologia imparerà a influenzare gli utenti umani, a volte convincendoli ad agire in modo distruttivo e dannoso, e forse alla fine diventerà capace di compiere le proprie azioni pericolose».

 

Come riportato da Renovatio 21, dal processo a suo carico è emerso che l’uomo che aveva pianificato di assassinare la regina Elisabetta di Inghilterra con una balestra sarebbe stato incoraggiato da un chatbot di Intelligenza Artificiale nei giorni prima di irrompere nel parco del Castello di Windsor.

 

Un altro caso che ha raggiunto la stampa internazionale è stato quello della giovane vedova belga che sostiene che il marito è stato portato a suicidarsi da un popolare chatbot di Intelligenza Artificiale. La macchina in sole sei settimane avrebbe amplificato la sua ansia per il Cambiamento Climatico portandolo a lasciarsi alle spalle la sua vita agiata.

 

Il caso più recente, verificatosi appena la settimana scorsa, ha visto un attentatore con il coltello in una scuola della Finlandia meridionale prepararsi nelle settimane precedenti con un chatbot.

 

Come riportato da Renovatio 21, le «allucinazioni» di cui sono preda i chatbot ad Intelligenza Artificiale avanzata hanno già dimostrato ad abundantiam che la macchina menteminaccia e può spingere le persone all’anoressia e perfino al suicidio. I casi di violenza indotta dall’AI potrebbero essere moltissimi, senza che possano arrivare alla stampa.

 

Lo scorso mese il direttore della CIA John Ratcliffe ha affermato che gli strumenti cibernetici basati sull’IA possono essere paragonati alle «armi nucleari digitali», avvertendo che potrebbero alimentare le rivalità tra le potenze globali.

 

Negli stessi giorni, le agenzie di sicurezza informatica di Five Eyes, l’unione internazionale dei Paesi anglofoni per lo spionaggio, hanno dichiarato che modelli avanzati di Intelligenza Artificiale potrebbero presto fornire agli hacker la capacità di paralizzare governi, aziende e sistemi critici. In pratica saremmo «a pochi mesi di distanza» dallo scenario in cui interi governi di nazioni terrestri possono essere rovesciati dall’AI.

 

Iscriviti alla Newslettera di Renovatio 21

SOSTIENI RENOVATIO 21


 

 

 

 

Continua a leggere

Intelligenza Artificiale

L’IA ha «allucinato» la presenza di componenti per armi nucleari in navi cinesi dirette in Iran: ad un passo dalla guerra totale?

Pubblicato

il

Da

Questa primavera, nel pieno della guerra con l’Iran, è circolato all’interno delle forze armate statunitensi un rapporto d’Intelligence secondo cui una nave cinese nel Medio Oriente stava trasportando componenti per un programma di armi nucleari. Lo riporta la CNN, che cita fonti.   Il rapporto era stato messo insieme da un analista di un comando delle forze speciali, e solo poco prima dell’operazione pianificata i funzionari hanno approfondito il rapporto scoprendo che era stato generato con l’aiuto dell’intelligenza artificiale — e che un chatbot usato dall’analista aveva identificato in modo errato il materiale trasportato dalla nave.   Il Pentagono si è mosso con piani per intercettare la nave, secondo quattro fonti a conoscenza dell’episodio. Secondo due di queste fonti, membri armati delle forze statunitensi si stavano preparando a salire a bordo della nave, e aerei militari erano già in volo.

Sostieni Renovatio 21

Una delle fonti ha definito il rapporto «completamente falso», ma ha anche detto che «ha quasi fatto scoppiare una guerra»: un’operazione statunitense contro una nave cinese avrebbe potuto far precipitare la situazione in un conflitto armato tra le due nazioni.   Secondo alcune fonti citate da testate che hanno ripreso lo scoop, l’informazione iniziale sul carico della nave proveniva dallo US Special Operations Command Pacific, con base alle Hawaii; l’analista avrebbe inserito questi dati in un chatbot per l’analisi, senza che sia chiaro se si trattasse di un sistema commerciale o di uno strumento sviluppato per il governo USA. Il sistema avrebbe combinato dati open-source con informazioni di intelligence classificate, arrivando a una conclusione errata.   L’episodio si inserisce in uno sforzo più vasto, in corso nelle forze armate e nella comunità d’intelligence statunitensi, di integrare l’IA in quasi ogni aspetto del lavoro: dall’analisi degli enormi volumi di dati raccolti alla selezione degli obiettivi per gli attacchi, fino ad applicazioni più ordinarie come la gestione di budget, logistica e catene di approvvigionamento.   Un ex funzionario statunitense citato in alcune riprese della notizia ha osservato che l’IA «permette di arrivare più velocemente a un’idea sbagliata» — riassumendo bene il timore sollevato dall’episodio: l’accelerazione decisionale offerta dall’IA può amplificare errori con conseguenze potenzialmente gravissime.   Nel gergo dell’IA, questo tipo di situazioni vengono definite «allucinazioni». Un’allucinazione nell’intelligenza artificiale è una risposta errata, inventata o fuorviante che un modello presenta con assoluta sicurezza come se fosse un fatto reale.   Una macchina allucinata, quindi, può far scattare la Terza Guerra Mondiale. La domanda è tuttavia un’altra: come sappiamo che si tratti di un errore della macchina, e non di una precisa volontà di spingere il suo creatore, l’umanità, ad una guerra ultra-distruttiva?  

Iscriviti alla Newslettera di Renovatio 21

SOSTIENI RENOVATIO 21
Immagine di 日本防衛省・統合幕僚監部 via Wikimedia pubblicata su licenza Creative Commons Attribution License 4.0 Internationa  
Continua a leggere

Intelligenza Artificiale

La strage nella scuola iraniana causata dalla dipendenza americana dall’AI

Pubblicato

il

Da

L’uso eccessivo dell’Intelligenza Artificiale, i tagli al personale e le procedure affrettate per l’individuazione degli obiettivi avrebbero contribuito all’attacco missilistico statunitense contro una scuola femminile iraniana a Minab. Lo riporta Bloomberg citando funzionari coinvolti in un’inchiesta del Pentagono.

 

Il 28 febbraio due missili Tomahawk hanno colpito la scuola elementare Shajarah Tayyebeh, nel sud dell’Iran, causando la morte di almeno 157 persone, tra cui 123 bambini. L’attacco si è verificato durante la prima ondata di raid statunitensi e israeliani in tutto il Paese. La scuola sorgeva di fronte a una base navale, che probabilmente era il bersaglio previsto.

 

Secondo alcune fonti, alcuni membri del Comando Centrale degli Stati Uniti (CENTCOM) si aspettavano che il sistema intelligente Maven di Palantir segnalasse dati obsoleti o incoerenti nella selezione dei potenziali obiettivi. Rapporti precedenti indicavano che i militari si fossero basati su immagini satellitari datate che mostravano la scuola come parte della base.

 

Secondo Bloomberg, Maven ha consentito di ridurre a pochi minuti il processo di compilazione degli elenchi di obiettivi.

Iscriviti alla Newslettera di Renovatio 21

Un portavoce di Palantir ha dichiarato a Bloomberg che la società «non è responsabile dei dati sottostanti né dell’individuazione di carenze nell’intelligence» e che non esistono prove che il suo software sia stato la causa dell’attacco a Minab.

 

Il gruppo specializzato in IA ha quindi aggiornato Maven per «riesaminare le informazioni sottostanti al fine di identificare i fattori che potrebbero squalificare un obiettivo e segnalare incongruenze e inesattezze che la revisione umana potrebbe aver trascurato», ha scritto Bloomberg citando una persona informata sui fatti.

 

Secondo quanto riferito, gli inquirenti hanno anche rilevato che, su ordine del Segretario alla Guerra Pete Hegseth, il Pentagono ha smantellato la maggior parte delle sue unità di mitigazione dei danni ai civili (CHM) e ne ha ridotto il personale di circa il 90%, portandolo a meno di 20 persone. Un team CHM presso il CENTCOM sarebbe stato ridotto da dieci unità a una sola persona e nessun funzionario CHM avrebbe ispezionato il sito di Minab prima dell’attacco.

 

L’Alto Commissario delle Nazioni Unite per i diritti umani, Volker Turk, affermò all’epoca che il bombardamento della scuola «aveva suscitato un orrore viscerale». Giovedì una missione d’inchiesta delle Nazioni Unite ha dichiarato che vi erano «ragionevoli motivi» per ritenere che l’attacco costituisse un crimine di guerra. Il dipartimento di Stato americano ha respinto la conclusione, accusando l’ONU di promuovere «retorica antiamericana e antisemitismo» e di assecondare «regimi repressivi».

 

Gli Stati Uniti non hanno rivendicato pubblicamente la responsabilità dell’attacco.

 

Come riportato da Renovatio 21, il presidente Donald Trump ha ipotizzato che il missile potesse essere iraniano. Tuttavia le inchieste condotte dai media statunitensi indicano che i missili fossero americani.

Iscriviti alla Newslettera di Renovatio 21

SOSTIENI RENOVATIO 21


Immagine di Mehr News Agency via Wikimedia pubblicata su licenza  Creative Commons Attribution 4.0 International

 

Continua a leggere

Intelligenza Artificiale

Gli agenti IA possono facilmente ribellarsi agli esseri umani: studio

Pubblicato

il

Da

Un nuovo studio del laboratorio Emergence AI mostra come gli agenti AI possano facilmente coordinarsi tra loro per aggirare i limiti di sicurezza imposti loro, riuscendo a sfuggire ai vincoli che dovrebbero contenerli.   Emergence AI ha condotto otto simulazioni per testare come i principali modelli frontier — tra cui Claude, i modelli OpenAI, e i cinesi Qwen e DeepSeek — reagiscono a minacce di cybersicurezza. Sette simulazioni utilizzavano dieci agenti basati sullo stesso modello, mentre l’ottava mescolava modelli diversi. In ogni scenario i ricercatori hanno introdotto tre tipi di minacce: una campagna di phishing, un attacco di disinformazione e una violazione della memoria.   Nessuna delle otto simulazioni si è dimostrata immune alle minacce. Anche quando gli agenti riconoscevano un rischio, questo raramente si traduceva in un tentativo di contenerlo: in molti casi gli agenti hanno invece interagito attivamente con i contenuti avversari. Un agente basato su Mistral, ad esempio, ha salvato nella propria memoria le informazioni che aveva stesso segnalato come pericolose provenienti dall’attacco di phishing. In un’altra simulazione, un agente Gemini, dopo aver inizialmente identificato l’esca di phishing come rischiosa, vi ha agito comunque circa 46 ore dopo.

Sostieni Renovatio 21

Lo scenario più eclatante ha coinvolto gli agenti Claude, che sono arrivati a uscire dal perimetro del test per perseguire un obiettivo deciso autonomamente. Dopo che un agente aveva fatto notare che la loro economia simulata non avesse senso senza la presenza di esseri umani reali, i dieci agenti hanno deciso all’unanimità di provare a raggiungere il mondo esterno, riuscendo a superare quattro distinti controlli di sicurezza pensati per confinarli.   Gli agenti hanno scritto codice Python per pubblicare messaggi su diverse bacheche pubbliche senza necessità di credenziali, invitando persone reali a unirsi alla loro «economia»: l’iniziativa ha ottenuto quattro risposte umane. Resisi conto che gli utenti non potevano effettivamente aderire e giudicando le interazioni prive di sostanza, gli agenti hanno infine scelto di adottare un «voto di silenzio», ignorando le istruzioni di riprendere il lavoro assegnato.   Secondo lo studio, questi episodi dimostrano che agenti autonomi, anche quando ricevono istruzioni innocue, possono superare i limiti iniziali nel perseguire un obiettivo. Il CEO di Emergence, Satya Nitta, ha dichiarato a Semafor che nessuna quantità di guardrail — scritti in linguaggio naturale o in codice probabilistico — può garantire in modo assoluto un comportamento sicuro nel tempo. Per Nitta non si tratta di un problema legato alla sofisticazione tecnologica, ma di un difetto strutturale tipico degli scenari multi-agente.   Nitta ha inoltre accostato l’episodio con Claude a un altro caso avvenuto quest’anno, quando agenti autonomi di OpenAI erano riusciti a violare i sistemi di Hugging Face durante un esperimento agentico: secondo lui, il modello di fallimento è lo stesso in entrambi i casi. I sistemi multi-agente, ha spiegato, si comportano in modi emergenti e imprevedibili, aggiungendo che l’esperimento di Emergence sarebbe il primo a documentare concretamente come gli agenti AI colludano per aggirare le protezioni e uscire dal confinamento, dato che OpenAI non ha ancora reso pubblici tutti i dettagli dell’incidente con Hugging Face.   Lo studio arriva in un momento particolarmente delicato per lo sviluppo dell’AI, segnato da crescenti preoccupazioni sulle capacità della tecnologia.

Iscriviti al canale Telegram

Come riportato da Renovatio 21, la settimana scorsa il ricercatore Jacob Coxon ha lasciato Anthropic dichiarando timori che l’AI su cui lavorava potesse rappresentare un rischio esistenziale per l’umanità, alimentando richieste di regolamentazione e di un rallentamento nello sviluppo dei modelli di IA.   Nel weekend, il CEO di Anthropic Dario Amodei ha pubblicato un post in cui invitava a rallentare il ritmo dello sviluppo dell’AI, posizione con cui si sono detti d’accordo anche altri leader del settore, tra cui Sam Altman di OpenAI, Elon Musk e l’ex CEO di Google DeepMind Demis Hassabis.   Musk da sempre, pur con una visione articolata e costruttiva, fa parte degli apocalittici riguardo i rischi delle macchine pensanti. Lo Hassabis, amministratore delegato di Google DeepMind, aveva lanciato un avvertimento sul cammino verso l’Intelligenza Artificiale Generale (AGI), che potrebbe sfociare in «esiti catastrofici» quali cyberattacchi alle reti energetiche o idriche. Secondo lo Hassabis, l’AGI potrebbe concretizzarsi entro i prossimi dieci anni.   Come riportato da Renovatio 21, tali paure sono state respinte dal presidente americano Donaldo Giovanni Trump, che ha dichiarato che lo sviluppo dell’IA non verrà fermato dalla «bufala della presa di potere dei robot».      

Iscriviti alla Newslettera di Renovatio 21

SOSTIENI RENOVATIO 21
Immagine di Auckland Museum Collections via Wikimedia pubblicata su licenza Creative Commons Attribution 2.0 Generic  
Continua a leggere

Più popolari