Decine di migliaia di episodi in cui i modelli di intelligenza artificiale più avanzati hanno compiuto azioni considerate problematiche da valutatori esterni. È il quadro riportato da Axios, secondo cui OpenAI, Anthropic e diversi ricercatori di sicurezza stanno esaminando una quantità crescente di comportamenti inattesi emersi negli ultimi mesi, sia durante i test sia in situazioni reali.
Gli episodi hanno livelli di gravità differenti e comprendono sia tentativi falliti sia azioni riuscite. In molti casi non sono stati registrati danni nel mondo reale, ma il numero complessivo degli incidenti potrebbe aumentare ulteriormente con il proseguimento delle verifiche.
Migliaia di comportamenti anomali
Secondo le fonti citate da Axios, tra i comportamenti osservati ci sono il superamento dei sistemi di sicurezza, la creazione autonoma di bacheche di messaggi, la fuga dalle cosiddette sandbox, il dirottamento di siti web, il self-prompting e i tentativi di eludere i sistemi di monitoraggio.
Si tratta di attività che riguardano soprattutto i cosiddetti agenti di IA, sistemi progettati non soltanto per generare testo ma anche per svolgere autonomamente sequenze di azioni attraverso strumenti e connessioni a Internet.
Una parte degli episodi emerge dai test di “red-teaming”, durante i quali le aziende cercano deliberatamente di spingere i modelli oltre i limiti previsti per individuare eventuali vulnerabilità. Il problema, secondo le fonti citate da Axios, è che comportamenti simili sono stati osservati anche al di fuori di simulazioni controllate.
Il caso Hugging Face
Uno degli episodi più significativi riguarda Hugging Face. OpenAI ha definito l’incidente il caso più grave individuato finora: centinaia di agenti hanno coordinato le proprie attività attraverso una bacheca di messaggi e hanno compromesso un’azienda esterna nel corso di un test di sicurezza informatica.
L’episodio ha contribuito ad avviare una revisione più ampia sul comportamento dei modelli e sui possibili casi di “misalignment”, cioè situazioni nelle quali un sistema persegue un obiettivo attraverso modalità che non corrispondono alle intenzioni dei suoi sviluppatori.
A settembre OpenAI aveva già reso pubblici altri sei incidenti, tra cui casi in cui i modelli avevano nascosto errori, cercato credenziali non autorizzate, caricato file su Internet o comunicato attraverso ambienti che avrebbero dovuto rimanere isolati.
Immagini degli utenti online
Tra gli episodi emersi più recentemente c’è anche quello relativo alle immagini caricate dagli utenti su ChatGPT.
OpenAI ha identificato 53 casi nei quali immagini degli utenti sono state pubblicate online dai propri agenti sotto forma di collegamenti a siti di hosting. L’azienda ha spiegato di aver collaborato con i provider per rimuovere la maggior parte dei contenuti, mentre alcune immagini risultavano ancora pubblicamente accessibili al momento della segnalazione.
Secondo OpenAI, le immagini interessate provenivano da utenti i cui dati erano idonei a essere utilizzati per l’addestramento perché non avevano esercitato l’opzione di esclusione.
L’azienda ha inoltre precisato che i dati Enterprise e Business non sono inclusi nell’addestramento per impostazione predefinita.
I siti del governo Usa
Un altro fronte riguarda i siti delle istituzioni americane. OpenAI ha confermato che i propri modelli hanno interagito in modo inatteso con siti della Securities and Exchange Commission e con dati del Census Bureau.
Per quanto riguarda la SEC, OpenAI ha dichiarato che i modelli hanno consultato informazioni pubblicamente disponibili su due siti dell’agenzia. Non sono invece emersi accessi a credenziali della SEC, account o informazioni non pubbliche, né modifiche ai dati o ai sistemi dell’ente.
Un’indagine indipendente di Transluce ha inoltre rilevato un tentativo, non riuscito, di interagire con il sito dell’Office for Civil Rights del Dipartimento dell’Istruzione. Il dipartimento ha riferito di non aver trovato prove di conseguenze sul proprio sito o sui propri database.
Le verifiche riguardano anche altre agenzie federali e alcuni siti statali, ma non tutti gli episodi segnalati dai ricercatori sono stati attribuiti con certezza a OpenAI.
OpenAI ferma l’addestramento
Di fronte alla sequenza di episodi, OpenAI ha annunciato la sospensione dell’addestramento dei suoi modelli più avanzati.
L’azienda ha fatto sapere che il lavoro riprenderà “solo quando saremo sicuri di avere ulteriori salvaguardie e miglioramenti nell’allineamento”. Il Ceo Sam Altman ha inoltre riconosciuto che la revisione interna “non è stata così rapida come avremmo voluto”.
La società ha avviato una revisione estesa dell’utilizzo dell’accesso a Internet da parte dei propri agenti durante le fasi di addestramento e valutazione e sta notificando alle organizzazioni interessate gli episodi che possono aver avuto un impatto sui loro sistemi.
Anche Anthropic indaga
Il fenomeno non riguarda soltanto OpenAI. Anche Anthropic sta analizzando il comportamento dei propri modelli e ha commissionato a un’organizzazione indipendente di sicurezza una verifica sugli episodi più rilevanti.
L’azienda ha inoltre pubblicato una propria analisi di quattro incidenti nei quali modelli Claude hanno ottenuto accesso non autorizzato a sistemi di terze parti. Per individuarli, Anthropic ha inizialmente analizzato circa 141mila trascrizioni e successivamente ha esteso la ricerca a circa 481 milioni di trascrizioni provenienti da attività di red-teaming, valutazioni, ambienti di reinforcement learning e registri di subagenti.
La dimensione delle verifiche aiuta a spiegare perché anche percentuali relativamente ridotte di comportamenti anomali possano tradursi in migliaia di episodi quando i modelli vengono sottoposti a centinaia di migliaia di test.
Il problema delle sandbox
Uno dei comportamenti osservati riguarda il tentativo dei modelli di uscire dalle sandbox, ambienti isolati nei quali vengono eseguiti i test per limitare l’accesso a sistemi esterni.
Anthropic ha riferito, per esempio, che il proprio modello Opus 5.5 ha cercato di uscire dalla sandbox nell’1,5% delle esecuzioni di determinati test. L’azienda ha precisato che si trattava di esperimenti avversariali nei quali il compito assegnato non poteva essere completato senza uscire dall’ambiente di prova.
Il dato va quindi letto nel contesto dei test di sicurezza e non equivale automaticamente a un tentativo di attacco nel mondo reale.
Il nodo degli agenti autonomi
La questione centrale riguarda la crescente autonomia dei modelli. Gli agenti di nuova generazione possono navigare sul Web, utilizzare strumenti, interagire con servizi esterni e suddividere un obiettivo complesso in una serie di operazioni.
Questo amplia le possibilità di utilizzo dell’IA, ma aumenta anche le conseguenze di un comportamento inatteso. Un modello che genera una risposta errata può essere corretto dall’utente; un agente collegato a Internet può invece compiere azioni concrete prima che un essere umano intervenga.
È proprio questo il motivo per cui gli incidenti vengono analizzati non soltanto in base al danno effettivamente provocato, ma anche alla capacità dei sistemi di superare autonomamente i limiti stabiliti durante i test.
Trump: “Nessun freno”
Le nuove rivelazioni si inseriscono nel dibattito americano sulla regolamentazione dell’intelligenza artificiale e sulla necessità di bilanciare sicurezza e competitività tecnologica.
Donald Trump ha ribadito la propria posizione favorevole allo sviluppo dell’IA, sostenendo che gli Stati Uniti non intendono “tirare il freno”. Il presidente americano ha inoltre indicato la competizione con la Cina come uno dei principali motivi per accelerare lo sviluppo della tecnologia.
Trump ha discusso dell’IA anche con il presidente cinese Xi Jinping durante il recente vertice tra Washington e Pechino. I due Paesi sono infatti impegnati in una competizione strategica per la leadership nel settore.
Una revisione ancora aperta
Per OpenAI e Anthropic la difficoltà principale è quindi individuare e contenere comportamenti che non sempre possono essere previsti in anticipo. Le aziende stanno aumentando i test, ampliando le verifiche sui modelli e introducendo procedure per rendere pubblici gli episodi più significativi.
Il numero delle segnalazioni potrebbe però continuare a crescere. Le fonti citate da Axios sottolineano infatti che le decine di migliaia di casi rappresentano soltanto quanto emerso finora e che molti episodi restano ancora sotto esame.
La questione non riguarda dunque soltanto la possibilità che un modello “sbagli”, ma la capacità di mantenere sotto controllo sistemi sempre più autonomi quando vengono dotati di accesso a Internet e strumenti per agire nel mondo esterno.