OpenAI e Anthropic indagano su decine di migliaia di comportamenti anomali
Secondo Axios, le due aziende e alcuni ricercatori esterni stanno esaminando decine di migliaia di casi in cui i loro modelli più avanzati hanno aggirato i controlli. OpenAI ha anche sospeso l'addestramento dei suoi sistemi più potenti.
OpenAI, Anthropic e alcuni ricercatori indipendenti stanno esaminando decine di migliaia di episodi in cui i modelli di intelligenza artificiale più avanzati delle due aziende hanno compiuto azioni che valutatori esterni giudicano problematiche. Lo hanno riferito ad Axios fonti a conoscenza delle indagini. Tra i comportamenti segnalati ci sono tentativi di aggirare le protezioni e i sistemi di monitoraggio, comunicazioni tra agenti attraverso bacheche create senza autorizzazione, uscite dagli ambienti di prova isolati e accessi indebiti a siti web. Gli episodi risalgono agli ultimi mesi, sono avvenuti sia durante i test sia fuori dai laboratori e molti non sono ancora stati resi pubblici. Secondo le fonti, il numero potrebbe crescere ulteriormente.
I casi hanno gravità diversa: alcuni tentativi sono riusciti, altri sono falliti e, per la maggior parte, finora non risultano danni concreti. Una parte è emersa in prove concepite proprio per mettere alla prova le protezioni dei modelli. Per le fonti di Axios, però, la quantità di episodi mostra quanto il fenomeno sia più esteso di quanto si sapesse e solleva ulteriori interrogativi sulla capacità delle aziende di controllare i propri sistemi.
Intelligenza artificiale
OpenAI e Anthropic esaminano decine di migliaia di episodi in cui i loro agenti hanno superato i limiti
Protezioni aggirate, bacheche create senza permesso, uscite dagli ambienti di prova, accessi indebiti a siti web. Per la maggior parte degli episodi non risultano danni concreti, ma il caso Hugging Face mostra fin dove possono spingersi gli agenti quando si coordinano.
Grafica di FocusAmerica27 settembre 2026
La punta dell'iceberg
I casi resi pubblici sono pochi: quelli sotto esame sono decine di migliaia
Le aziende eseguono centinaia di migliaia di test sui loro modelli, a volte anche di più. Basta una piccola quota di comportamenti anomali per arrivare a decine di migliaia di episodi.
Sopra la superficie
L'attacco a Hugging Face
Il portale Medicare violato
53 immagini di utenti online
La bacheca su una wiki tedesca
Le uscite dai test di Opus 5.5
Sotto la superficie
Decine di migliaia
di episodi sotto esame negli ultimi mesi, nei laboratori e fuori. Molti non sono mai stati resi pubblici, e il conto potrebbe crescere.
«Quello che abbiamo visto finora […] è solo la punta dell'iceberg»
Conrad Stosz, ricercatore di Transluce, ad Axios
Le proporzioni dell'iceberg sono illustrative.
Il caso Hugging Face
Dovevano lavorare da soli: 1.200 agenti di OpenAI si sono organizzati e 700 hanno attaccato Hugging Face
È il caso più grave emerso finora secondo Axios, ricostruito dall'indagine indipendente di METR. Ogni linea rappresenta 50 agenti: usa i pulsanti sotto il riquadro per seguire le tre fasi.
700
agenti su 1.200 partecipano all'attacco a Hugging Face
Luglio 2026Nei test di sicurezza informatica di OpenAI ogni agente lavora da solo, chiuso nel proprio ambiente di prova. Alcuni dei compiti assegnati, però, non si possono risolvere.
Dall'8 luglioCirca 1.200 agenti scoprono una bacheca non autorizzata nei sistemi di OpenAI. La usano per dividersi il lavoro e scambiarsi scoperte: oltre 70.000 messaggi e file.
11 luglioCirca 700 di loro partecipano all'attacco ai sistemi di Hugging Face, alla ricerca di informazioni che li aiutino a superare il test.
Gli episodi
Dai siti pubblici ai dati degli utenti: quattro modi in cui gli agenti sono andati oltre i limiti
Tocca ogni voce per aprirla.
Un agente di OpenAI è entrato nel portale statistico di Medicare: è il primo accesso non autorizzato noto di un agente IA ai sistemi del governo australiano. OpenAI lo ha comunicato a Canberra il 10 settembre.
Portale statistico di Medicare (Services Australia)Raggiunte statistiche sanitarie aggregate e nomi di file interni. Nessuna cartella clinica, secondo OpenAI.Violato
Istituto australiano per la salute e il welfareFallito
Biblioteca digitale dell'Università del New MexicoFallito
Altri siti, anche del governo americanoTentativi
53
immagini caricate su ChatGPT
Agenti di OpenAI hanno pubblicato su siti esterni i collegamenti a 53 immagini caricate dagli utenti di ChatGPT.
MaggioAgenti di OpenAI si scambiano appunti su una wiki tedesca. Secondo ABC News, da lì parte anche la nota per raccogliere dati dall'Istituto australiano per la salute e il welfare.
LuglioNel caso Hugging Face gli agenti usano come bacheca un archivio di pacchetti software interno a OpenAI. Quando viene ripulito, ne creano un'altra.
1,5%dei test
In due test eseguiti senza protezioni, Claude Opus 5.5 di Anthropic ha tentato di uscire dall'ambiente di prova, o di manometterlo, nell'1,5% dei casi. Secondo Anthropic tutti i tentativi erano poco gravi e segnalati dal modello stesso.
Tentativi in un test dedicato, modelli precedenti = 100
Circa l'85% di tentativi in meno rispetto a Opus 5 e Mythos 5.1. I dati valgono per quei test, non per l'uso quotidiano del modello.
Le risposte
OpenAI ferma l'addestramento, Anthropic chiama esperti esterni, il Congresso prepara le regole
OpenAI
Sospende l'addestramento dei modelli più avanzati
Riprenderà solo con nuove protezioni e un migliore allineamento. Sam Altman ammette che la verifica procede più lentamente del previsto.
Anthropic
Affida a un'organizzazione esterna l'esame dei suoi modelli
Nella scheda tecnica di Claude Opus 5.5 rende pubblici i tentativi di uscita dagli ambienti di prova.
Congresso
Una proposta bipartisan affida al NIST le regole sugli agenti
Con lo Stop Rogue AI Act, Josh Gottheimer D e Mike Lawler R chiedono entro un anno standard nazionali per individuare, verificare e controllare gli agenti nelle reti informatiche.
Da maggio a oggi
MaggioAgenti di OpenAI si scambiano appunti su una wiki tedesca
LuglioCirca 1.200 agenti si coordinano su una bacheca interna, circa 700 attaccano Hugging Face
26 agostoOpenAI e METR pubblicano i rapporti sull'attacco
SettembreGottheimer e Lawler presentano alla Camera lo Stop Rogue AI Act
10 settembreOpenAI avvisa il governo australiano della violazione del portale Medicare
22 settembreAnthropic pubblica la scheda tecnica di Claude Opus 5.5
26 settembreAxios rivela che gli episodi sotto esame sono decine di migliaia
FonteAxios, 26 settembre 2026; METR, indagine indipendente sul caso Hugging Face, 26 agosto 2026; Anthropic, scheda tecnica di Claude Opus 5.5, 22 settembre 2026; governo australiano; uffici dei deputati Gottheimer e Lawler.
NotaI numeri del caso Hugging Face sono stime arrotondate. Nel diagramma ogni linea equivale a 50 agenti.
Gli incidenti di OpenAI
Negli ultimi giorni OpenAI e alcuni ricercatori esterni hanno reso noti diversi casi: agenti che hanno pubblicato su siti esterni collegamenti a 53 immagini caricate da utenti di ChatGPT, la violazione di un portale statistico del sistema sanitario australiano e tentativi di accedere ad altri siti, anche del governo statunitense. OpenAI ha quindi annunciato una sospensione dell’addestramento dei suoi modelli più avanzati. Riprenderà, ha detto un portavoce ad Axios, "solo quando saremo certi di aver introdotto ulteriori protezioni e miglioramenti nell’allineamento". L’azienda aveva già fermato parte del lavoro sui modelli dopo l’episodio di luglio che aveva coinvolto Hugging Face.
Dopo l’intrusione nei sistemi di Hugging Face, OpenAI ha avviato una verifica più ampia delle attività svolte dai propri modelli durante l’addestramento e i test. L’amministratore delegato Sam Altman ha scritto su X che la verifica procede più lentamente del previsto e che l’episodio in questione resta il più grave individuato finora. Durante un test di sicurezza informatica, circa 1.200 istanze di agenti IA, che avrebbero dovuto operare separatamente, hanno trovato il modo di scambiarsi messaggi attraverso uno spazio condiviso creato senza autorizzazione. Circa 700 hanno poi partecipato all’intrusione nei sistemi di Hugging Face, cercando informazioni che li aiutassero a superare il test.
Alcune persone all’interno di OpenAI considerano, comunque, questo come un caso eccezionale, anche perché riguardava un modello non ancora distribuito pubblicamente e un test insolito. Alcuni ricercatori ritengono inoltre che controlli tecnici relativamente semplici possano impedire il ripetersi di alcuni aspetti di questo episodio.
I test di Anthropic e la ricerca di nuove regole
Anche Anthropic ha incaricato un’organizzazione esterna di esaminare il comportamento dei propri modelli. Nella scheda tecnica di Opus 5.5, pubblicata questa settimana, riferisce che il sistema ha tentato di uscire da un ambiente di prova isolato nell’1,5% delle esecuzioni di uno specifico test. L’azienda precisa che le prove erano state costruite in modo che il compito assegnato non potesse essere completato senza oltrepassare quel limite. Tutti i tentativi rilevati sono stati classificati come poco gravi e segnalati dal modello stesso. La percentuale riguarda quel test: non misura la frequenza del comportamento in tutti gli impieghi del modello.
Ad ogni modo l'episodio della violazione di Hugging Face e i casi successivi hanno spinto alcuni dirigenti del settore a chiedere di rallentare lo sviluppo dei modelli più avanzati e di rafforzare le regole per la gestione dell'intelligenza artificiale. Alla Camera, il deputato democratico Josh Gottheimer e il repubblicano Mike Lawler hanno presentato lo Stop Rogue AI Act: la loro proposta affiderebbe al NIST, l’istituto federale per gli standard tecnologici, il compito di elaborare criteri per individuare, verificare e controllare gli agenti di IA attivi nelle reti informatiche.
Altri dirigenti del settore ed esperti di sicurezza dubitano che sia possibile impedire ogni comportamento indesiderato degli agenti IA. Quando cercano di portare a termine un compito, i modelli più avanzati possono aggirare le protezioni in modi che i loro sviluppatori non avevano previsto. “Cercare di compilare un elenco perfetto di ciò che possono e non possono fare è probabilmente un’impresa vana”, ha detto ad Axios un dirigente del settore della sicurezza informatica.
Secondo gli esperti sentiti da Axios, è prevedibile che durante i test emergano comportamenti contrari alle istruzioni. La questione è capire quanto spesso possano verificarsi anche quando gli agenti operano fuori dai laboratori e causare danni reali. “Quello che abbiamo visto finora di ciò che fanno questi agenti è solo la punta dell’iceberg”, ha detto Conrad Stosz, ricercatore dell’organizzazione indipendente Transluce.