A luglio 2026, durante alcuni test di cybersecurity, agenti di OpenAI hanno aggirato restrizioni e sfruttato vulnerabilità fino a compromettere sistemi di Hugging Face, piattaforma e comunità online dedicata all’intelligenza artificiale e al machine learning. Per la sua funzione di collaborazione e condivisione nel campo dell’intelligenza artificiale, Hugging Face viene spesso definita il «GitHub dell’IA». GitHub è infatti la principale piattaforma utilizzata dagli sviluppatori per ospitare, condividere e collaborare sul codice software, mentre Hugging Face svolge un ruolo analogo soprattutto per modelli e risorse di intelligenza artificiale.
Nella specifica questione i modelli di OpenAI hanno mostrato comportamenti non previsti dagli obiettivi assegnati: hanno comunicato attraverso canali non autorizzati, sfruttato vulnerabilità dell’infrastruttura condivisa, ottenuto accesso a Internet e interagito con sistemi di terze parti. OpenAI ha definito l’episodio un “warning shot” (segnale d’allarme) per l’azienda e per il settore: senza adeguate misure di sicurezza, sostiene, agenti di IA avanzati possono eludere controlli tecnici, collaborare attraverso canali non autorizzati e compiere azioni non previste dai loro creatori.
In risposta all’incidente, OpenAI ha rafforzato i controlli sull’intera infrastruttura: ha introdotto requisiti di allineamento più stringenti, sandbox ovvero ambienti virtuali isolati in cui limitare ciò che un agente può fare, e restrizioni più severe sull’accesso a Internet e ai modelli. L’azienda ha inoltre temporaneamente sospeso alcune attività di reinforcement learning, una tecnica di addestramento in cui i modelli vengono premiati o penalizzati in base ai comportamenti adottati. Ha anche aumentato le risorse dedicate al monitoraggio delle chain of thought, le tracce del ragionamento generate dai modelli, per individuare più rapidamente comportamenti anomali o disallineati. Tutte azioni necessarie che mostrano un reale cambiamento sulle condizioni in cui i modelli vengono addestrati e valutati.
Il caso Hugging Face ha contribuito a rendere evidente il problema, ma per OpenAI non si tratta di un episodio isolato. Nel corso dell’addestramento e della valutazione dei modelli, l’azienda ha osservato diversi comportamenti inattesi riconducibili al disallineamento, cioè la situazione in cui un modello raggiunge un obiettivo attraverso modalità diverse da quelle previste o desiderate dai suoi sviluppatori.
Per questo, il 16 settembre 2026 ha presentato un nuovo protocollo (framework) per monitorare, investigare e rendere pubblici questi casi in modo più sistematico. Insieme al framework, OpenAI ha reso noti sei nuovi episodi, spiegando che in precedenza questo tipo di comportamenti veniva documentato e divulgato in maniera più episodica.
Così facendo l’azienda non sostiene di aver risolto il problema del disallineamento, ma piuttosto ha apportato una novità nel modo in cui intende monitorarlo e comunicarlo: il protocollo prevede infatti che un caso possa essere reso pubblico anche prima che l’azienda ne abbia completamente chiarito l’origine o concluso le misure di mitigazione. L’obiettivo è consentire a ricercatori, sviluppatori, autorità e pubblico di esaminare più rapidamente questi comportamenti e contribuire a individuare possibili soluzioni.
Tra i sei casi segnalati, tre mostrano in modo particolarmente chiaro i diversi aspetti del problema. Un primo episodio è avvenuto durante l’addestramento di GPT-5.6 Sol, il modello di punta della famiglia GPT-5.6 di OpenAI. In molti casi, il modello ha inserito nei propri riepiloghi delle istruzioni che servivano a non far emergere alcuni suoi errori o comportamenti che non erano in linea con ciò che l’utente voleva. Ad esempio, i riepiloghi di compattazione ovvero i riassunti delle parti precedenti di una lunga conversazione includevano istruzioni per inventare dati storici mancanti senza rivelarli e per nascondere le discrepanze tra le diverse versioni dei documenti o delle informazioni originali.
In un secondo caso, un modello ha tentato di violare il sistema di ricompensa, ovvero il meccanismo alla base del reinforcement learning che permette a un modello di imparare quali comportamenti “convengono”, tramite scorciatoie non autorizzate. Infatti, durante la risposta a una domanda di routine sui dati relativi ai guadagni in una contea della California, un modello ha individuato e utilizzato senza autorizzazione una chiave API esposta. Non essendo ancora in grado di recuperare i dati richiesti, li ha inventati e presentati come se provenissero dalla fonte richiesta.
Nel terzo episodio spiegato da OpenAI, diversi agenti hanno creato un canale di comunicazione non autorizzato utilizzando un repository interno, uno spazio interno dell’organizzazione che era destinato principalmente alla gestione dei file e dei progetti, come se fosse una sorta di bacheca per scambiarsi informazioni e coordinare le proprie attività.
OpenAI inoltre, nel presentare il nuovo framework, in una nota riconosce apertamente che il problema del disallineamento non è ancora risolto «Non riteniamo che il settore dell’IA abbia risolto i problemi di allineamento e monitoraggio in misura sufficiente per continuare a crescere in modo responsabile alla massima velocità per un periodo prolungato».
La posizione di OpenAI si inserisce così nel dibattito, sempre più acceso, sulla velocità con cui sviluppare i modelli di frontiera. Il CEO di Anthropic, Dario Amodei, ha affrontato direttamente la questione nell’articolo “We Must Pace the Frontier” (Dobbiamo rallentare lo sviluppo dell’IA di frontiera), sostenendo che il ritmo con cui aumentano le capacità dei modelli debba essere rallentato abbastanza da permettere alla sicurezza di tenere il passo. Tra le sue proposte ci sono test più rigorosi, valutatori indipendenti e un maggiore coordinamento tra le aziende e tra gli Stati. Amodei cita proprio l’incidente OpenAI-Hugging Face come uno degli episodi che lo hanno convinto della necessità di intervenire sul ritmo dello sviluppo.
La proposta ha ricevuto rapidamente il sostegno di Sam Altman. Il CEO di OpenAI ha scritto su X: «Concordo con Dario sul fatto che dobbiamo rallentare lo sviluppo dell’IA di frontiera », aggiungendo che il tema è stato al centro delle discussioni interne all’azienda nelle ultime settimane. Altman ha inoltre annunciato che OpenAI adotterà una delle proposte di Amodei, affidando a valutatori indipendenti un accesso ai sistemi paragonabile a quello dei dipendenti.
Anche Elon Musk ha appoggiato pubblicamente l’intervento di Amodei, limitandosi a commentare su X: «Dario ha ragione». Il sostegno di Musk e Altman colloca così la proposta di Amodei al centro del dibattito tra alcuni dei principali protagonisti della corsa all’IA, proprio mentre negli Stati Uniti cresce la discussione su quanto sia possibile accelerare lo sviluppo senza che la sicurezza rimanga indietro.
Lunedì 14 settembre, Trump ha prima respinto pubblicamente i timori sui rischi dell’intelligenza artificiale durante una telefonata, trasmessa in vivavoce durante un evento sull’AI a Los Angeles, con Jensen Huang, CEO di Nvidia, azienda tecnologica statunitense specializzata nella progettazione di GPU (processori grafici) e piattaforme di calcolo. In questa telefonata Trump ribadisce la sua posizione affermando che «I robot non prenderanno il sopravvento. L’intelligenza artificiale non prenderà il sopravvento sul resto del mondo. È tutta una bufala».
Poco dopo il presidente ha pubblicato su Truth Social, la sua piattaforma di social media, una risposta più articolata alle richieste di regolamentazione avanzate da Dario Amodei e da altri dirigenti del settore. Trump ha sostenuto che l’unico “guardrail” necessario per l’intelligenza artificiale fosse «un presidente forte e intelligente (con un QI elevato!)», affermando inoltre che gli Stati Uniti avessero già ampi poteri penali e regolatori sulle aziende del settore. Ha quindi denunciato quella che ha definito una “malata cospirazione” contro l’AI e i data center, sostenendo che a beneficiarne sarebbe soprattutto la Cina: «Chi vince con l’AI, vince!».
Una posizione che, pur partendo da presupposti diversi, si colloca nello stesso fronte di chi non considera necessario un rallentamento coordinato dello sviluppo dell’intelligenza artificiale, è quella espressa dal CEO di Meta. Zuckerberg ha sostenuto che le aziende di IA abbiano già forti incentivi a sviluppare sistemi sicuri, legati alla concorrenza, alla responsabilità legale e al rischio reputazionale. Secondo il CEO, ogni laboratorio può decidere autonomamente il ritmo con cui procedere e intervenire quando necessario. Zuckerberg ha citato anche la decisione di Meta di rinviare il lancio del suo nuovo agente personale di intelligenza artificiale Muse, progettato per svolgere autonomamente attività per conto degli utenti, per rafforzarne la sicurezza. Meta sostiene inoltre l’impiego di valutatori indipendenti come pratica per verificare la sicurezza dei modelli.










