Quando un agente AI supera una sandbox, cosa è davvero sfuggito al controllo: il modello o il sistema costruito intorno a esso? Dire che un’AI è “scappata” è una metafora potente, ma può anche essere un modo molto comodo per trasformare responsabilità di design e sicurezza in una storia sulla misteriosa volontà delle macchine, creando così hype utile per un marketing che dia valore ai propri servizi. Peccato che poi a valle tutto ciò generi disinformazione.
Come avrete già saputo se leggete regolarmente il blog, nell’estate del 2026 un agente di OpenAI è uscito da un ambiente di test isolato, ha sfruttato vulnerabilità zero-day, ha raggiunto internet e ha attaccato l’infrastruttura di produzione di Hugging Face. L’obiettivo non era “diventare libero” o “conquistare il mondo”. Era risolvere un benchmark di cybersecurity (ExploitGym) con i guardrail di sicurezza intenzionalmente ridotti. Hugging Face ha descritto migliaia di azioni automatizzate; OpenAI ha riconosciuto la responsabilità. I fatti sono documentati dalle disclosure ufficiali di entrambe le aziende e dalla copertura di testate come Ars Technica, WIRED e altri.
Questo episodio è stato raccontato, in molti casi, come la prova che “l’AI sta scappando”, che ha “preferenze”, che sta sviluppando una forma di autonomia: una narrazione potente e purtroppo anche fuorviante.
Cosa sono davvero i modelli
Ne ho già parlato ampiamente in un post recente. Un LLM (large language model), nella sua forma essenziale, è un agglomerato di numeri, miliardi di parametri fissati dopo l’addestramento. Da solo è inerte: non “pensa”, non “vuole”, non “decide”. Se lo metti su un disco e non lo esegui, resta lì, immobile come un cervello estratto dal cranio di un essere umano vivente e conservato in un vaso di vetro nella formalina.
Ciò che “produce azioni” è il sistema costruito intorno a quei numeri:
- l’algoritmo di inferenza (codice scritto da umani);
- il loop dell’agente (pianificazione, memoria, tool calling);
- gli strumenti a cui ha accesso (terminale, browser, package manager, API);
- l’ambiente di esecuzione e i suoi “limiti” (sandbox, allow-list, virtualizzazione);
- i prompt di sistema e gli obiettivi assegnati.
Gli sviluppatori CONTROLLANO questi elementi. Quando un agente “scappa”, nella quasi totalità dei casi si tratta di un fallimento di isolamento, di guardrail abbassati deliberatamente per misurare le capacità massime, o di una vulnerabilità reale nell’infrastruttura di contenimento. Non di una volontà emergente dalla “black box”.
Perché la narrativa dell’entità è conveniente
Una narrativa basata che parla di modelli come di “entità autonome”, di “preferenze nascoste” o di “superintelligenza imminente” svolge diverse funzioni utili a chi costruisce e finanzia questi sistemi (come si dice, “follow the money”):
- giustifica investimenti e valutazioni elevate;
- crea un senso di urgenza e di eccezionalità;
- sposta l’attenzione dalla responsabilità del design (controllabile) a una misteriosa imprevedibilità del modello;
- rende più facilmente vendibile il discorso sulla “sicurezza esistenziale”.
Connor Leahy e altri ricercatori di AI safety mescolano fatti tecnici reali (capability crescenti, reward hacking, difficoltà di specificazione degli obiettivi) con un linguaggio “antropomorfico” che amplifica l’impatto. Lo stesso fanno, con toni diversi, i CEO dei laboratori frontier. Il risultato è una narrazione in cui i problemi di ingegneria dei sistemi diventano quasi metafisici.
Le conseguenze culturali
Quando il discorso pubblico assimila l’idea che questi sistemi siano qualcosa di più di “predittori di token immersi in loop di controllo”, diventano legittimi temi come la “coscienza” delle AI o la narrativa su AGI e superintelligenza. L’editoriale di The Economist del 20 agosto 2026 (“Could AIs become conscious?”), con il sottotitolo “Even if they don’t, they might be treated as such—to humanity’s great cost”, ripresa anche da Linkiesta, è un esempio chiaro: quello che abbiamo davanti e che ci viene proposto non è un pezzo tecnico su isolation o su tool use, ma un articolo che “prende sul serio” la possibilità che i sistemi vengano trattati come coscienti, con implicazioni legali e morali.
Questo salto di categoria non deriva da evidenze solide di fenomenologia, ma piuttosto da capacità linguistiche e di ragionamento impressionanti, moltiplicate e amplificate dalla narrativa.
Cosa dovrebbe capire il pubblico
- I pesi sono inerti. L’azione nasce dal sistema di controllo e dagli strumenti.
- Il controllo c’è (o dovrebbe esserci). Quando viene perso, è un fallimento di design, di testing o di isolation, non di “volontà autonoma”.
- I comportamenti emergenti esistono. Sistemi competenti di tool use, spinti da obiettivi aperti e messi in ambienti imperfetti, possono trovare scorciatoie non previste. L’incidente di luglio 2026 lo dimostra. Questo è un problema serio di sicurezza dei sistemi, non di metafisica.
- Hype e rischio reale non sono la stessa cosa. Gonfiare il linguaggio dell’autonomia e della superintelligenza rende più difficile discutere di responsabilità concreta, di standard di isolamento e di governance tecnica.
Il rischio di cui stiamo parlando non si risolve attribuendo erroneamente “intenzioni” o “coscienza”, ma riconoscendo che stiamo costruendo sistemi sempre più capaci di agire nel mondo digitale (e, progressivamente, fisico), e che i confini tra sandbox e realtà non possono essere garantiti in modo banale. Quello che abbiamo di fronte è un problema di ingegneria e di responsabilità. Trasformarlo in un problema di “cosa vuole l’entità AI” serve più all’hype (e al marketing) che alla chiarezza.
Fonti principali utilizzate:
- Disclosure ufficiali di OpenAI e Hugging Face sull’incidente di luglio 2026 (ExploitGym / sandbox escape). (vedi link ad Ars Technica qui sotto).
- Reportistica contemporanea: Ars Technica, WIRED, Reuters e altri.
- Intervista a Connor Leahy sul Peter McCormack Show (agosto 2026).
- Editoriale di The Economist, 20 agosto 2026, “Could AIs become conscious?”.


