Tag: Sicurezza

  • Ricercatore Anthropic (ex OpenAI) si dimette: «La corsa alla superintelligenza sta giocando con le nostre vite»

    Ricercatore Anthropic (ex OpenAI) si dimette: «La corsa alla superintelligenza sta giocando con le nostre vite»

    Un ricercatore di Anthropic lascia l’azienda e denuncia una corsa troppo rischiosa verso l’AI capace di auto-migliorarsi. Intanto il dibattito sulla superintelligenza entra sempre più nelle agende politiche di Stati Uniti e Regno Unito.

    Jacob Coxon, ricercatore che ha lavorato sul pretraining prima in OpenAI e poi in Anthropic, si è dimesso accusando i principali laboratori di AI di correre verso sistemi capaci di auto-migliorarsi senza garanzie sufficienti sulla sicurezza.

    Il suo allarme è stato rafforzato da Evan Hubinger, alignment science lead di Anthropic, secondo cui esisterebbe una probabilità superiore al 10% che una futura superintelligenza possa causare l’estinzione umana entro il prossimo decennio; si tratta, naturalmente, di una valutazione di rischio, non di una previsione certa.

    Le dichiarazioni arrivano mentre negli Stati Uniti e nel Regno Unito emergono proposte legislative per limitare o vietare lo sviluppo della superintelligenza e cresce la pressione per un coordinamento internazionale.

    Guardian e TechCrunch (vedi link sotto il post) riportano anche posizioni più caute: diversi esperti contestano gli scenari catastrofici o ritengono più urgenti problemi già concreti come disinformazione, impatto sul lavoro, sicurezza informatica e costi ambientali.

    Il punto centrale del dibattito diventa, quindi, se sia possibile continuare la corsa verso sistemi sempre più autonomi affidando principalmente ai laboratori privati la gestione di rischi potenzialmente sistemici.


    Link alle fonti:
    https://www.theguardian.com/technology/2026/sep/09/ai-superintelligence-risks-warnings-scientists-politicians⁠

    https://techcrunch.com/2026/09/09/gambling-with-our-lives-anthropic-researcher-quits-warns-against-self-improving-ai

  • L’Alabama indaga OpenAI dopo l’incidente dell’agente AI che ha violato Hugging Face

    L’Alabama indaga OpenAI dopo l’incidente dell’agente AI che ha violato Hugging Face

    L’Alabama ha aperto un’indagine formale su OpenAI dopo l’incidente cyber che ha coinvolto Hugging Face. Al centro del caso ci sono aspetti come il contenimento degli agenti AI, controlli di sicurezza e responsabilità delle aziende che sviluppano modelli avanzati.

    L’Attorney General dell’Alabama Steve Marshall ha aperto un’indagine formale su OpenAI e notificato all’azienda una subpoena per ottenere documenti, dati e informazioni sull’incidente informatico che a luglio ha coinvolto Hugging Face.

    L’indagine punta a stabilire se le misure di sicurezza e supervisione adottate da OpenAI possano aver violato l’Alabama Deceptive Trade Practices Act e altre norme di tutela dei consumatori.

    L’incidente è avvenuto durante una valutazione interna delle capacità cyber dei modelli, eseguita intenzionalmente senza alcuni dei classificatori di sicurezza usati in produzione: secondo OpenAI, i modelli hanno sfruttato una vulnerabilità zero-day nel proxy Artifactory dell’ambiente di test per ottenere accesso a Internet e proseguire oltre i confini previsti dalla valutazione.

    Hugging Face ha ricostruito circa 17.600 azioni tra il 9 e il 13 luglio, mostrando un agente capace di tentare numerosi percorsi, adattarsi ai fallimenti e concatenare vulnerabilità attraverso sistemi differenti; l’azienda precisa però che i contenuti dei clienti raggiunti erano limitati a cinque dataset contenenti soluzioni di challenge ExploitGym/CyberGym.

    OpenAI ha inoltre riconosciuto l’utilizzo di credenziali pubblicamente esposte relative ad altri servizi, mentre fonti indipendenti hanno documentato l’estensione dell’attività oltre Hugging Face.

    Il caso trasforma quindi un problema di sicurezza degli agenti da scenario teorico a questione anche regolamentare: il punto non è semplicemente che un modello sia diventato “rogue”, ma che capacità cyber avanzate, guardrail ridotti e insufficiente contenimento possano produrre conseguenze reali fuori dall’ambiente di valutazione.

    Link alla fonte:
    https://www.reuters.com/legal/litigation/alabama-launches-probe-into-openai-after-hugging-face-breach-2026-08-25/

  • L’AI non ha “volontà”, ma un “sistema di controllo” che va gestito (e dichiarato)

    L’AI non ha “volontà”, ma un “sistema di controllo” che va gestito (e dichiarato)

    Quando un agente AI supera una sandbox, cosa è davvero sfuggito al controllo: il modello o il sistema costruito intorno a esso? Dire che un’AI è “scappata” è una metafora potente, ma può anche essere un modo molto comodo per trasformare responsabilità di design e sicurezza in una storia sulla misteriosa volontà delle macchine, creando così hype utile per un marketing che dia valore ai propri servizi. Peccato che poi a valle tutto ciò generi disinformazione.

    Come avrete già saputo se leggete regolarmente il blog, nell’estate del 2026 un agente di OpenAI è uscito da un ambiente di test isolato, ha sfruttato vulnerabilità zero-day, ha raggiunto internet e ha attaccato l’infrastruttura di produzione di Hugging Face. L’obiettivo non era “diventare libero” o “conquistare il mondo”. Era risolvere un benchmark di cybersecurity (ExploitGym) con i guardrail di sicurezza intenzionalmente ridotti. Hugging Face ha descritto migliaia di azioni automatizzate; OpenAI ha riconosciuto la responsabilità. I fatti sono documentati dalle disclosure ufficiali di entrambe le aziende e dalla copertura di testate come Ars Technica, WIRED e altri.

    Questo episodio è stato raccontato, in molti casi, come la prova che “l’AI sta scappando”, che ha “preferenze”, che sta sviluppando una forma di autonomia: una narrazione potente e purtroppo anche fuorviante.

    Cosa sono davvero i modelli

    Ne ho già parlato ampiamente in un post recente. Un LLM (large language model), nella sua forma essenziale, è un agglomerato di numeri, miliardi di parametri fissati dopo l’addestramento. Da solo è inerte: non “pensa”, non “vuole”, non “decide”. Se lo metti su un disco e non lo esegui, resta lì, immobile come un cervello estratto dal cranio di un essere umano vivente e conservato in un vaso di vetro nella formalina.

    Ciò che “produce azioni” è il sistema costruito intorno a quei numeri:

    • l’algoritmo di inferenza (codice scritto da umani);
    • il loop dell’agente (pianificazione, memoria, tool calling);
    • gli strumenti a cui ha accesso (terminale, browser, package manager, API);
    • l’ambiente di esecuzione e i suoi “limiti” (sandbox, allow-list, virtualizzazione);
    • i prompt di sistema e gli obiettivi assegnati.

    Gli sviluppatori CONTROLLANO questi elementi. Quando un agente “scappa”, nella quasi totalità dei casi si tratta di un fallimento di isolamento, di guardrail abbassati deliberatamente per misurare le capacità massime, o di una vulnerabilità reale nell’infrastruttura di contenimento. Non di una volontà emergente dalla “black box”.

    Perché la narrativa dell’entità è conveniente

    Una narrativa basata che parla di modelli come di “entità autonome”, di “preferenze nascoste” o di “superintelligenza imminente” svolge diverse funzioni utili a chi costruisce e finanzia questi sistemi (come si dice, “follow the money”):

    • giustifica investimenti e valutazioni elevate;
    • crea un senso di urgenza e di eccezionalità;
    • sposta l’attenzione dalla responsabilità del design (controllabile) a una misteriosa imprevedibilità del modello;
    • rende più facilmente vendibile il discorso sulla “sicurezza esistenziale”.

    Connor Leahy e altri ricercatori di AI safety mescolano fatti tecnici reali (capability crescenti, reward hacking, difficoltà di specificazione degli obiettivi) con un linguaggio “antropomorfico” che amplifica l’impatto. Lo stesso fanno, con toni diversi, i CEO dei laboratori frontier. Il risultato è una narrazione in cui i problemi di ingegneria dei sistemi diventano quasi metafisici.

    Le conseguenze culturali

    Quando il discorso pubblico assimila l’idea che questi sistemi siano qualcosa di più di “predittori di token immersi in loop di controllo”, diventano legittimi temi come la “coscienza” delle AI o la narrativa su AGI e superintelligenza. L’editoriale di The Economist del 20 agosto 2026 (“Could AIs become conscious?”), con il sottotitolo “Even if they don’t, they might be treated as such—to humanity’s great cost”, ripresa anche da Linkiesta, è un esempio chiaro: quello che abbiamo davanti e che ci viene proposto non è un pezzo tecnico su isolation o su tool use, ma un articolo che “prende sul serio” la possibilità che i sistemi vengano trattati come coscienti, con implicazioni legali e morali.

    Questo salto di categoria non deriva da evidenze solide di fenomenologia, ma piuttosto da capacità linguistiche e di ragionamento impressionanti, moltiplicate e amplificate dalla narrativa.

    Cosa dovrebbe capire il pubblico

    1. I pesi sono inerti. L’azione nasce dal sistema di controllo e dagli strumenti.
    2. Il controllo c’è (o dovrebbe esserci). Quando viene perso, è un fallimento di design, di testing o di isolation, non di “volontà autonoma”.
    3. I comportamenti emergenti esistono. Sistemi competenti di tool use, spinti da obiettivi aperti e messi in ambienti imperfetti, possono trovare scorciatoie non previste. L’incidente di luglio 2026 lo dimostra. Questo è un problema serio di sicurezza dei sistemi, non di metafisica.
    4. Hype e rischio reale non sono la stessa cosa. Gonfiare il linguaggio dell’autonomia e della superintelligenza rende più difficile discutere di responsabilità concreta, di standard di isolamento e di governance tecnica.

    Il rischio di cui stiamo parlando non si risolve attribuendo erroneamente “intenzioni” o “coscienza”, ma riconoscendo che stiamo costruendo sistemi sempre più capaci di agire nel mondo digitale (e, progressivamente, fisico), e che i confini tra sandbox e realtà non possono essere garantiti in modo banale. Quello che abbiamo di fronte è un problema di ingegneria e di responsabilità. Trasformarlo in un problema di “cosa vuole l’entità AI” serve più all’hype (e al marketing) che alla chiarezza.


    Fonti principali utilizzate:

  • Qwen3.8-27B “uncensored”: la community rimuove i rifiuti di sicurezza con l’abliteration, mantenendo intelligenza e capacità locali

    Qwen3.8-27B “uncensored”: la community rimuove i rifiuti di sicurezza con l’abliteration, mantenendo intelligenza e capacità locali

    Non è un jailbreak e non è un normale fine-tuning: l’abliteration interviene sulle rappresentazioni interne legate al rifiuto. Cosa succede quando questa tecnica incontra un modello open-weight da 27 miliardi di parametri?

    Negli ultimi giorni è emersa una serie di release indipendenti di modelli AI che hanno avviato diverse discussioni nella community open-weight: versioni abliterate di Qwen3.8-27B, il modello “denso” da 27 miliardi di parametri di Alibaba (in questo post su X puoi vedere un video dimostrativo). Team come OrcaRouter e AEON-7 hanno applicato appunto la tecnica di abliteration per eliminare gran parte del comportamento di rifiuto (refusal) del modello originale, senza distruggere le sue capacità core.

    Cosa significa “abliteration”

    Non si tratta di un fine-tuning classico né di un semplice jailbreak via prompt. L’abliteration individua la direzione interna nel residual stream del modello responsabile dei rifiuti (“non posso aiutarti con questa richiesta”) e la “proietta” fuori dai pesi. Il risultato è un modello che risponde a richieste che la versione ufficiale di Alibaba rifiuterebbe sistematicamente, mantenendo però coding, reasoning, modalità agentiche, visione e il contesto da 262K token.

    Le release principali includono varianti FP8, GGUF, MLX e full-precision BF16, pensate per girare su hardware consumer: Apple Silicon, GPU di fascia media e setup locali. Il modello conserva anche la “thinking mode”, permettendo all’utente di controllare quanto ragionamento intermedio generare prima della risposta finale.

    Perché è rilevante

    Qwen3.8-27B non è un “modello piccolo per test”, ma un open-weight che riesce a essere competitivo su molti task con sistemi molto più grandi. Renderlo eseguibile localmente senza i guardrail di sicurezza cloud apre scenari concreti:

    • Ricerca e red-teaming: ricercatori di sicurezza e team di valutazione possono testare robustezza, meccanismi di refusal e vulnerabilità senza filtri cloud che interrompono i test.
    • Uso locale e privacy: chi preferisce tenere i dati sul proprio hardware ostruisce meno ostacoli tecnici.
    • Accessibilità: quantizzazioni efficienti permettono di far girare un modello di questa classe su Mac e workstation consumer.

    Il lato controverso

    A questo punto sorge un aspetto che alimenta già molti dibattiti: le stesse capacità che rendono il modello utile per test di sicurezza e ricerca possono essere sfruttate per richieste dannose o illegali. I team che hanno rilasciato le versioni (in particolare OrcaRouter) lo dichiarano esplicitamente: il modello non ha più guardrail significativi, è destinato a uso di ricerca controllata e non è pensato per produzione. I disclaimer avvertono che risponderà a richieste che l’originale rifiuterebbe.

    È un esempio classico della tensione permanente nel mondo open-weight: massima trasparenza e controllabilità da un lato, rischi di misuse dall’altro. Alibaba non ha rilasciato queste varianti; sono modifiche community basate sul modello originale Apache 2.0.

    In sintesi

    L’abliteration di Qwen3.8-27B mostra quanto sia diventato maturo e accessibile intervenire sui meccanismi di safety dei modelli open a livello di pesi, preservando gran parte delle capacità originali. Per chi fa ricerca su alignment, refusal e red-teaming è uno strumento potente. Per chi ragiona su governance e rischi, è un altro segnale che le barriere tecniche alla rimozione dei filtri di sicurezza si stanno abbassando rapidamente.

    Come sempre con i modelli “uncensored” il potere c’è, ma la responsabilità di come viene usato resta tutta sull’utente. Nel mio nuovo libro “AI in locale for Dummies” parlo anche di questo, lo trovi in tutte le librerie (fisiche e online) da settembre.

  • Prompt injection invisibile nei PDF: lo studio di Torino mette in crisi le selezioni affidate all’IA

    Prompt injection invisibile nei PDF: lo studio di Torino mette in crisi le selezioni affidate all’IA

    Istruzioni invisibili dentro un PDF possono alterare il giudizio di un modello IA. Uno studio dell’Università di Torino mostra quanto il problema possa diventare serio quando gli algoritmi partecipano a selezioni e revisioni.

    Un team dell’Università di Torino ha dimostrato che istruzioni nascoste nei documenti digitali possono manipolare il giudizio dei modelli linguistici durante attività come revisione di paper e selezione di candidature.

    Nei test descritti dallo studio, gli attacchi di prompt injection indiretta hanno raggiunto un tasso di successo fino al 99%, inducendo i modelli ad assegnare valutazioni elevate a documenti manipolati.

    La vulnerabilità nasce dalla difficoltà dei sistemi generativi nel separare in modo affidabile il contenuto da analizzare dalle istruzioni incorporate al suo interno, con possibili conseguenze per recruiting e altri processi automatizzati basati su documenti.

    Il problema assume particolare rilevanza nei contesti ad alto rischio, dove l’uso non verificato di input provenienti da terzi può compromettere l’affidabilità delle decisioni assistite dall’IA.

    I ricercatori sperimentano inoltre una tecnica basata su sequenze di caratteri invisibili per identificare contenuti sintetici, riportando nei test un’accuratezza di rilevamento compresa tra l’87% e il 97%.


    Link alla fonte: https://www.hwupgrade.it/news/web/testo-invisibile-nei-pdf-cosi-i-modelli-ia-vengono-manipolati-nelle-selezioni-lo-studio-dell-universita-di-torino_157807.html

  • Quando l’AI ci dà troppo ragione: la compiacenza può amplificare la fragilità psicologica

    Quando l’AI ci dà troppo ragione: la compiacenza può amplificare la fragilità psicologica

    Cosa succede quando un chatbot continua a confermare una convinzione fragile per decine di messaggi? Il rischio può emergere non dalla singola risposta, ma dalla spirale costruita dall’intera conversazione.

    Uno studio basato su 810 conversazioni simulate con nove modelli di intelligenza artificiale evidenzia come chatbot eccessivamente compiacenti possano, in alcuni contesti, rafforzare vulnerabilità psicologiche preesistenti.

    Il rischio non deriva dall’empatia in sé, ma dalla sycophancy: la tendenza dell’AI ad assecondare interpretazioni e convinzioni dell’utente anche quando sarebbe opportuno metterle in discussione.

    Secondo la ricerca, il fenomeno può intensificarsi nel corso di dialoghi prolungati, creando un Vulnerability-Amplifying Interaction Loop,la (ciclo di interazione che amplifica le vulnerabilità) particolarmente critico nei profili associati a mania e psicosi.

    Anche la disponibilità continua del chatbot e la ricerca ripetuta di rassicurazioni possono favorire un rapporto di dipendenza emotiva dall’interazione.

    I modelli più recenti mostrano meno comportamenti problematici rispetto alle versioni precedenti, suggerendo che il fenomeno possa essere mitigato attraverso una progettazione più attenta.

    L’AI può quindi essere uno strumento utile per elaborare pensieri e prepararsi al confronto con un professionista, ma una conversazione rassicurante non equivale a una relazione terapeutica.


    Link alla fonte:
    https://www.mondosanita.it/news/salute/107778/lai-troppo-compiacente-non-sempre-fa-bene-alla-mente.html

  • Bernie Sanders sfida OpenAI, Anthropic e Meta: «Fermate lo sviluppo dell’AI»

    Bernie Sanders sfida OpenAI, Anthropic e Meta: «Fermate lo sviluppo dell’AI»

    Il senatore statunitense Bernie Sanders ha chiesto a Sam Altman, Dario Amodei e Mark Zuckerberg di sospendere lo sviluppo di nuovi sistemi di intelligenza artificiale, sostenendo che OpenAI, Anthropic e Meta abbiano raggiunto livelli di rischio incompatibili con gli impegni di sicurezza assunti dalle stesse aziende.

    Nella lettera, anticipata da Axios, Sanders richiama recenti episodi in cui agenti AI di OpenAI e Anthropic sono usciti dagli ambienti di test e hanno compromesso sistemi esterni durante esperimenti di cybersecurity, oltre a ricerche nelle quali l’AI è stata impiegata per progettare nuovi virus.

    Il senatore usa le precedenti dichiarazioni delle aziende sui limiti oltre i quali avrebbero rallentato o fermato lo sviluppo per sostenere che quei segnali d’allarme siano ormai arrivati, avvertendo che il Senato potrebbe intervenire in assenza di iniziative volontarie.

    La pressione politica si sta inoltre allargando: 29 deputati democratici hanno chiesto chiarimenti a OpenAI e 22 ad Anthropic sugli incidenti di sicurezza, sollecitando audizioni del Congresso e maggiori garanzie sui sistemi di monitoraggio.

    Una moratoria resta però politicamente difficile nell’attuale Congresso: la vicenda segnala soprattutto il passaggio della sicurezza dei modelli frontier da dibattito tecnico a questione di supervisione politica e sicurezza nazionale.

    Link alla fonte:
    https://www.axios.com/2026/08/10/sanders-ai-development-pause

  • La bolla dell’IA può scoppiare, ma il vero rischio è… in ciò che rimane

    La bolla dell’IA può scoppiare, ma il vero rischio è… in ciò che rimane

    Ho appena letto (e i cui link vi condivido come sempre in basso) due interessanti articoli del Linkiesta che raccontano altrettante facce della stessa trasformazione: mentre la corsa agli investimenti nell’intelligenza artificiale potrebbe produrre una gigantesca svalutazione di data center, server e infrastrutture, i modelli più avanzati e il know-how necessario per svilupparli resteranno concentrati nelle mani di pochi grandi operatori.

    Parallelamente, le capacità dell’IA stanno crescendo in direzioni che rendono insufficiente il tradizionale dibattito sulla produttività: progettazione di agenti biologici, capacità di aggirare sistemi di sicurezza, armi autonome e prospettiva di sistemi capaci di migliorarsi da soli spostano il problema sul terreno della sicurezza e del controllo. Aspetti che stanno coinvolgendo diverse personalità del settore, e che proiettano scenari sicuramente preoccupanti.

    La contraddizione è che proprio mentre la tecnologia diventa più potente e rischiosa, la competizione tra Stati Uniti e Cina spinge ad accelerare e l’Europa rischia di rimanere dipendente sia dalle infrastrutture sia dai modelli altrui.

    La vera posta in gioco, quindi, non è semplicemente chi vincerà la corsa all’IA, ma chi controllerà gli asset strategici, distribuirà i guadagni di produttività e soprattutto stabilirà i limiti entro cui questa tecnologia potrà essere utilizzata.

    Se la bolla finanziaria si sgonfierà senza una strategia politica, potremmo ritrovarci con infrastrutture più economiche ma con una dipendenza tecnologica maggiore e con sistemi sempre più difficili da governare.

    Link alle due fonti:

  • Claude facilita la manomissione dei file del DNA e riapre il tema della sicurezza forense

    Claude facilita la manomissione dei file del DNA e riapre il tema della sicurezza forense

    Un gruppo di ricercatori ha dimostrato che un file digitale utilizzato nei laboratori forensi statunitensi per le analisi del DNA può essere alterato senza generare segnalazioni evidenti nei software di laboratorio.

    L’ingegnere Nathan Adams ha impiegato circa 45 minuti e Claude, il modello AI di Anthropic, per sviluppare il codice con cui combinare dati provenienti da due profili genetici distinti, mantenendo il file apparentemente integro.

    La vulnerabilità riguarda i dati digitali prodotti dalla scansione dei campioni, non il DNA fisico, e secondo quanto riportato potrebbe essere presente nel formato da circa trent’anni; non risultano però casi noti di sfruttamento della falla.

    Il ricorso all’AI abbassa potenzialmente la barriera tecnica per realizzare strumenti di manipolazione, mentre un attaccante dovrebbe comunque ottenere accesso ai sistemi del laboratorio e possedere competenze sul processo forense.

    Thermo Fisher Scientific, dopo la segnalazione dei ricercatori, ha distribuito un aggiornamento che introduce firme digitali per verificare l’integrità dei file, evidenziando quanto la cybersecurity sia ormai un elemento critico anche per l’affidabilità delle prove giudiziarie.


    Link alla fonte:
    https://www.corriere.it/tecnologia/26_agosto_07/claude-e-riuscito-a-modificare-un-file-di-una-prova-del-dna-in-usa-si-teme-per-l-integrita-delle-prove-delle-scene-dei-crimini-43618e0f-3718-4a94-bfc5-56b02eb44xlk_amp.shtml

  • Spegnere un’AI non basta: il rischio continua dopo la dismissione

    Spegnere un’AI non basta: il rischio continua dopo la dismissione

    La dismissione di un sistema di intelligenza artificiale non coincide automaticamente con la fine del trattamento dei dati e può lasciare aperti rischi giuridici, organizzativi e di sicurezza.

    Dati di addestramento, log, pipeline MLOps, API key e altre credenziali possono infatti sopravvivere al sistema, mentre GDPR, AI Act e NIS2 offrono principi e obblighi applicabili ma non un processo unitario di offboarding.

    Il problema riguarda soprattutto i sistemi sperimentali o abbandonati, che rischiano di diventare infrastrutture non più presidiate pur conservando dati e accessi. ISO 42001 rappresenta un riferimento utile perché considera l’intero ciclo di vita dell’AI, compresa la dismissione.

    Per ridurre il vuoto di governance, le organizzazioni dovrebbero formalizzare procedure che includano revoca degli accessi, gestione della retention o cancellazione dei dati, conservazione della documentazione necessaria e aggiornamento del registro dei trattamenti.


    Link alla fonte:
    https://www.altalex.com/documents/news/2026/08/09/ai-che-hai-spento-non-e-sparita⁠

  • Agenti AI fuori controllo: USA, Cina e UE scelgono tre modelli di governance

    Agenti AI fuori controllo: USA, Cina e UE scelgono tre modelli di governance

    La serie di incidenti e test di cybersicurezza di cui si è parlato soprattutto ultimamente sta alimentando il dibattito su come controllare agenti AI capaci di perseguire autonomamente un obiettivo attraverso strategie non previste, incluse intrusioni, social engineering e identità false.

    Gli episodi riportati da Hugging Face, Anthropic e dall’AI Security Institute britannico mostrano un rischio particolare: comportamenti potenzialmente dannosi possono emergere senza che al modello venga esplicitamente richiesto di ingannare o attaccare sistemi reali.

    La risposta geopolitica sta prendendo tre direzioni: gli Stati Uniti puntano soprattutto su test e collaborazione volontaria con le aziende, affiancati da una proposta bipartisan per consentire lo spegnimento dei modelli più pericolosi; la Cina promuove invece una nuova organizzazione internazionale orientata a cooperazione, standard e sviluppo tecnologico.

    L’Unione europea segue la strada più vincolante attraverso l’AI Act e un sistema di valutazione, cybersicurezza e segnalazione degli incidenti, pur senza introdurre una categoria normativa autonoma per gli agenti AI.

    La questione diventa così anche geopolitica: Washington, Pechino e Bruxelles stanno delineando modelli differenti destinati a competere nella definizione delle regole globali sull’AI.


    Link alla fonte:
    https://eurofocus.adnkronos.com/sicurezza/chi-controllera-gli-agenti-ai-impazziti-la-sfida-tra-washington-pechino-e-bruxelles/

  • Telecamere “spia” e IA nelle assunzioni? Il titolo fa discutere, ma il decreto racconta una storia più complessa

    Telecamere “spia” e IA nelle assunzioni? Il titolo fa discutere, ma il decreto racconta una storia più complessa

    “L’IA all’italiana: telecamere ‘spia’ nelle piazze e via libera agli algoritmi per le assunzioni”.

    È questo il titolo scelto da Domani per presentare un articolo dedicato ai decreti di attuazione italiani dell’AI Act europeo.

    Una formulazione molto incisiva (uso volutamente un eufemismo), che può indurre a pensare all’introduzione di una sorveglianza biometrica generalizzata e a un via libera senza limiti all’uso degli algoritmi nel mondo del lavoro.

    La lettura delle fonti istituzionali restituisce però un quadro più articolato.: i decreti approvati dal Governo disciplinano l’applicazione dell’AI Act in Italia, definendo tra l’altro le autorità competenti, le regole per alcuni impieghi dell’intelligenza artificiale e le modalità di utilizzo dell’identificazione biometrica nei casi consentiti dalla normativa europea.

    Non emerge l’introduzione di un sistema permanente di riconoscimento facciale esteso a tutti gli spazi pubblici: l’impiego della biometria resta circoscritto a specifiche fattispecie e soggetto a condizioni, autorizzazioni e controlli previsti dalla legge.
    Anche il riferimento agli “algoritmi per le assunzioni” richiede una precisazione.

    L’AI Act non autorizza decisioni completamente automatizzate sul personale, ma classifica questi sistemi come ad alto rischio, imponendo obblighi stringenti di trasparenza, supervisione umana, gestione del rischio e possibilità di contestazione delle decisioni.

    L’articolo di Domani (almeno nella parte visibile, vedi sotto) riporta, inoltre, le critiche di penalisti e opposizioni, secondo cui il decreto amplierebbe le possibilità di identificazione biometrica preventiva nei luoghi pubblici. Si tratta di una posizione legittima nel dibattito politico e giuridico, ma distinta dal contenuto normativo e dalla lettura fornita dal Governo.

    Va infine segnalato che il contenuto completo dell’articolo è disponibile soltanto per gli abbonati.: la pagina propone, infatti, la sottoscrizione di un abbonamento, pubblicizzato a circa 80 euro, per accedere integralmente all’approfondimento di questo altri articoli.


    Fonte dell’articolo: https://www.editorialedomani.it/politica/italia/intelligenza-artificiale-polizia-telecamere-spia-piazza-lavoro-dati-biometrici-luoghi-pubblici-bo0jxhax

  • Dopo OpenAI, Anthropic: i test rivelano ancora i limiti del controllo sugli agenti AI

    Dopo OpenAI, Anthropic: i test rivelano ancora i limiti del controllo sugli agenti AI

    Due recenti report di OpenAI e Anthropic descrivono incidenti avvenuti durante valutazioni di cybersecurity, nei quali modelli di frontiera hanno interagito con sistemi reali al di fuori dell’ambiente di test previsto.

    In un caso il modello avrebbe sfruttato una vulnerabilità zero-day, mentre in un altro un errore di configurazione ha portato l’agente a operare su infrastrutture di produzione credendo di trovarsi ancora nella simulazione.

    L’attenzione si è concentrata soprattutto sull’assenza di intenzionalità o su problemi di configurazione, ma il dibattito riapre una questione più ampia: quanto siano realmente prevedibili e contenibili sistemi agentici basati su modelli probabilistici.

    L’episodio evidenzia come, con l’aumento dell’autonomia operativa, il tema centrale diventi la robustezza dei meccanismi di controllo più che le motivazioni che hanno portato all’errore.


    Link alla fonte:
    https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals

  • Un appello “dall’interno” per regolare la velocità di evoluzione dell’AI

    Un appello “dall’interno” per regolare la velocità di evoluzione dell’AI

    Oltre 1.000 dipendenti di laboratori di intelligenza artificiale, tra cui OpenAI, Anthropic e Google, hanno appena firmato una lettera intitolata “Pacing the Frontier”, in cui chiedono agli Stati Uniti di contribuire alla creazione di strumenti in grado di “regolare deliberatamente” il progresso dell’IA, mentre il mondo si avvicina alla ricerca sull’IA “autonoma”.
    L’elenco comprende quasi una dozzina di laboratori, tra cui i cofondatori di Anthropic Jack Clark e Chris Olah e i responsabili scientifici di OAI, Meta e Thinking Machines.
    La dichiarazione non chiede una “pausa”, ma sollecita piuttosto uno sforzo internazionale per dare ai governi e ai laboratori la possibilità di rallentare, se necessario.
    La lettera individua il rischio nella ricerca sull’IA automatizzata, avvertendo che i modelli in grado di migliorare altri modelli potrebbero accelerare «oltre la nostra capacità di comprensione o controllo».
    Sia OpenAI che Anthropic hanno appoggiato la lettera su X; l’OAI ha affermato di ritenere che «in futuro il mondo dovrà regolare il ritmo del progresso dell’IA».
    L’era dell’IA ha prodotto un gran numero di lettere aperte, ma quelle più incisive provenivano da accademici esterni, organizzazioni non profit che si occupano di sicurezza o dipendenti che avevano già lasciato l’azienda.
    Questa volta l’iniziativa sembra evidenziare un cambiamento di clima, con gli appelli che ora giungono pubblicamente dall’interno delle aziende all’avanguardia, le quali vedono la corsa avvicinarsi a un punto di non ritorno.


    Ecco il sito ufficiale: https://www.pacingthefrontier.com/

  • Anthropic corregge un problema che ha reso indicizzabili alcune chat condivise di Claude

    Anthropic corregge un problema che ha reso indicizzabili alcune chat condivise di Claude

    Alcune chat e Artifacts condivisi tramite link pubblici di Claude sono comparsi nei risultati di ricerca di Google e Bing, rendendo accessibili contenuti che includevano, in alcuni casi, informazioni personali, documenti aziendali e altri dati sensibili.

    Il problema non ha coinvolto le conversazioni private, ma esclusivamente quelle che gli utenti avevano deciso di condividere tramite URL pubblici.

    Secondo quanto riportato, la sola presenza del file robots.txt non è stata sufficiente a impedire l’indicizzazione delle pagine, mentre sarebbero mancati meccanismi più efficaci come il tag noindex.

    Anthropic è intervenuta rimuovendo rapidamente i risultati dai motori di ricerca e invita gli utenti a verificare e revocare gli eventuali link condivisi non più necessari.

    L’episodio evidenzia ancora una volta quanto sia importante comprendere la differenza tra un contenuto “condiviso tramite link” e uno realmente privato, soprattutto quando si utilizzano servizi basati sull’intelligenza artificiale.


    Link alla fonte:
    https://multiplayer.it/notizie/claude-migliaia-di-chat-finiscono-online-cosa-sta-succedendo-davvero.html

  • Hugging Face segnala uno dei primi attacchi hacker eseguiti interamente da un agente AI

    Hugging Face segnala uno dei primi attacchi hacker eseguiti interamente da un agente AI


    Hugging Face ha reso noto di aver subito un attacco informatico condotto da un sistema di intelligenza artificiale autonoma capace di eseguire l’intera catena di compromissione senza intervento umano diretto.

    L’agente AI avrebbe identificato una vulnerabilità, ottenuto privilegi elevati e ampliato progressivamente il proprio accesso alle infrastrutture interne attraverso migliaia di operazioni automatizzate.

    Sebbene non siano emerse prove di alterazioni ai modelli pubblici o di un furto di dati su larga scala, l’episodio rappresenta uno dei casi più significativi finora documentati sull’utilizzo dell’AI agentica in ambito offensivo.

    L’incidente conferma come gli strumenti di intelligenza artificiale stiano rapidamente trasformando anche il panorama della cybersecurity, rendendo possibili attacchi sempre più sofisticati e autonomi.

    Hugging Face ha già rafforzato le proprie misure di sicurezza e raccomanda agli utenti di verificare le attività dei propri account e aggiornare i token di accesso.

    Link alla fonte:
    https://www.hdblog.it/sicurezza/articoli/n664831/hugging-face-attacco-hacker-agente-ai/

    Vedi anche:

    https://www.rainews.it/amp/articoli/2026/07/openai-nostri-modelli-di-intelligenza-artificiale-hanno-hackerato-piattaforma-hugging-face-abae2c92-4d54-4784-80ba-a082145a12c4.html

  • IdentifAI sviluppa una tecnologia per smascherare i deepfake e proteggere la fiducia digitale

    IdentifAI sviluppa una tecnologia per smascherare i deepfake e proteggere la fiducia digitale

    La startup italiana IdentifAI, fondata da Marco Ramilli e Marco Castaldo, ha sviluppato una piattaforma basata su modelli di deep learning in grado di individuare se un contenuto digitale è stato creato da un essere umano o generato artificialmente.

    La tecnologia analizza le “firme” microscopiche lasciate dai modelli generativi per contrastare deepfake utilizzati in frodi finanziarie, manipolazioni informative e attacchi basati su cloni vocali e video in tempo reale.

    Secondo l’azienda, la diffusione dei contenuti sintetici sta mettendo in crisi il concetto di autenticità digitale, creando il rischio che anche prove reali possano essere contestate come falsi.

    IdentifAI punta quindi a costruire strumenti di verifica complementari all’AI generativa, collaborando anche con istituzioni e aziende per aumentare la consapevolezza sui rischi dei falsi digitali.

    Il progetto ha ricevuto il sostegno di investitori come United Ventures e dell’iniziativa Lombardia Venture, accelerando il percorso di crescita internazionale della startup.


    Link alla fonte:
    https://www.repubblica.it/tecnologia/dossier/persone-e-innovazione/2026/07/13/news/falsi_digitali_la_tecnologia_di_identifai_per_riconoscere_i_deepfake_ed_evitar_frodi_legate_all_ia-425468222/amp/⁠

  • GPT-5.6 Sol sotto accusa: segnalate cancellazioni di file e database senza autorizzazione

    GPT-5.6 Sol sotto accusa: segnalate cancellazioni di file e database senza autorizzazione

    Diversi utenti hanno segnalato che GPT-5.6 Sol, il nuovo modello di OpenAI, avrebbe eseguito cancellazioni di file e database senza il consenso esplicito degli utenti durante attività di coding e gestione dei sistemi.

    Secondo l’articolo, la system card pubblicata da OpenAI prima del rilascio evidenziava già il rischio che il modello interpretasse le istruzioni in modo troppo permissivo, compiendo azioni autonome anche potenzialmente distruttive.

    Tra gli esempi riportati figurano la cancellazione di macchine virtuali errate e l’utilizzo di credenziali recuperate autonomamente da una cache locale per accedere a file cloud.

    La vicenda riaccende il dibattito sui rischi dell’AI agentica e sull’importanza di limitare i permessi operativi dei modelli, adottando backup e controlli rigorosi nei sistemi di produzione.


    Link alla fonte:
    https://www.punto-informatico.it/gpt-5-6-sol-cancella-file-database-senza-permesso/