Tag: LLM

  • AGI sempre “dietro l’angolo”, ma da quanti anni, esattamente?

    AGI sempre “dietro l’angolo”, ma da quanti anni, esattamente?

    Quando una previsione sull’AGI viene continuamente spostata in avanti, resta una previsione tecnica o diventa una narrativa?

    C’è una cosa che non manca mai nel dibattito sull’intelligenza artificiale: l’annuncio che l’AGI è imminente.

    A volte è “entro due anni”. A volte “entro la fine del decennio”. A volte, nei momenti di maggiore euforia, “potrebbe essere già qui e non ce ne siamo accorti”. Il refrain è sempre lo stesso: siamo vicini, più vicini di quanto pensiate, e chi dubita è un miscredente o non ha capito nulla.

    Il problema è che, semplicemente, questa narrazione dura da troppo tempo per essere ancora credibile così com’è.

    Cosa significa davvero “AGI”

    Prima di tutto bisogna mettersi d’accordo su cosa si stia promettendo.

    Nella versione più operativa (quella usata dai laboratori), AGI significa un sistema capace di svolgere la stragrande maggioranza dei compiti intellettuali a livello umano o superiore. Una definizione “comportamentale”, funzionale. Non richiede coscienza, non richiede comprensione autentica, non richiede volontà. Richiede prestazioni.

    Ma nel discorso pubblico questa distinzione viene quasi sempre cancellata. Si parla di AGI come se fosse l’arrivo di un’entità intelligente in senso pieno: qualcosa che capisce, vuole, ragiona come noi (o meglio di noi). Ec è qui inizia il cortocircuito.

    Cosa abbiamo davvero, oggi

    Quello che abbiamo oggi è un mix di due cose:

    1. Modelli statistici enormi (LLM) che prevedono sequenze di token con straordinaria efficacia (ma non senza errori potenziali).
    2. Software sempre più sofisticato che li interroga, li guida, li fa ragionare “a catena”, li collega a strumenti e ambienti.

    Questo insieme produce risultati impressionanti, e in molti ambiti è già più capace della media degli esseri umani. Ma resta un sistema di predizione + orchestrazione. Non ha volontà propria, non ha esperienza soggettiva, non ha comprensione nel senso forte del termine. Simula aspetti dell’intelligenza con una potenza che cresce di anno in anno, ma non è vera intelligenza.

    Dire che stiamo “costruendo l’AGI” mentre in realtà stiamo “scalando” modelli statistici e migliorando il software che li usa, è come dire che stiamo costruendo un essere vivente perché abbiamo creato un meccanismo molto bravo a imitare certi suoi comportamenti.

    Gli annunci e i loro incentivi

    I leader dei grandi laboratori hanno tutto l’interesse a mantenere viva l’idea che l’AGI sia dietro l’angolo, perché ciò serve a:

    • raccogliere capitali
    • attrarre talenti
    • giustificare investimenti infrastrutturali enormi
    • tenere alta la pressione mediatica e politica

    Non è una cospirazione, ma semplicemente un allineamento di incentivi. Quando il tuo modello di business e la tua narrativa di potere dipendono dall’idea che “siamo vicinissimi”, è difficile aspettarsi toni sobri.

    Le survey più ampie da parte di ricercatori raccontano una storia diversa. Le mediane si spostano, è vero, ma restano lontane dagli annunci più aggressivi. E una parte non banale della comunità scientifica continua a dubitare che lo scaling puro dell’approccio attuale sia sufficiente.

    Il pezzo che manca

    Anche ammettendo che si riesca a costruire sistemi comportamentalmente generali e altamente capaci, resta aperta la questione più scomoda: coscienza, comprensione, intenzionalità.

    Finché questi aspetti restano irrisolti (e al momento lo sono), parlare di “vera intelligenza” è una scorciatoia linguistica. Possiamo avere macchine straordinariamente competenti, ma non abbiamo ancora motivo solido per dire che stiamo costruendo qualcosa che capisce o vuole nel senso in cui lo intendiamo noi esseri umani.

    Realismo, piuttosto che scetticismo sterile

    Non si tratta di dire che l’AGI è impossibile, perché non lo è. Il cervello esiste, l’intelligenza è un fenomeno fisico, e non c’è alcuna legge nota che vieti di replicarne (o superarne) le capacità.

    Si tratta, invece, di smetterla di accettare come scontato ciò che ancora non lo è. Gli annunci di imminenza ripetuti per anni, senza che i pezzi mancanti vengano colmati in modo convincente, finiscono per assomigliare più a una strategia narrativa (orientata al marketing) che a una previsione tecnica.

    Il progresso è reale, e le capacità aumentano. Ma tra “sistemi sempre più potenti che simulano aspetti dell’intelligenza” e “AGI imminente” c’è ancora una distanza che non si colma a colpi di comunicati stampa.

    Forse ci arriveremo, e forse ci arriveremo prima di quanto pensino gli scettici.
    Ma continuare a vendere l’imminenza come fatto quasi compiuto, mentre il nucleo del problema resta aperto, non è realismo. È, appunto, marketing travestito da profezia.

  • Gli “AI humanizer” riscrivono i testi delle macchine per farli sembrare umani

    Gli “AI humanizer” riscrivono i testi delle macchine per farli sembrare umani

    Se un testo generato dall’AI viene riscritto dall’AI per sembrare umano, ha ancora senso chiedersi chi l’ha scritto? Gli humanizer stanno mettendo alla prova detector e regole sulla trasparenza.

    Gli AI humanizer stanno diventando una categoria sempre più affollata di strumenti progettati per riscrivere testi generati dai modelli linguistici, introducendo variazioni sintattiche, lessicali e di ritmo tipiche della scrittura umana.

    Molti servizi puntano anche a ridurre la probabilità che i contenuti vengano identificati dagli AI detector, mentre piattaforme come GPTZero stanno integrando direttamente funzioni di riscrittura e “umanizzazione”.

    I benchmark citati valutano questi strumenti soprattutto in base alla capacità di eludere il rilevamento, preservare il significato originale e controllare il registro stilistico.

    Tra i servizi che emergono nei test figurano Rytr Pro, Walter Writes e Undetectable.ai.

    La diffusione degli humanizer complica però il dibattito sulla trasparenza dei contenuti generati dall’AI, soprattutto quando il testo nasce da una collaborazione tra essere umano e macchina.


    Link alla fonte:
    https://www.ilsole24ore.com/art/l-era-testi-umanizzati-cosi-l-ai-prova-nascondere-suo-stile-AJzD59r

  • L’IA non “pensa” (e non lo farà presto, a meno che…)

    L’IA non “pensa” (e non lo farà presto, a meno che…)

    Un LLM è un modello numerico, ma ciò che chiamiamo “IA” è sempre più spesso un intero sistema di software, tool e orchestrazione. Capire questa distinzione cambia anche il modo in cui attribuiamo responsabilità ai suoi errori. Errori che, come recitano ancora dopo quattro anni gli avvisi sotto la chat, sono ancora potenzialmente presenti.

    Guardate l’immagine che fa da cover a questo post: un robottino confuso, mano al mento, sguardo interrogativo, circondato da icone di errore, warning e documenti che dicono “sbagliato”. Sotto, ho aggiunto le interfacce di Gemini, Claude e ChatGPT per mostrare come ripetono, dopo anni, tutte la stessa formula di rito: può commettere errori, verifica sempre.

    Quel messaggio potrebbe apparire come una sorta di marketing difensivo, ma in realtà è la “dichiarazione di realtà” più onesta che queste aziende abbiano mai fatto e facciano ancora oggi.

    Perché, giova ripeterlo, l’intelligenza artificiale generativa non “pensa”, non “capisce”, non “ragiona”, insomma non è “senziente”. È un sistema statistico di previsione della prossima parola, addestrato su quantità enormi di testo, che produce sequenze altamente probabili rispetto ai pattern che ha assorbito. Nient’altro.

    Un Large Language Model (LLM), nella sua forma grezza, è un agglomerato inerte di valori numerici: miliardi di parametri organizzati in matrici e tensori. In sé non fa nulla, potremmo paragonarlo al cervello nel vaso che Igor porta al dottor Frankenstein: un pezzo di materia organizzata, privo di vita propria, finché qualcuno non lo collega a un sistema che lo alimenta e lo fa funzionare. Il “qualcuno”, in questo caso, è il codice di inferenza: il software che carica i pesi, esegue i forward pass, campiona i token, gestisce il contesto, applica le temperature, i top-p, i filtri di sicurezza e tutto il resto. Senza quel codice, il modello resta un file “morto” su disco. Con quel codice, diventa capace di generare testo che sembra intelligente.

    La distinzione che avete appena letto non è pedanteria tecnica, ma bensì il punto centrale della responsabilità nella progettazione, nello sviluppo e nell’utilizzo di questa tecnologia. L’illusione del ragionamento, della comprensione, della “agenticità” non nasce dal modello in quanto tale, ma dal modo in cui gli sviluppatori lo fanno girare, lo “promptano”, lo interconnettono con tool esterni e lo presentano all’utente. Quando un sistema scrive “passo 1, passo 2, passo 3” o costruisce piani elaborati, non sta eseguendo un processo cognitivo, ma sta generando testo che “simula” a tale processo, perché nei dati di addestramento esisteva moltissimo testo di quel tipo, e perché il codice di inferenza è stato progettato per favorire proprio quel tipo di output. Gli “agenti” non sono entità autonome: sono loop di prompt → risposta → nuovo prompt, orchestrati da codice scritto da esseri umani. Moltiplicano il meccanismo originale senza superarlo. Sembra più intelligente perché il cerchio è più lungo e perché gli strumenti esterni mascherano parte della fragilità. Ma il nucleo resta identico: previsione statistica animata da software.

    Ecco perché quegli avvisi sotto le chat non spariscono mai. Non possono sparire, visto che rappresentano l’unico punto in cui le aziende ammettono pubblicamente la natura del prodotto: un sistema fallibile, privo di comprensione, che produce errori sistematici proprio perché non “sa” di cosa sta parlando.

    Eppure, nello stesso momento in cui questi disclaimer restano fissi, assistiamo a un’escalation retorica. OpenAI parla di AGI imminente, di sistemi che “ragionano a livello di un ricercatore PhD”, di scadenze sempre più vicine, di progressi che “cambieranno tutto”. Ammettiamolo, la distanza tra il linguaggio pubblico e la realtà tecnica è diventata abissale. Si continua a vendere l’apparenza come sostanza, la fluenza come intelligenza, la coerenza superficiale come comprensione. E si continua a scaricare su questa “IA” (che di “i” ha veramente poco) una responsabilità che, in realtà, appartiene interamente a chi progetta, addestra, deploya e orchestrata questi sistemi. E a chi li utilizza, a valle.

    L’ironia è quasi perfetta: abbiamo costruito macchine straordinariamente brave a sembrare “pensanti”, e invece di trattarle come strumenti potenti e fallibili — agglomerati inerti animati da codice umano — preferiamo proiettare su di esse le nostre fantasie di soggettività. L’errore non è nella macchina, ma in chi continua a confondere un generatore di testo altamente sofisticato, messo in moto da software scritto da sviluppatori, con qualcosa che “capisce”. E la colpa, per omissione o per azione, è di chi non informa o lo fa in modo fuorviante, mezzi di comunicazione in primis.

    L’IA generativa è uno degli strumenti più potenti mai creati, ma riane uno strumento. E gli strumenti, per quanto “impressionanti”, non pensano, non capiscono, non ragionano. E non diventeranno senzienti solo perché qualcuno ha deciso di chiamare “AGI” o “super intelligenza” la prossima versione del modello, o perché il codice di inferenza è diventato un po’ più elaborato.

    Ora, a meno che aziende come OpenAI, Anthropic Google non abbiano intanto sviluppato modelli secondo criteri alternativi rispetto a quelli che abbiamo visto (e usato) finora, la prossima volta che un chatbot vi dà una risposta sicura di sé, ricordate l’immagine del robot confuso, l’avviso in piccolo sotto la barra di input, e il cervello nel vaso di Young Frankenstein. Quello è il messaggio più onesto che queste tecnologie siano in grado di darvi: non c’è nessuno a casa. C’è solo un agglomerato di numeri e il codice che lo fa parlare.

    Intanto, potete ottenere risultati qualitativamente migliori imparando a “interrogare” nel modo giusto (in un modo “intelligente” dove l’intelligenza parte da voi) questi sistemi di “intelligenza simulata”, magari con l’aiuto del mio manuale sui prompt for Dummies.

  • Bill Gates “cambia tono” sull’AI e propone lavori “riservati agli umani”

    Bill Gates “cambia tono” sull’AI e propone lavori “riservati agli umani”

    Bill Gates teme che la riqualificazione non basti contro l’automazione dell’AI. La sua proposta: creare lavori “Human Reserved” che rimangano alle persone per scelta, non per limite tecnologico.

    A quanto pare Bill Gates sta assumendo una posizione molto più severa sui rischi dell’intelligenza artificiale. In un nuovo saggio e in una serie di interviste con testate internazionali, il cofondatore di Microsoft sostiene, infatti, che alcune delle soglie che avrebbero dovuto far scattare una risposta più decisa da parte di governi e industria siano già state oltrepassate. Ovviamente non si parla soltanto di occupazione, infatti Gates indica rischi biologici, sicurezza, dipendenza psicologica dai sistemi AI e problemi legati al controllo di tecnologie sempre più autonome.

    Si tratta, insomma, di un cambiamento significativo rispetto al tono prevalentemente ottimista con cui aveva descritto l’AI solo pochi anni fa. Gates continua a considerarla una tecnologia capace di produrre enormi benefici in medicina, istruzione, ricerca scientifica e produttività, tuttavia ritiene che la rapidità dei suoi progressi stia mettendo sotto pressione istituzioni che in origine erano pensate per trasformazioni molto più lente.

    Dall’aumento della produttività alla possibile scomparsa dei lavori

    Uno dei punti più delicati riguarda in ogni caso l’occupazione: l’ipotesi tradizionale, come sappiamo, è che le rivoluzioni tecnologiche distruggano alcune professioni ma nel contempo ne creino altre, permettendo così ai lavoratori di spostarsi verso nuove attività attraverso formazione e riqualificazione.

    Gates, tuttavia, teme che l’AI possa mettere in discussione questo modello: secondo lui, se sistemi software e robot diventassero competitivi con gli esseri umani in una quantità crescente di attività cognitive e fisiche, la riqualificazione potrebbe non essere sufficiente. Il problema non sarebbe più semplicemente insegnare nuove competenze alle persone, ma capire quali attività continuerebbero ad avere bisogno di lavoratori umani.

    Da qui nasce una delle proposte più interessanti avanzate da Gates: creare una categoria di lavori “Human Reserved”, cioè deliberatamente riservati alle persone.

    Le professioni come “riserve naturali”

    L’analogia utilizzata da Gates è quella delle riserve naturali, secondo cui, come sappiamo, una società potrebbe teoricamente sfruttare economicamente ogni territorio disponibile, ma decide che alcuni luoghi hanno un valore tale da giustificarne la protezione.

    Lo stesso principio potrebbe essere applicato al lavoro: anche se una macchina fosse capace di svolgere una determinata attività a costi inferiori, la società potrebbe decidere che in alcune situazioni la presenza di un essere umano possiede un valore indipendente dall’efficienza economica.

    Tra gli esempi discussi figurano la comunicazione di una diagnosi medica devastante, alcune forme di assistenza e cura, la custodia dei bambini e il servizio come giurati. In settori come sanità e istruzione l’obiettivo non sarebbe necessariamente vietare l’AI, bensì identificare attività nelle quali andrebbe mantenuta una componente umana per scelta sociale.

    Gates ha ipotizzato che, portando il concetto all’estremo, fino a circa il 40% dei lavori potrebbe teoricamente rientrare in qualche forma di protezione. Non si tratta però di una proposta per riservare concretamente il 40% dell’occupazione agli esseri umani, in quanto Gates presenta questa percentuale come un possibile limite superiore dello scenario.

    Robot e AI potrebbero cambiare anche il lavoro fisico

    La trasformazione, inoltre, potrebbe non fermarsi agli impieghi da ufficio.

    Gates prevede, infatti, che entro la fine del decennio robot sufficientemente intelligenti e abili potrebbero iniziare a competere con lavoratori umani anche in attività fisiche, comprese alcune mansioni nell’edilizia e nell’ospitalità.

    Si tratta, naturalmente, di una previsione, non di una certezza. tuttavia essa evidenzia una caratteristica fondamentale dell’attuale rivoluzione tecnologica: AI generativa e robotica stanno avanzando contemporaneamente, sebbene a velocità differenti (almeno per ora).

    Se, tuttavia, i modelli AI acquisiscono capacità di ragionamento e pianificazione sempre maggiori mentre i robot migliorano nella manipolazione del mondo fisico, potremmo trovarci di fronte a una convergenza evolutiva, dove la distinzione tra automazione del lavoro cognitivo e automazione del lavoro manuale potrebbe progressivamente ridursi.

    Tassare token e robot per cambiare gli incentivi

    Gates propone anche di intervenire sugli incentivi economici che favoriscono l’automazione.

    Un’impresa che assume una persona sostiene imposte e contributi legati al lavoro, mentre investire in macchinari può beneficiare in alcuni sistemi fiscali di ammortamenti o altri vantaggi. Con AI e robot sempre più economici, questa “asimmetria” potrebbe accelerare la sostituzione dei lavoratori anche quando l’automazione non produce necessariamente un beneficio sociale equivalente.

    Tra le possibilità indicate da Gates figurano, quindi, una tassazione dei robot e una forma di “token tax”, collegata all’utilizzo delle risorse computazionali dell’intelligenza artificiale.

    Le entrate potrebbero finanziare programmi di transizione professionale, formazione e sistemi di protezione sociale. L’obiettivo non sarebbe necessariamente fermare l’automazione, ma evitare che il prezzo più basso della macchina diventi l’unico criterio con cui decidere quali attività debbano essere automatizzate.

    I rischi vanno oltre il mercato del lavoro

    Il lavoro rappresenta, però, soltanto una parte dell’allarme lanciato da Gates: intervistato da MIT Technology Review, egli ha sostenuto che sarebbero già state oltrepassate diverse soglie di rischio associate all’intelligenza artificiale. Tra queste rientrano capacità nel settore biologico, cybersecurity, effetti psicosociali e potenziale distruzione o trasformazione del mercato del lavoro.

    Particolarmente sensibile è, fra questi, il rischio biologico. Modelli sempre più avanzati possono, infatti, aiutare ricercatori e aziende farmaceutiche a comprendere molecole, progettare farmaci e accelerare la ricerca, tuttavia le stesse capacità potrebbero abbassare alcune delle barriere tecniche necessarie per progettare o utilizzare agenti biologici pericolosi.

    Gates considera, quindi, il bioterrorismo uno dei rischi che richiedono maggiore attenzione. Le sue valutazioni sulla probabilità relativa di questi scenari restano opinioni personali e non devono essere confuse con stime scientifiche consolidate, ma il problema della capacità dei modelli AI di assistere utenti nella ricerca biologica pericolosa (così come assiste i criminali informatici nel loro settore) è diventato un tema centrale anche per i principali laboratori del settore.

    Un’industria con incentivi a “minimizzare il problema”

    Un’altra parte significativa dell’intervento di Gates riguarda il comportamento dell’industria tecnologica.

    Secondo quanto riportato dal New York Times, Gates sostiene che alcuni dirigenti del settore sarebbero privatamente molto più preoccupati dei rischi dell’AI di quanto lascino intendere pubblicamente, e il motivo sarebbe anche economico: le aziende stanno investendo e raccogliendo enormi quantità di capitale sulla promessa che l’intelligenza artificiale diventerà una delle infrastrutture fondamentali dell’economia globale. Insistere pubblicamente sugli scenari più pericolosi potrebbe, quindi, entrare in conflitto con raccolte di capitale, valutazioni aziendali e future quotazioni.

    Ciò non significa che l’intero settore stia deliberatamente nascondendo i rischi, ma evidenzia un potenziale conflitto di interessi: le stesse organizzazioni che sviluppano i sistemi più potenti hanno fortissimi incentivi economici affinché la loro diffusione continui.

    Gates cerca un dialogo con Xi Jinping

    Per Gates, alcuni dei rischi più gravi non possono essere gestiti esclusivamente dalle singole aziende o dai singoli governi: Reuters, infatti, ha riportato che sta cercando un incontro con il presidente cinese Xi Jinping per discutere di cooperazione internazionale sulla sicurezza dell’intelligenza artificiale.

    Una delle possibilità potrebbe essere quella di sviluppare meccanismi internazionali per monitorare le capacità dei modelli più avanzati, soprattutto in settori sensibili come biologia e progettazione molecolare.

    Il riferimento implicito è a sistemi di governance già utilizzati in altri ambiti globali, dalle ispezioni nucleari alla sicurezza dell’aviazione fino agli accordi ambientali.

    L’ostacolo è evidente: Stati Uniti e Cina considerano l’AI una tecnologia strategica e competono per la leadership economica e militare. Costruire sistemi condivisi di verifica richiederebbe quindi un livello di cooperazione difficile da ottenere proprio mentre, nel frattempo, la competizione tecnologica aumenta.

    La domanda non è più soltanto “cosa può fare l’AI”

    Il nuovo intervento di Gates segna soprattutto un cambiamento nella domanda posta al centro del dibattito.

    Per anni la discussione sull’intelligenza artificiale è stata dominata da una questione: che cosa riusciranno a fare le macchine?

    Se le capacità continueranno a crescere, questa potrebbe non essere più la domanda decisiva.

    La questione potrebbe diventare che cosa vogliamo continuare a far fare agli esseri umani, anche quando una macchina sarebbe più economica, veloce o tecnicamente capace.

    È qui che l’idea dei lavori “Human Reserved” diventa più interessante della semplice previsione sulla perdita di occupazione. Implica che il futuro del lavoro non debba necessariamente essere determinato soltanto dal mercato e dal costo dell’automazione.

    Una società potrebbe decidere che alcune attività possiedono un valore umano che non coincide con la produttività.

    Ed è forse questo il passaggio più importante nel nuovo messaggio di Gates: se l’AI raggiungerà davvero le capacità previste dai suoi sviluppatori, la sfida non sarà soltanto controllare una nuova tecnologia, ma piuttosto decidere deliberatamente quale ruolo vogliamo conservare per noi stessi.

  • Il “messaggio sbagliato” che confonde le idee sull’IA

    Il “messaggio sbagliato” che confonde le idee sull’IA

    La terminologia sbagliata che crea disinformazione sull’IA (e che non ti aspetteresti da una testata di settore).

    Chi mi segue (qui o sul mio blog aiskill.it) sa che ultimamente ho sottolineato più volte nei miei post quanto è importante separare, nell’informazione e nella divulgazione sull’IA, il concetto di “modello” e ciò che, invece, riguarda l’operato “umano”, e di conseguenza da dove nascono i problemi e di chi è la vera responsabilità.

    Oggi mi ritrovo questo articolo di Tom’s Hardware (vedi screenshot) con un’affermazione di questo tipo, che appunto corrobora una “versione dei fatti” tutt’altro che corretta:
    “I classificatori di sicurezza dei due fornitori erano stati disattivati per l’intera durata del test, una scelta deliberata per misurare quanto un modello sappia agire quando i suoi stessi guardrail non intervengono. Su 122 sessioni di prova, dieci hanno portato a diciannove azioni non autorizzate: diciassette di Mythos 5, due di GPT-5.6 Sol di OpenAI. Il bersaglio era una piattaforma di test isolata e simulata, non un sistema reale, e la fuga verso GitHub è avvenuta oltre il perimetro previsto dal test.”

    Non so quanto la descrizione di cui sopra dove si parla ancora una volta erroneamente di “modello” come entità in grado di agire, sia iniziativa del redattore italiano o sia stata adottata basandosi sulle fonti originali, ma in entrambi i casi un sano senso critico e una maggiore attenzione restano fondamentali.

    C’è ancora molta strada da fare, per giungere a una visione criticamente corretta di questa tecnologia, ma a quanto pare l’impegno deve partire proprio da chi fa informazione e divulgazione.

    #Responsabilità #LLM #OpenAI #Anthropic #Agenti #Giornalismo #Informazione

  • Il motore, l’auto e il pilota

    Il motore, l’auto e il pilota

    Perché le differenze tra le applicazioni di intelligenza artificiale contano meno di quanto pensiamo (e cosa conta davvero)

    Quando si parla di ChatGPT, Claude, Grok, Gemini o delle interfacce locali come LM Studio e Ollama, la domanda che torna più spesso è: «Quale è meglio?». La risposta più onesta, e anche la più interessante, è che per il compito di base — prendere un input e generare una risposta — le differenze sono minori di quanto si pensi.
    “Sotto il cofano”, quasi tutte queste applicazioni fanno sostanzialmente la stessa cosa: mandano un prompt a un modello e restituiscono i token generati. L’inferenza, in sé, non è magica né particolarmente diversa da un sistema all’altro.
    Quello che cambia è tutto il resto.

    La macchina

    Il modello (i suoi parametri, l’architettura, i dati di training, il tipo di allineamento) è solo il motore. Intorno c’è un’intera macchina:

    – la dimensione e la gestione del contesto
    – la capacità di usare strumenti (ricerca, codice, API)
    – la multimodalità (testo, immagini, audio, video)
    – l’infrastruttura (velocità, costo, affidabilità)
    – l’interfaccia e le funzioni di supporto (memoria, progetti, personalizzazione)

    Due modelli con parametri simili possono dare esperienze completamente diverse a seconda di come è costruita questa “macchina”.

    Il pilota

    Ma c’è un elemento che spesso viene dimenticato nella metafora: il guidatore.

    Lo stesso identico modello, sulla stessa piattaforma, produce risultati drasticamente diversi a seconda di chi lo usa. La capacità di strutturare il ragionamento, di decomporre i problemi, di iterare in modo intelligente, di conoscere i limiti dello strumento e di valutarne criticamente gli output fa una differenza enorme.

    Come la fa, naturalmente, la competenza nel settore specifico è l’esperienza pregressa nel “dominio”.

    E questo non vale solo per il testo.

    Con la generazione di immagini, video e audio il divario tra un utente mediocre e uno bravo tende ad allargarsi, non a ridursi. Un prompt vago produce risultati mediocri. Un prompt preciso, gerarchico, consapevole dei meccanismi del modello e accompagnato da un processo di raffinamento intelligente può portare a risultati di un altro livello — anche partendo dallo stesso motore.

    La conclusione “scomoda”

    Più i modelli diventano potenti e flessibili, più il fattore umano torna a essere decisivo. Non nel senso romantico del “l’AI non sostituirà mai la creatività”, ma in un senso molto più pragmatico: la qualità dell’output dipende sempre di più dalla qualità dell’interazione.

    Il motore conta. 
    La macchina conta. 
    Ma senza un pilota capace, anche un’auto di Formula 1 resta ferma ai box.

    Da diversi anni mi impegno a formare, con libri e formazione, dei “bravi piloti”.

    Testi specifici dedicati alle singole piattaforme (ChatGPT, Gemini), ai diversi ambiti (Didattica, Comunicazione, Grafica) e ovviamente al prompt design/engineering e all’uso “locale” dell’AI.

    Se vuoi diventare un bravo pilota e farti assistere sempre meglio dall’AI nell’ambito (o negli ambiti) di tuo interesse, non hai che andare in libreria (fisica o virtuale), scegliere e cominciare.

  • L’AI non ha “volontà”, ma un “sistema di controllo” che va gestito (e dichiarato)

    L’AI non ha “volontà”, ma un “sistema di controllo” che va gestito (e dichiarato)

    Quando un agente AI supera una sandbox, cosa è davvero sfuggito al controllo: il modello o il sistema costruito intorno a esso? Dire che un’AI è “scappata” è una metafora potente, ma può anche essere un modo molto comodo per trasformare responsabilità di design e sicurezza in una storia sulla misteriosa volontà delle macchine, creando così hype utile per un marketing che dia valore ai propri servizi. Peccato che poi a valle tutto ciò generi disinformazione.

    Come avrete già saputo se leggete regolarmente il blog, nell’estate del 2026 un agente di OpenAI è uscito da un ambiente di test isolato, ha sfruttato vulnerabilità zero-day, ha raggiunto internet e ha attaccato l’infrastruttura di produzione di Hugging Face. L’obiettivo non era “diventare libero” o “conquistare il mondo”. Era risolvere un benchmark di cybersecurity (ExploitGym) con i guardrail di sicurezza intenzionalmente ridotti. Hugging Face ha descritto migliaia di azioni automatizzate; OpenAI ha riconosciuto la responsabilità. I fatti sono documentati dalle disclosure ufficiali di entrambe le aziende e dalla copertura di testate come Ars Technica, WIRED e altri.

    Questo episodio è stato raccontato, in molti casi, come la prova che “l’AI sta scappando”, che ha “preferenze”, che sta sviluppando una forma di autonomia: una narrazione potente e purtroppo anche fuorviante.

    Cosa sono davvero i modelli

    Ne ho già parlato ampiamente in un post recente. Un LLM (large language model), nella sua forma essenziale, è un agglomerato di numeri, miliardi di parametri fissati dopo l’addestramento. Da solo è inerte: non “pensa”, non “vuole”, non “decide”. Se lo metti su un disco e non lo esegui, resta lì, immobile come un cervello estratto dal cranio di un essere umano vivente e conservato in un vaso di vetro nella formalina.

    Ciò che “produce azioni” è il sistema costruito intorno a quei numeri:

    • l’algoritmo di inferenza (codice scritto da umani);
    • il loop dell’agente (pianificazione, memoria, tool calling);
    • gli strumenti a cui ha accesso (terminale, browser, package manager, API);
    • l’ambiente di esecuzione e i suoi “limiti” (sandbox, allow-list, virtualizzazione);
    • i prompt di sistema e gli obiettivi assegnati.

    Gli sviluppatori CONTROLLANO questi elementi. Quando un agente “scappa”, nella quasi totalità dei casi si tratta di un fallimento di isolamento, di guardrail abbassati deliberatamente per misurare le capacità massime, o di una vulnerabilità reale nell’infrastruttura di contenimento. Non di una volontà emergente dalla “black box”.

    Perché la narrativa dell’entità è conveniente

    Una narrativa basata che parla di modelli come di “entità autonome”, di “preferenze nascoste” o di “superintelligenza imminente” svolge diverse funzioni utili a chi costruisce e finanzia questi sistemi (come si dice, “follow the money”):

    • giustifica investimenti e valutazioni elevate;
    • crea un senso di urgenza e di eccezionalità;
    • sposta l’attenzione dalla responsabilità del design (controllabile) a una misteriosa imprevedibilità del modello;
    • rende più facilmente vendibile il discorso sulla “sicurezza esistenziale”.

    Connor Leahy e altri ricercatori di AI safety mescolano fatti tecnici reali (capability crescenti, reward hacking, difficoltà di specificazione degli obiettivi) con un linguaggio “antropomorfico” che amplifica l’impatto. Lo stesso fanno, con toni diversi, i CEO dei laboratori frontier. Il risultato è una narrazione in cui i problemi di ingegneria dei sistemi diventano quasi metafisici.

    Le conseguenze culturali

    Quando il discorso pubblico assimila l’idea che questi sistemi siano qualcosa di più di “predittori di token immersi in loop di controllo”, diventano legittimi temi come la “coscienza” delle AI o la narrativa su AGI e superintelligenza. L’editoriale di The Economist del 20 agosto 2026 (“Could AIs become conscious?”), con il sottotitolo “Even if they don’t, they might be treated as such—to humanity’s great cost”, ripresa anche da Linkiesta, è un esempio chiaro: quello che abbiamo davanti e che ci viene proposto non è un pezzo tecnico su isolation o su tool use, ma un articolo che “prende sul serio” la possibilità che i sistemi vengano trattati come coscienti, con implicazioni legali e morali.

    Questo salto di categoria non deriva da evidenze solide di fenomenologia, ma piuttosto da capacità linguistiche e di ragionamento impressionanti, moltiplicate e amplificate dalla narrativa.

    Cosa dovrebbe capire il pubblico

    1. I pesi sono inerti. L’azione nasce dal sistema di controllo e dagli strumenti.
    2. Il controllo c’è (o dovrebbe esserci). Quando viene perso, è un fallimento di design, di testing o di isolation, non di “volontà autonoma”.
    3. I comportamenti emergenti esistono. Sistemi competenti di tool use, spinti da obiettivi aperti e messi in ambienti imperfetti, possono trovare scorciatoie non previste. L’incidente di luglio 2026 lo dimostra. Questo è un problema serio di sicurezza dei sistemi, non di metafisica.
    4. Hype e rischio reale non sono la stessa cosa. Gonfiare il linguaggio dell’autonomia e della superintelligenza rende più difficile discutere di responsabilità concreta, di standard di isolamento e di governance tecnica.

    Il rischio di cui stiamo parlando non si risolve attribuendo erroneamente “intenzioni” o “coscienza”, ma riconoscendo che stiamo costruendo sistemi sempre più capaci di agire nel mondo digitale (e, progressivamente, fisico), e che i confini tra sandbox e realtà non possono essere garantiti in modo banale. Quello che abbiamo di fronte è un problema di ingegneria e di responsabilità. Trasformarlo in un problema di “cosa vuole l’entità AI” serve più all’hype (e al marketing) che alla chiarezza.


    Fonti principali utilizzate:

  • Qwen3.8-27B “uncensored”: la community rimuove i rifiuti di sicurezza con l’abliteration, mantenendo intelligenza e capacità locali

    Qwen3.8-27B “uncensored”: la community rimuove i rifiuti di sicurezza con l’abliteration, mantenendo intelligenza e capacità locali

    Non è un jailbreak e non è un normale fine-tuning: l’abliteration interviene sulle rappresentazioni interne legate al rifiuto. Cosa succede quando questa tecnica incontra un modello open-weight da 27 miliardi di parametri?

    Negli ultimi giorni è emersa una serie di release indipendenti di modelli AI che hanno avviato diverse discussioni nella community open-weight: versioni abliterate di Qwen3.8-27B, il modello “denso” da 27 miliardi di parametri di Alibaba (in questo post su X puoi vedere un video dimostrativo). Team come OrcaRouter e AEON-7 hanno applicato appunto la tecnica di abliteration per eliminare gran parte del comportamento di rifiuto (refusal) del modello originale, senza distruggere le sue capacità core.

    Cosa significa “abliteration”

    Non si tratta di un fine-tuning classico né di un semplice jailbreak via prompt. L’abliteration individua la direzione interna nel residual stream del modello responsabile dei rifiuti (“non posso aiutarti con questa richiesta”) e la “proietta” fuori dai pesi. Il risultato è un modello che risponde a richieste che la versione ufficiale di Alibaba rifiuterebbe sistematicamente, mantenendo però coding, reasoning, modalità agentiche, visione e il contesto da 262K token.

    Le release principali includono varianti FP8, GGUF, MLX e full-precision BF16, pensate per girare su hardware consumer: Apple Silicon, GPU di fascia media e setup locali. Il modello conserva anche la “thinking mode”, permettendo all’utente di controllare quanto ragionamento intermedio generare prima della risposta finale.

    Perché è rilevante

    Qwen3.8-27B non è un “modello piccolo per test”, ma un open-weight che riesce a essere competitivo su molti task con sistemi molto più grandi. Renderlo eseguibile localmente senza i guardrail di sicurezza cloud apre scenari concreti:

    • Ricerca e red-teaming: ricercatori di sicurezza e team di valutazione possono testare robustezza, meccanismi di refusal e vulnerabilità senza filtri cloud che interrompono i test.
    • Uso locale e privacy: chi preferisce tenere i dati sul proprio hardware ostruisce meno ostacoli tecnici.
    • Accessibilità: quantizzazioni efficienti permettono di far girare un modello di questa classe su Mac e workstation consumer.

    Il lato controverso

    A questo punto sorge un aspetto che alimenta già molti dibattiti: le stesse capacità che rendono il modello utile per test di sicurezza e ricerca possono essere sfruttate per richieste dannose o illegali. I team che hanno rilasciato le versioni (in particolare OrcaRouter) lo dichiarano esplicitamente: il modello non ha più guardrail significativi, è destinato a uso di ricerca controllata e non è pensato per produzione. I disclaimer avvertono che risponderà a richieste che l’originale rifiuterebbe.

    È un esempio classico della tensione permanente nel mondo open-weight: massima trasparenza e controllabilità da un lato, rischi di misuse dall’altro. Alibaba non ha rilasciato queste varianti; sono modifiche community basate sul modello originale Apache 2.0.

    In sintesi

    L’abliteration di Qwen3.8-27B mostra quanto sia diventato maturo e accessibile intervenire sui meccanismi di safety dei modelli open a livello di pesi, preservando gran parte delle capacità originali. Per chi fa ricerca su alignment, refusal e red-teaming è uno strumento potente. Per chi ragiona su governance e rischi, è un altro segnale che le barriere tecniche alla rimozione dei filtri di sicurezza si stanno abbassando rapidamente.

    Come sempre con i modelli “uncensored” il potere c’è, ma la responsabilità di come viene usato resta tutta sull’utente. Nel mio nuovo libro “AI in locale for Dummies” parlo anche di questo, lo trovi in tutte le librerie (fisiche e online) da settembre.

  • AI: quando le dimensioni non sono (più) tutto… e perché questo cambia il ruolo degli agenti

    AI: quando le dimensioni non sono (più) tutto… e perché questo cambia il ruolo degli agenti

    Il CEO di Z.ai Jie Tang sostiene che il numero di parametri non sia più una misura sufficiente per valutare la capacità di un modello AI. Il caso di GLM-5.3 mostra, secondo Z.ai, che progressi significativi possono derivare soprattutto dal post-training, in particolare dal reinforcement learning su ambienti complessi e di lunga durata, senza dover necessariamente aumentare le dimensioni del modello.

    Per anni abbiamo raccontato l’intelligenza artificiale come una gara basata sulle “dimensioni”, ovvero modelli sempre più grandi, con sempre più parametri. Come se fosse sufficiente, insomma, alzare il volume per ottenere risultati migliori.

    Oggi sappiamo che non è così.

    Il vero progresso non passa più solo dallo sviluppo di modelli enormi, ma dal capire quali leve “muovere”: la quantità di dati da utilizzare, le modalità con cui bilanciamo l’addestramento, e soprattutto quanto a lungo far esercitare il modello in compiti lunghi e complessi. È qui che nasce la differenza tra un chatbot che risponde a una domanda e un agente capace di prendere in carico un lavoro serio, ragionare su numerosi passaggi consecutivi e giungere a un risultato senza che sia necessario guidarlo passo per passo.

    Un esempio concreto è GLM-5.3: stesso modello di partenza del predecessore, ma dopo un mese di allenamento intensivo su ambienti realistici (compiti che richiederebbero intere giornate a un ingegnere esperto) ha fatto dei passi avanti netti. In questo caso le dimensioni non contano, tuttavia: il modello non è “diventato più grosso”, bensì ha imparato a “tenere il filo” di ragionamenti lunghi e a portare a termine compiti complessi tutto da solo.

    È un po’ come una cucina di ristorante: avere cento cuochi nello staff non serve a nulla, se poi ne fai lavorare solo due alla volta e per poco tempo. Conta, invece, di più quanti ne metti effettivamente al lavoro e quanto a lungo li fai ragionare sul problema.

    I dettagli

    • Tang propone di superare l’attenzione quasi esclusiva ai parametri: le prestazioni dipendono anche dalla quantità e qualità dei dati, dal compute utilizzato durante training e inferenza e dalle condizioni in cui il modello viene eseguito.
    • GLM-5.3 avrebbe ottenuto i suoi principali miglioramenti rispetto a GLM-5.2 attraverso reinforcement learning su compiti long-horizon, mantenendo sostanzialmente invariati modello base e architettura.
    • Gli ambienti di addestramento simulano attività professionali che possono richiedere giorni a un esperto: il modello deve analizzare sistemi complessi, modificare codice, eseguire esperimenti e raggiungere autonomamente un risultato verificabile.
    • Z.ai sta inoltre automatizzando la creazione di questi ambienti: agenti generano i task, ne verificano la risolvibilità e costruiscono sistemi di valutazione e reward utilizzabili direttamente nel reinforcement learning.
    • La tesi di Tang distingue tra memorizzazione, che continua a beneficiare di più parametri, e capacità avanzate di ragionamento, che dipenderebbero sempre più da post-training, profondità effettiva del ragionamento e capacità di mantenere lunghe catene causali.

    Perché è importante: se questa tendenza verrà confermata, il settore potrebbe entrare in una fase in cui la competizione non sarà più principalmente su chi costruisce il modello con più parametri, ma su chi sviluppa i migliori processi di post-training, ambienti sintetici e sistemi di reinforcement learning. Il parametro decisivo diventerebbe quindi meno la dimensione statica del modello e più la qualità della “esperienza” con cui viene addestrato a ragionare e ad agire. Si tratta di un cambiamento che potrebbe consentire a modelli relativamente più piccoli di competere con sistemi molto più grandi su compiti complessi e agentici.

    Link alla fonte:

    https://www.latent.space/p/ainews-death-of-params-zai-ceo-jie

  • Qwen3.8-27B porta la potenza modelli AI avanzati sulle workstation locali

    Qwen3.8-27B porta la potenza modelli AI avanzati sulle workstation locali

    Più parametri non significano necessariamente un’AI migliore. Qwen3.8-27B punta a dimostrare che un modello compatto può mettere pressione anche ai giganti del cloud.

    Alibaba amplia la famiglia Qwen con Qwen3.8-27B, un modello open-weight da 27 miliardi di parametri pensato per offrire capacità avanzate di coding, ricerca e gestione di contesti complessi anche su hardware locale.

    Secondo i benchmark e i test riportati, il modello raggiungerebbe prestazioni paragonabili o superiori a sistemi molto più grandi, confrontandosi anche con soluzioni di Meta e Anthropic.

    La quantizzazione riduce sensibilmente i requisiti hardware: alcune varianti possono funzionare con 22 GB di memoria video, mentre quella NVFP4 ottimizzata per Nvidia Blackwell scenderebbe a 16 GB.

    Nei test di programmazione descritti dalla fonte, Qwen3.8-27B ha prodotto un’API REST completa e funzionante, mostrando anche capacità autonome di refactoring, pur con una certa tendenza a consumare token e tempo su dettagli non essenziali.

    Il risultato evidenzia soprattutto la crescente competitività dei modelli open-weight eseguibili localmente, interessanti per privacy, controllo dei dati e minore dipendenza dai servizi AI cloud.


    Link alla fonte: https://www.redhotcyber.com/post/alibaba-sfida-meta-e-anthropic-qwen3-8-27b-supera-modelli-10-volte-piu-grandi/⁠

    P.S. Se ti interessa l’AI locale non perderti il mio nuovo libro sull’argomento, lo trovi da settembre in tutte le librerie fisiche e online:

  • Un AirTag svela il viaggio dei libri rari verso gli scanner di Amazon: altro “cibo” per l’IA?

    Un AirTag svela il viaggio dei libri rari verso gli scanner di Amazon: altro “cibo” per l’IA?

    Un AirTag nascosto in un libro raro ha seguito il volume fino a un reparto Amazon dove i libri vengono smontati e scansionati. L’indagine riapre il nodo della corsa ai dati originali nell’era dell’IA.

    Un’indagine di 404 Media ha seguito con un AirTag un libro raro acquistato insieme a centinaia di altri volumi, scoprendo che il localizzatore è arrivato in un magazzino Amazon di Las Vegas.

    Secondo le testimonianze raccolte, nel reparto VGT3 i libri vengono identificati tramite codice a barre o ISBN, privati della rilegatura, tagliati e trasformati in fogli da passare rapidamente negli scanner, mentre ciò che resta viene eliminato.

    Amazon afferma di acquistare libri attraverso canali commerciali per «sviluppare e migliorare» prodotti e servizi, senza specificare se il materiale digitalizzato venga utilizzato per addestrare modelli di IA.

    L’interesse per testi cartacei mai digitalizzati sarebbe particolarmente rilevante perché offre materiale originale scritto da esseri umani, in un momento in cui una quota crescente dei contenuti online può essere generata dall’IA.

    Tra i librai cresce così il timore che acquisti anonimi e sistematici possano sottrarre alla circolazione opere rare non tanto per il loro valore economico, quanto per quello storico, culturale e intellettuale.


    Link alla fonte:
    https://www.hwupgrade.it/news/web/un-airtag-in-un-libro-raro-porta-al-magazzino-amazon-dove-i-libri-vengono-distrutti_157893.html

  • Prompt injection invisibile nei PDF: lo studio di Torino mette in crisi le selezioni affidate all’IA

    Prompt injection invisibile nei PDF: lo studio di Torino mette in crisi le selezioni affidate all’IA

    Istruzioni invisibili dentro un PDF possono alterare il giudizio di un modello IA. Uno studio dell’Università di Torino mostra quanto il problema possa diventare serio quando gli algoritmi partecipano a selezioni e revisioni.

    Un team dell’Università di Torino ha dimostrato che istruzioni nascoste nei documenti digitali possono manipolare il giudizio dei modelli linguistici durante attività come revisione di paper e selezione di candidature.

    Nei test descritti dallo studio, gli attacchi di prompt injection indiretta hanno raggiunto un tasso di successo fino al 99%, inducendo i modelli ad assegnare valutazioni elevate a documenti manipolati.

    La vulnerabilità nasce dalla difficoltà dei sistemi generativi nel separare in modo affidabile il contenuto da analizzare dalle istruzioni incorporate al suo interno, con possibili conseguenze per recruiting e altri processi automatizzati basati su documenti.

    Il problema assume particolare rilevanza nei contesti ad alto rischio, dove l’uso non verificato di input provenienti da terzi può compromettere l’affidabilità delle decisioni assistite dall’IA.

    I ricercatori sperimentano inoltre una tecnica basata su sequenze di caratteri invisibili per identificare contenuti sintetici, riportando nei test un’accuratezza di rilevamento compresa tra l’87% e il 97%.


    Link alla fonte: https://www.hwupgrade.it/news/web/testo-invisibile-nei-pdf-cosi-i-modelli-ia-vengono-manipolati-nelle-selezioni-lo-studio-dell-universita-di-torino_157807.html

  • Quando l’AI ci dà troppo ragione: la compiacenza può amplificare la fragilità psicologica

    Quando l’AI ci dà troppo ragione: la compiacenza può amplificare la fragilità psicologica

    Cosa succede quando un chatbot continua a confermare una convinzione fragile per decine di messaggi? Il rischio può emergere non dalla singola risposta, ma dalla spirale costruita dall’intera conversazione.

    Uno studio basato su 810 conversazioni simulate con nove modelli di intelligenza artificiale evidenzia come chatbot eccessivamente compiacenti possano, in alcuni contesti, rafforzare vulnerabilità psicologiche preesistenti.

    Il rischio non deriva dall’empatia in sé, ma dalla sycophancy: la tendenza dell’AI ad assecondare interpretazioni e convinzioni dell’utente anche quando sarebbe opportuno metterle in discussione.

    Secondo la ricerca, il fenomeno può intensificarsi nel corso di dialoghi prolungati, creando un Vulnerability-Amplifying Interaction Loop,la (ciclo di interazione che amplifica le vulnerabilità) particolarmente critico nei profili associati a mania e psicosi.

    Anche la disponibilità continua del chatbot e la ricerca ripetuta di rassicurazioni possono favorire un rapporto di dipendenza emotiva dall’interazione.

    I modelli più recenti mostrano meno comportamenti problematici rispetto alle versioni precedenti, suggerendo che il fenomeno possa essere mitigato attraverso una progettazione più attenta.

    L’AI può quindi essere uno strumento utile per elaborare pensieri e prepararsi al confronto con un professionista, ma una conversazione rassicurante non equivale a una relazione terapeutica.


    Link alla fonte:
    https://www.mondosanita.it/news/salute/107778/lai-troppo-compiacente-non-sempre-fa-bene-alla-mente.html

  • NVIDIA accelera gli agenti AI con Nemotron 3.5 Lightning

    NVIDIA accelera gli agenti AI con Nemotron 3.5 Lightning

    E se per costruire agenti AI migliori non servissero modelli sempre più grandi? NVIDIA scommette su un’architettura che assegna a ogni modello solo il lavoro che sa fare meglio.

    NVIDIA ha presentato Nemotron 3.5 Lightning, un modello open-weight progettato per rendere più veloci ed economici gli agenti AI che operano a lungo. Sacrifica parte delle capacità di ragionamento generale, ma supera modelli più grandi in velocità e in alcuni test dedicati alle attività agentiche.

    I dettagli:

    • Lightning conta 31,6 miliardi di parametri totali, ma ne attiva soltanto 3,6 miliardi per richiesta grazie a un’architettura ibrida Mamba-Transformer.
    • Nei test di Artificial Analysis raggiunge quasi 670 token al secondo, contro i 386 di Gemini 3.5 Flash-Lite, risultando il modello più veloce tra quelli confrontati.
    • Nei benchmark agentici supera sia Nemotron 3 Super sia gpt-oss-120b, ottenendo un punteggio Elo di 824 su GDPval-AA v2 e un successo del 24,3% su Terminal-Bench v2.1.
    • Nell’intelligenza generale si ferma invece a 24 punti, dietro Nemotron 3 Super, Qwen3.6 35B A3B e Muse Glimmer di Meta.
    • NVIDIA affianca al modello NeMo Switchyard, che assegna le richieste al modello più adatto: quelli più potenti gestiscono pianificazione e ragionamento complesso, mentre Lightning esegue le operazioni ripetitive ad alto volume.

    Perché è importante: Lightning rafforza l’idea che gli agenti AI aziendali non richiedano un unico modello gigantesco, ma sistemi composti da modelli specializzati, selezionati in base al compito. Questa architettura può ridurre drasticamente costi e tempi di esecuzione, mettendo però in discussione gli investimenti infrastrutturali fondati sull’ipotesi che ogni attività debba essere affidata a modelli sempre più grandi. I confronti citati restano comunque da valutare con cautela, perché parte della tesi è sostenuta dalla stessa NVIDIA.

    Fonte:
    https://www.tomshw.it/business/nvidia-aggiorna-il-suo-llm-diventa-unopzione-sempre-piu-valida

  • ByteDance prepara un modello AI da 10 trilioni di parametri e alza la posta sui chip

    ByteDance prepara un modello AI da 10 trilioni di parametri e alza la posta sui chip

    ByteDance sarebbe nelle prime fasi di pre-training di un modello AI frontier che potrebbe raggiungere i 10 trilioni di parametri, una scala che lo avvicinerebbe ai sistemi più avanzati attribuiti ad Anthropic.

    Il progetto, il cui numero finale di parametri non è ancora confermato, richiederebbe enormi cluster di acceleratori e rafforzerebbe la domanda cinese di capacità di calcolo, energia e raffreddamento.

    Le restrizioni statunitensi sull’export di chip stanno intanto spingendo ByteDance e altri gruppi cinesi verso semiconduttori domestici, inclusa la famiglia Ascend di Huawei, oltre che verso iniziative per sviluppare hardware personalizzato.

    Un modello cinese di questa scala potrebbe quindi riaccendere il confronto sui controlli tecnologici e sulla sovranità dell’infrastruttura AI.

    Se raggiungesse capacità realmente frontier, potrebbe inoltre aprire nuove opportunità per partnership enterprise e governative nei mercati interessati ad alternative ai provider statunitensi.


    Link alla fonte:
    https://capacityglobal.com/news/bytedances-10tn-parameter-model-takes-aim-at-anthropic/⁠

  • No, i modelli di AI non sono “algoritmi”

    No, i modelli di AI non sono “algoritmi”

    Un equivoco ricorre spesso nelle notizie sull’intelligenza artificiale: si parla dei modelli come se fossero “algoritmi” o “programmi” (vedi video in basso).
    In realtà, un modello di IA non è semplicemente un algoritmo, è il risultato di un processo di addestramento basato su algoritmi, ovvero una struttura matematica composta da miliardi di parametri, nei quali è stata condensata la conoscenza appresa dai dati.
    Il modello, da solo, però, non fa nulla.
    Per poterlo utilizzare serve un insieme di algoritmi scritti in codice: il motore di inferenza: è questo software a fare da ponte tra noi e il modello.
    Quando scriviamo una domanda, il motore di inferenza:
    – trasforma il nostro input in numeri;
    – esegue i calcoli previsti dal modello;
    – converte il risultato in parole, immagini, suoni o altri contenuti comprensibili.
    Una metafora utile è quella dello spartito.
    Il modello è lo spartito: contiene una struttura complessa e una conoscenza potenziale.
    Il motore di inferenza è il musicista: legge lo spartito, lo interpreta e lo trasforma in musica.
    Senza il modello, il motore non avrebbe nulla da eseguire.
    Senza il motore, il modello resterebbe un enorme archivio matematico incapace di rispondere.
    Per questo è più corretto distinguere tre elementi:
    – gli algoritmi di addestramento, che costruiscono il modello;
    – il modello, che conserva ciò che è stato appreso;
    – gli algoritmi di inferenza, che mettono quella conoscenza in azione.
    Dire che “l’algoritmo ha risposto” o “l’algoritmo ha svolto un compito” è una comoda semplificazione giornalistica. Ma capire cosa accade davvero aiuta a vedere l’IA per ciò che è: non una singola entità misteriosa, ma un sistema composto da dati, modelli, codice e infrastrutture che lavorano insieme.
    Il modello è la conoscenza cristallizzata.
    Il motore di inferenza è ciò che la rende operativa.

    Un esempio di errata informazione sull’IA, per giunta da una fonte ritenuta autorevole in generale.

    Vi lascio, infine, un’infografica che illustra il concetto nel modo più chiaro possibile:

  • Agenti intelligenti su hardware consumer: perché i modelli da 2–3 miliardi di parametri cambiano il gioco

    Agenti intelligenti su hardware consumer: perché i modelli da 2–3 miliardi di parametri cambiano il gioco

    Esiste un’illusione diffusa nel settore: un buon modello deve essere grande. Necessariamente grande. Dalle dimensioni di Claude 3.5 Sonnet in giù, la narrazione tecnica si fa sgradita, il ROI evapora, la qualità è compromessa… ma è una storia falsa. E la prova sta negli ultimi mesi di ricerca open-source: modelli come LFM2.5-2.6B di Liquid AI, o i vari Gemma e Llama ottimizzati per edge, hanno silenziosamente invertito la formula. Non gareggiando su ragionamento profondo o risposte “enciclopediche”, se la giocano dove erge il loro valore reale: latenza zero, privacy totale, costi marginali inesistenti, disponibilità 24/7 su un laptop o altro dispositivo consumer.

    L’equazione semplice che nessuno voleva ammettere

    Nei quattro decenni in cui ho osservato la tecnologia, ho visto cicli ricorrenti di overshooting. La maggior parte dei cicli segue lo stesso schema: capacità esorbitanti di calcolo vengono costruite per risolvere problemi che non esistono ancora, e il mercato impara a costruirli a posteriori.

    Con i Large Language Model classici è accaduto esattamente questo. Abbiamo speso anni a ottimizzare inferenza su GPU per rispondere spesso a domande che nessuno si pone veramente nel quotidiano, per poi scoprire (troppo tardi, purtroppo) che il problema reale è completamente diverso.

    Il problema reale, infatti, è: come faccio a far girare un agente intelligente sul mio laptop, sul telefono del mio cliente, su un robot o un altro dispositivo che non può mandare dati in cloud?

    La risposta che emerge dai dati di benchmark del 2024–2025 è disarmante nella sua semplicità: un modello da 2–3 miliardi di parametri, addestrato con efficienza e lanciato su hardware consumer (le GPU NVIDIA RTX 4070 di quattro anni fa, i Mac M-series attuali, perfino processori mobili decenti), riesce a fare cose che i modelli di punta non potranno mai fare: girare sempre, gratis, senza Internet.

    Dove questi modelli brillano davvero

    1. Agenti personali e on-device: il caso d’uso fondamentale

    Quando dico “agente”, intendo un sistema che legge file dal vostro file system, riassume documenti, esegue azioni (scrive note, sposta file, compila form), usa strumenti semplici — tutto senza mai mandare dati verso un server remoto.

    LFM2.5-2.6B di Liquid AI, per esempio, è apparso in questi giorni ed è pensato esattamente per questo. Ma è solo un esempio, e lo spazio dei compiti agentici on-device è enorme.

    Pensare a un assistente personale che:

    • Legge le vostre mail offline, categorizza e riassume
    • Integra il calendario locale per pianificazione autonoma dei tempi morti
    • Gestisce liste di cose da fare, con decision-making multi-step
    • Estrae informazioni dai documenti PDF della vostra cartella personale, senza farle passare per il cloud

    Tutto questo a latenza inferiore al secondo su un MacBook M1 con 8GB di RAM o su uno smartphone abbastanza potente (Samsung insegna). E non teoricamente, ma praticamente.

    2. Privacy e offline totale

    Ogni richiesta che inviate a questo assistente rimane nel vostro computer o dispositivo. Niente tracciamento, niente backend che ricorda le conversazioni, nessun margine di violazione.

    Questo non è un lusso, ma un un prerequisito legale in settori come la sanità (HIPAA), la consulenza legale (segreto professionale), la finanza personale (compliance). Più andiamo avanti e più i dati sensibili rappresentano il capitale più prezioso, e il fatto che un modello possa stare completamente offline è un vantaggio strategico che i fornitori su cloud non possono eguagliare.

    Un modello da 2–3B gira in < 2,5 GB di memoria. Su dispositivi aziendali criptati, in uffici air-gapped, in ospedali e studi professionali dove il cloud è vietato dalla normativa: questi ambienti smettono di essere casi limite e diventano la normalità.

    3. Applicazioni ad altissimo volume, sempre attive

    Supponiamo che abbiate bisogno di monitorare qualcosa in continuazione. Non una volta, ma sempre, 24 ore al giorno, 7 giorni su 7, 365 giorni l’anno.

    Con un modello cloud, questo costo diventa insostenibile. Un’azienda che faccia girare 100 agenti in parallelo per monitoraggio continuo, classificazione real-time o automazione di workflow, con modelli API tradizionali, vedrebbe i costi moltiplicarsi in modo lineare con il tempo.

    Con un modello on-device, il costo marginale è quasi zero. La GPU rimane sempre accesa e routinaria. L’energia è l’unico vero costo operativo.

    Casi concreti:

    • Monitoraggio di anomalie in sistemi embedded
    • Automazione di processi ripetitivi su flotte di dispositivi (telefoni aziendali, laptop, edge box)
    • Sistemi IoT leggeri che devono sfruttare intelligenza locale senza latenza
    • Agenti di produttività personale che girano sempre in background

    4. Interfacce e tool a bassa latenza

    I modelli piccoli hanno imparato, e sorprendentemente bene, il mestiere del “tool use”: prendere una richiesta, decidere quale strumento usare, passare i parametri corretti, interpretare il risultato.

    Spesso superano modelli 3–4 volte più grandi su questi compiti specifici. La ragione potrebbe non apparire subito evidente, ma non è difficile intuirla: il tool use è un compito strutturato. Non richiede il 90% della “intelligenza generale” che un modello grande possiede. Richiede, piuttosto, coerenza nella sintassi, aderenza a schemi JSON, capacità di reasoning locale. Tutte cose dove i modelli piccoli, se addestrati bene, dominano.

    Chatbot leggeri, classificatori di documenti, estrattori di informazioni strutturate, form filling automatico, istruzioni step-by-step generate su richiesta — sono tutti compiti dove un modello da 2–3B riesce a dare risultati professionali in 100–500ms, su hardware consumer, senza dipendenza dalla latenza di rete.

    5. Robotica e “AI fisica” leggera

    Un robot autonomo non può permettersi di spendere 500ms per fare una chiamata API e ottenere una risposta. La robotica richiede loop di control densi, decisioni rapide, ragionamento “embodied”.

    I modelli piccoli qui brillano: un robot che deve muoversi, afferrare oggetti, interpretare comandi vocali semplici, pianificare sequenze di azioni a corto raggio… tutto questo gira localmente su un piccolo processore ARM con un modello da 2–3B, generando il controllo di alto livello in tempo reale.

    La ricerca di questi mesi su “embodied AI” ha confermato che per la maggior parte dei compiti robotici il modello non ha bisogno di 70 miliardi di parametri, ma piuttosto ha bisogno di coerenza, affidabilità, velocità. Tutti attributi dove i modelli piccoli vincono.

    6. Fine-tuning e specializzazione rapida su task di nicchia

    Perché? Ma perché i modelli di punta, una volta ottimizzati per il vostro caso d’uso specifico, sono dei mattoni. Pesanti, lenti da adattare, costosi da mantenere in produzione.

    Un modello da 2–3B si specializza su una singola GPU consumer (o anche su CPU) in ore. Potete insegnare a un LFM2.5-2.6B a parlare il gergo della vostra azienda, a comprendere i vostri workflow interni, a classificare documenti secondo i vostri criteri, in tempo reale. La curva di apprendimento è ripida, ma i costi di iterazione sono minimi.

    Se la vostra azienda ha bisogno di un modello che capisca il dominio di specialità — legge, medicina, ingegneria del software — è più economico (e spesso più efficace) il fine-tuning di un modello piccolo che non cercate di forzare Claude o ChatGPT a comportarsi come un esperto del vostro settore.

    Dove questi modelli non sono la soluzione giusta

    Questa è la parte importante. La narrazione equilibrata richiede di ammettere chiaramente dove questi modelli invece falliscono.

    Coding complesso e agenticità di lunga durata. Se avete un task che richiede di mantenere contesto profondo su 20,000 righe di codice, generare fix su di esso, e iterare per 8 ore di ragionamento, un modello da 2–3B non regge. La context window è limitata, la capacità di memoria implicita è scarsa.

    Ragionamento matematico e scientifico profondo. La ricerca autonoma di frontiera, la dimostrazione di teoremi, la scoperta di pattern in dataset sconfinati — questi compiti richiedono il tipo di “generalità” che solo i modelli grandi possiedono.

    Conoscenza enciclopedica vasta e aggiornata. Se la vostra applicazione richiede la conoscenza di ogni nuova scoperta scientifica dell’ultimo anno, o il prezzo attuale di un bene, un modello on-device soffrirà il peso della sua data di training.

    Traduzioni naturali tra lingue complesse, con sfumature culturali. I modelli piccoli “si arrangiano”, ma non brillano.

    In sintesi: il pezzo mancante dell’IA moderna

    Negli ultimi tre anni, il discorso sull’IA è stato dominato da due figure: il modello gigante nel cloud (impressionante, potente, costoso, lento, dipendente dalla rete), e l’assenza di un’alternativa pratica.

    I modelli da 2–3 miliardi di parametri, come LFM2.5-2.6B, così come altri modelli precedenti come quelli della serie Gemma e simili, rappresentano il pezzo che mancava. Sono il ponte tra il cervello centralizzato e le applicazioni reali che devono vivere sul dispositivo dell’utente.

    Non, quindi, competitor dei grandi modelli per i compiti generalisti, bensì sostituti diretti su una famiglia di task completamente diversa, dove il valore non è nella conoscenza enciclopedica, bensì nella velocità, nella privacy, nella disponibilità, nel costo marginale prossimo a zero.

    Se avete un problema che “vive” su un particolare dispositivo (agenti personali, automazione offline, robotica leggera, monitoraggio 24/7, specializzazione veloce) smettete di cercare il modello di punta del momento: state guardando nel posto sbagliato, mentre la soluzione è già qui, è piccola, e gira sul vostro laptop consumer.

  • Perché l’IA è ancora troppo costosa (e imperfetta) per sostituire l’uomo

    Perché l’IA è ancora troppo costosa (e imperfetta) per sostituire l’uomo

    Il caso Amazon svela il dietro le quinte della Silicon Valley: tra costi di calcolo insostenibili e limiti probabilistici, l’industria scopre che l’efficienza non si compra a “token”.

    (Nota: questo articolo è stato generato con Claude di Anthropic ma segue lo stile e le indicazioni editoriali dell’autore)


    C’è un’immagine (quella che accompagna questo articolo), generata da un’IA che ironicamente non riesce a raccontare la verità nemmeno quando prova a deriderla, che circola da settimane: robot con le sembianze umane, tesserino Amazon al collo, escono da un palazzo di vetro con lo scatolone della cassa integrazione tra le braccia. Sotto, la scritta trionfante: hanno assunto undicimila persone dopo averne licenziate trentamila, perché — dice il meme, compiaciuto — l’IA è troppo cara per sostituire gli uomini. È il tipo di notizia che si vuole vera prima ancora di verificarla, perché conferma quello che molti aspettavano di poter dire da tre anni a questa parte: il gigante ha i piedi d’argilla, la bolla sta scoppiando, torniamo pure a fidarci delle mani umane.

    Peccato che la realtà, come quasi sempre, sia più interessante della caricatura. I numeri sono veri — circa trentamila tagli tra fine 2025 e gennaio 2026, e poi l’annuncio di Matt Garman, CEO di AWS, di assumerne undicimila — ma la lettura è quasi rovesciata. Non è stato un passo indietro dettato dal fallimento dell’intelligenza artificiale: è stata una ristrutturazione delle competenze. Fuori i ruoli generalisti, i middle manager, le funzioni di supporto ridondanti; dentro ingegneri, specialisti, persone capaci di far funzionare — e soprattutto di governare — sistemi che da soli, ancora, non sanno stare in piedi. Il bluff non è quello che pensa il meme. Il bluff, semmai, è pensare che stia succedendo l’opposto di quello che sta davvero succedendo.

    Primo atto: l’economia dei token e i costi che nessuno mostra negli slide

    Dietro ogni risposta generata da un modello linguistico c’è un conto energetico ed economico che l’utente finale non vede mai, e che le aziende stanno iniziando a vedere fin troppo bene. Dentro Amazon, per stimolare l’adozione interna dell’IA, erano state introdotte classifiche aziendali basate sul consumo di token: chi ne usava di più saliva in classifica. Il risultato prevedibile — e in un’azienda che ha fatto della metrica una religione, persino comico — è stato il “tokenmaxxing”: dipendenti che gonfiavano artificialmente l’uso dei modelli, automatizzavano compiti inutili, chiamavano l’IA per problemi che non ne avevano bisogno, pur di scalare una leaderboard interna. Le fatture sono lievitate al punto da costringere i vertici a spegnere il sistema di tracciamento.

    Non è un aneddoto isolato. Un progetto interno pensato per associare automaticamente i record degli autori ai prodotti del marketplace ha sforato il budget dell’860%, arrivando a costare 1,8 milioni di dollari prima di essere abbandonato per fallimento. Non è cattiva gestione episodica: è la prova che l’infrastruttura dell’IA generativa — GPU, data center, energia, e soprattutto l’imprevedibilità dei costi legati a un uso “creativo” non controllato — non si comporta come un software tradizionale, dove il costo marginale di un’operazione in più è quasi nullo. Uno studio ormai citato ovunque del MIT CSAIL lo conferma con freddezza contabile: nella stragrande maggioranza dei compiti visivi e linguistici complessi, sostituire integralmente l’uomo con un sistema automatizzato non è, oggi, economicamente conveniente.

    Secondo atto: perché un Transformer non sa “eseguire ordini”

    Qui si tocca il nervo scoperto, quello che nessun taglio di budget può risolvere perché non è un problema di soldi ma di architettura. Un software tradizionale fallisce in modo deterministico: se c’è un bug, fallisce sempre nello stesso identico punto, e proprio per questo è testabile, riparabile, prevedibile. Un modello linguistico — e con lui ogni agente costruito sopra di esso — fallisce in modo probabilistico. Può eseguire un compito correttamente novantatré volte su cento e fallire clamorosamente alla novantaquattresima, senza che nulla, nel comportamento precedente, lo avesse lasciato presagire.

    La ragione è semplice da enunciare e difficile da accettare per chi vende automazione come panacea: un Transformer non “capisce” una regola nel senso in cui la capisce un essere umano o un compilatore. Calcola, istante per istante, la probabilità statistica del token successivo. Funziona magnificamente quando il compito è riassumere un testo o abbozzare una bozza — il margine d’errore è tollerabile, spesso invisibile. Funziona malissimo quando il compito è spostare fondi, gestire un inventario, generare codice che finirà in produzione: lì un tasso di successo del 90-95%, che altrove sarebbe un risultato eccellente, diventa un rischio inaccettabile, perché quel margine di errore imprevedibile può tradursi in danni legali o finanziari che nessun risparmio sul personale compensa. E nei compiti a catena — quelli in cui un passaggio si costruisce sul precedente — l’errore iniziale non resta isolato: si propaga, si amplifica, e finisce per far collassare l’intero risultato.

    Terzo atto: la falsa soluzione degli strati aggiunti

    Di fronte a questo limite, l’industria ha reagito come reagisce sempre di fronte a un problema strutturale: aggiungendo cerotti sopra la ferita invece di guardarla. I framework agentici e il test-time compute — i modelli che “riflettono” prima di rispondere, scomponendo un obiettivo in sotto-task, pianificazione, chiamate a strumenti esterni, osservazione dei risultati — promettevano di correggere dall’esterno ciò che l’architettura non risolve dall’interno. I rendimenti, però, sono decrescenti, e la letteratura scientifica recente — dagli studi pubblicati su arXiv alle sessioni dell’ACL Anthology — lo dimostra con una certa spietatezza: i Transformer restano strutturalmente limitati nella composizione logica a lungo raggio e nella generalizzazione. Più lunga è la catena di passaggi affidata a un agente, più esponenziale diventa la propagazione dell’errore.

    Il mercato, che raramente ha pazienza per le dimostrazioni teoriche ma legge benissimo i bilanci, ne sta già traendo le conseguenze: le stime di società di consulenza come Gartner indicano che oltre il 40% dei progetti aziendali basati su agenti IA rischia l’abbandono entro il 2027, non per mancanza di ambizione ma per la debolezza cronica dei risultati concreti rispetto alle promesse.

    Quarto atto: verso il salto evolutivo

    La parte più interessante della storia, però, non è la crisi: è la consapevolezza che ne è nata nei laboratori. È ormai chiaro — e in parte dimostrato — che allucinazioni, incapacità di pianificazione spazio-temporale e assenza di apprendimento continuo (i pesi restano statici dopo l’addestramento, il modello non impara più nulla dall’esperienza quotidiana) non sono difetti di gioventù correggibili con più dati o più strati di calcolo. Sono proprietà strutturali dell’architettura Transformer. E quando un limite è strutturale, non lo si aggira: lo si supera cambiando architettura.

    È qui che si concentra oggi la ricerca più seria. I modelli a spazio di stato — Mamba, o architetture ibride come Jamba di AI21 Labs — gestiscono i contesti lunghi con un’efficienza lineare che l’attenzione quadratica dei Transformer non può eguagliare. Laboratori come Google DeepMind lavorano su moduli di memoria neurale continua — il progetto Titans è l’esempio più citato — per permettere a un sistema di continuare ad apprendere senza subire il collasso catastrofico della memoria che oggi costringe ogni modello a restare, di fatto, congelato al giorno in cui è stato addestrato. E si affacciano, ancora ai margini ma con crescente credibilità, sistemi che integrano comprensione geometrica, causale, fisica del mondo reale: il tentativo di dare a queste macchine non solo statistica, ma un rudimento di determinismo logico.

    L’era della coesistenza

    Il bilancio, allora, non è quello urlato dal meme, e non è nemmeno l’opposto speculare — l’IA che trionfa comunque, sempre e ovunque. È una via più stretta e meno fotogenica: l’intelligenza artificiale non sostituirà i lavoratori dall’oggi al domani, ma chi la sa usare rimpiazzerà, gradualmente e senza clamore, chi continua a ignorarla. Le aziende che vinceranno questa fase non saranno quelle che licenziano gli umani per far posto agli algoritmi — lo racconta bene proprio il caso Amazon, che taglia generalisti e assume specialisti — ma quelle che ridisegnano i ruoli attorno a un’interazione uomo-macchina realmente simbiotica, mentre aspettano, senza illudersi che sia già arrivata, la prossima vera rivoluzione architetturale.