Tag: Addestramento

  • OpenAI e Anthropic “si accaparrano” i Mac per addestrare gli agenti AI?

    OpenAI e Anthropic “si accaparrano” i Mac per addestrare gli agenti AI?

    Gli agenti AI hanno bisogno di una palestra, non solo di GPU. OpenAI e Anthropic starebbero usando grandi “flotte” di Mac per insegnare ai modelli a lavorare direttamente sui desktop.

    Secondo un report basato su fonti anonime, OpenAI avrebbe acquistato decine di migliaia di Mac mini e Mac Studio per attività di reinforcement learning legate agli agenti AI capaci di interagire direttamente con un desktop.

    Anthropic avrebbe perseguito, invece, un obiettivo simile affittando capacità basata su Mac attraverso AWS, privilegiando quindi un modello infrastrutturale diverso.

    Le quantità indicate non sono state confermate da OpenAI, Anthropic o Apple e non esistono al momento dati pubblici che colleghino questi acquisti alla forte crescita recente dei ricavi Mac.

    Se confermato, il fenomeno mostrerebbe però come l’addestramento degli agenti “computer use” stia creando una nuova domanda di hardware fisico oltre alle tradizionali GPU usate per eseguire i modelli.

    Sullo sfondo resta inoltre la scarsità di memoria, che potrebbe contribuire alla minore disponibilità di alcune configurazioni destinate a professionisti e consumatori.


    Link alla fonte:
    https://www.tomshw.it/business/i-mac-mini-si-vendono-come-il-pane-se-li-comprano-tutti-openai-e-anthropic-1

  • AI: quando le dimensioni non sono (più) tutto… e perché questo cambia il ruolo degli agenti

    AI: quando le dimensioni non sono (più) tutto… e perché questo cambia il ruolo degli agenti

    Il CEO di Z.ai Jie Tang sostiene che il numero di parametri non sia più una misura sufficiente per valutare la capacità di un modello AI. Il caso di GLM-5.3 mostra, secondo Z.ai, che progressi significativi possono derivare soprattutto dal post-training, in particolare dal reinforcement learning su ambienti complessi e di lunga durata, senza dover necessariamente aumentare le dimensioni del modello.

    Per anni abbiamo raccontato l’intelligenza artificiale come una gara basata sulle “dimensioni”, ovvero modelli sempre più grandi, con sempre più parametri. Come se fosse sufficiente, insomma, alzare il volume per ottenere risultati migliori.

    Oggi sappiamo che non è così.

    Il vero progresso non passa più solo dallo sviluppo di modelli enormi, ma dal capire quali leve “muovere”: la quantità di dati da utilizzare, le modalità con cui bilanciamo l’addestramento, e soprattutto quanto a lungo far esercitare il modello in compiti lunghi e complessi. È qui che nasce la differenza tra un chatbot che risponde a una domanda e un agente capace di prendere in carico un lavoro serio, ragionare su numerosi passaggi consecutivi e giungere a un risultato senza che sia necessario guidarlo passo per passo.

    Un esempio concreto è GLM-5.3: stesso modello di partenza del predecessore, ma dopo un mese di allenamento intensivo su ambienti realistici (compiti che richiederebbero intere giornate a un ingegnere esperto) ha fatto dei passi avanti netti. In questo caso le dimensioni non contano, tuttavia: il modello non è “diventato più grosso”, bensì ha imparato a “tenere il filo” di ragionamenti lunghi e a portare a termine compiti complessi tutto da solo.

    È un po’ come una cucina di ristorante: avere cento cuochi nello staff non serve a nulla, se poi ne fai lavorare solo due alla volta e per poco tempo. Conta, invece, di più quanti ne metti effettivamente al lavoro e quanto a lungo li fai ragionare sul problema.

    I dettagli

    • Tang propone di superare l’attenzione quasi esclusiva ai parametri: le prestazioni dipendono anche dalla quantità e qualità dei dati, dal compute utilizzato durante training e inferenza e dalle condizioni in cui il modello viene eseguito.
    • GLM-5.3 avrebbe ottenuto i suoi principali miglioramenti rispetto a GLM-5.2 attraverso reinforcement learning su compiti long-horizon, mantenendo sostanzialmente invariati modello base e architettura.
    • Gli ambienti di addestramento simulano attività professionali che possono richiedere giorni a un esperto: il modello deve analizzare sistemi complessi, modificare codice, eseguire esperimenti e raggiungere autonomamente un risultato verificabile.
    • Z.ai sta inoltre automatizzando la creazione di questi ambienti: agenti generano i task, ne verificano la risolvibilità e costruiscono sistemi di valutazione e reward utilizzabili direttamente nel reinforcement learning.
    • La tesi di Tang distingue tra memorizzazione, che continua a beneficiare di più parametri, e capacità avanzate di ragionamento, che dipenderebbero sempre più da post-training, profondità effettiva del ragionamento e capacità di mantenere lunghe catene causali.

    Perché è importante: se questa tendenza verrà confermata, il settore potrebbe entrare in una fase in cui la competizione non sarà più principalmente su chi costruisce il modello con più parametri, ma su chi sviluppa i migliori processi di post-training, ambienti sintetici e sistemi di reinforcement learning. Il parametro decisivo diventerebbe quindi meno la dimensione statica del modello e più la qualità della “esperienza” con cui viene addestrato a ragionare e ad agire. Si tratta di un cambiamento che potrebbe consentire a modelli relativamente più piccoli di competere con sistemi molto più grandi su compiti complessi e agentici.

    Link alla fonte:

    https://www.latent.space/p/ainews-death-of-params-zai-ceo-jie

  • Un AirTag svela il viaggio dei libri rari verso gli scanner di Amazon: altro “cibo” per l’IA?

    Un AirTag svela il viaggio dei libri rari verso gli scanner di Amazon: altro “cibo” per l’IA?

    Un AirTag nascosto in un libro raro ha seguito il volume fino a un reparto Amazon dove i libri vengono smontati e scansionati. L’indagine riapre il nodo della corsa ai dati originali nell’era dell’IA.

    Un’indagine di 404 Media ha seguito con un AirTag un libro raro acquistato insieme a centinaia di altri volumi, scoprendo che il localizzatore è arrivato in un magazzino Amazon di Las Vegas.

    Secondo le testimonianze raccolte, nel reparto VGT3 i libri vengono identificati tramite codice a barre o ISBN, privati della rilegatura, tagliati e trasformati in fogli da passare rapidamente negli scanner, mentre ciò che resta viene eliminato.

    Amazon afferma di acquistare libri attraverso canali commerciali per «sviluppare e migliorare» prodotti e servizi, senza specificare se il materiale digitalizzato venga utilizzato per addestrare modelli di IA.

    L’interesse per testi cartacei mai digitalizzati sarebbe particolarmente rilevante perché offre materiale originale scritto da esseri umani, in un momento in cui una quota crescente dei contenuti online può essere generata dall’IA.

    Tra i librai cresce così il timore che acquisti anonimi e sistematici possano sottrarre alla circolazione opere rare non tanto per il loro valore economico, quanto per quello storico, culturale e intellettuale.


    Link alla fonte:
    https://www.hwupgrade.it/news/web/un-airtag-in-un-libro-raro-porta-al-magazzino-amazon-dove-i-libri-vengono-distrutti_157893.html

  • NVIDIA sotto accusa: uso consapevole di libri piratati per addestrare modelli AI

    Una class action avviata negli Stati Uniti accusa NVIDIA di aver scaricato e utilizzato consapevolmente milioni di libri piratati per addestrare i propri modelli di intelligenza artificiale.
    Secondo i documenti giudiziari aggiornati, l’azienda avrebbe avuto contatti diretti con Anna’s Archive, una nota “shadow library”, nonostante gli avvertimenti sulla natura illegale dei contenuti.
    I testi sarebbero stati impiegati per l’addestramento di modelli come NeMo, Megatron e Nemotron, oltre a essere redistribuiti tramite infrastrutture e framework NVIDIA.
    La causa, che coinvolge anche scrittori noti come Susan Orlean, potrebbe avere forti ripercussioni sull’intero settore IA e riaccendere il dibattito su copyright, fair use e responsabilità nel training dei modelli.

    Link alla fonte:
    https://multiplayer.it/notizie/nvidia-potrebbe-aver-contattato-annas-archive-per-avere-accesso-a-milioni-di-file-di-libri-piratati-per-addestrare-i-suoi-modelli-ia.html

  • Mistral AI sotto accusa: scaricati 70 TB di libri pirata per addestrare modelli AI

    Un’inchiesta di Mediapart ha rivelato che Mistral AI, una delle principali startup europee nel settore dell’intelligenza artificiale, è indirettamente coinvolta in un presunto caso di utilizzo di dati piratati.
    Secondo i documenti giudiziari emersi dal contenzioso “Kadrey v. Meta”, Guillaume Lample, oggi direttore scientifico di Mistral AI, avrebbe coordinato nel 2022 il download di circa 70 terabyte di libri protetti da copyright da Library Genesis mentre lavorava in Meta.
    I file sarebbero stati destinati all’addestramento di modelli linguistici, in un contesto di forte competizione con OpenAI e Google.
    Sebbene Meta non abbia poi utilizzato quei dati per la prima versione di LLaMA, le rivelazioni sollevano dubbi sull’origine dei dataset usati per addestrare Mistral 7B.
    La vicenda assume particolare rilevanza alla luce del nuovo AI Act europeo, che impone trasparenza sulle fonti dei dati di training, obbligo che Mistral AI non ha ancora soddisfatto.

    Link alla fonte:
    https://www.lesnumeriques.com/intelligence-artificielle/mistral-ai-la-licorne-francaise-accusee-par-meta-d-avoir-vole-70-to-de-livres-pour-nourrir-son-ia-n248558.html

  • OpenAI acquisisce Neptune.ai per potenziare il monitoraggio del training dei modelli avanzati

    OpenAI ha annunciato un accordo definitivo per acquisire neptune.ai, piattaforma specializzata nel tracciamento e nell’analisi degli esperimenti di training dei modelli di machine learning.

    L’integrazione punta a migliorare la visibilità in tempo reale sul comportamento dei modelli durante l’addestramento, un elemento cruciale nei processi creativi ed esplorativi del frontier research.

    Neptune ha già collaborato con OpenAI nello sviluppo di strumenti capaci di confrontare migliaia di run, analizzare metriche su più livelli e identificare rapidamente problemi emergenti.

    Secondo Jakub Pachocki, Chief Scientist di OpenAI, la tecnologia di Neptune consente analisi più precise e veloci dei workflow di training, offrendo un vantaggio strategico nell’ottimizzazione dei modelli.

    Per Neptune, l’ingresso in OpenAI rappresenta l’opportunità di offrire le proprie soluzioni su scala globale e contribuire allo sviluppo della prossima generazione di strumenti di addestramento.

    Link alla fonte:
    https://openai.com/index/openai-to-acquire-neptune/

  • Cosa c’è DAVVERO dietro l’AI?

    Ti sei mai chiesto chi c’è veramente dietro le risposte dei modelli di intelligenza artificiale più potenti?

    Invisible Technologies, l’azienda che sostiene di aver addestrato l’80% dei principali modelli di IA del mondo, rivela che l’IA non è magia, ma un sofisticato testo predittivo potenziato da un “esercito invisibile di umani” che etichettano dati, valutano le risposte e insegnano ai modelli il giusto e lo sbagliato.

    I Large Language Models (LLM), sistemi non deterministici basati su reti neurali, vengono addestrati attraverso tre meccanismi principali: il Supervised Fine-Tuning, che fornisce esempi di dati di alta qualità (i “libri di testo”); il Reinforcement Learning (o reward modeling), dove gli umani assegnano voti alle risposte, premiando i comportamenti desiderati; e l’Evaluation, ovvero la creazione di test per misurare i miglioramenti, tenendo conto che l’opinione degli utenti non è deterministica e la soggettività è fondamentale.

    L’addestramento è una vera e propria ricerca scientifica complessa, non un semplice scooping up dell’internet, e la qualità dei dati è cruciale, poiché i modelli devono filtrare petabyte di contenuti irrilevanti o “spazzatura tossica” (come quella trovata su Reddit, una delle principali fonti di riferimento); di conseguenza, l’accesso a dati di addestramento superiori è destinato a diventare il vantaggio competitivo fondamentale (“moat”).

    La complessità del lavoro di addestramento è aumentata notevolmente, richiedendo specialisti con competenze specifiche (come infermieri, avvocati o esperti multilingue) invece di generalisti, il che sta facendo lievitare i costi del settore.

    Le aziende che implementano l’IA spesso commettono errori, come avere dati disorganizzati, non comprendere i propri processi interni (il black box del “team di Dave”), o tentare di automatizzare un processo esistente e difettoso anziché ridefinirlo completamente a partire dal risultato desiderato (come rimpiazzare un cavallo veloce con un’automobile); per avere successo, è essenziale stabilire metriche di valutazione chiare e oggettive, non un generico “pollice in su o in giù”.

    Infine, sebbene l’impatto dell’IA si stia spostando dal digitale al fisico (veicoli autonomi, robotica, logistica), la supervisione umana rimarrà fondamentale, specialmente negli ambiti normati (come le decisioni mediche o legali) a causa delle questioni di responsabilità, e per funzioni essenziali come la people management e gli atti di comunicazione, data la natura non razionale e imprevedibile dell’essere umano.

    Questa presentazione, realizzata con NotebookLM, nasce dalla trascrizione di un podcast del canale YouTube “The Neuron”, intitolato “This Company Trained 80% of the World’s Top AI Models (Here’s How They Do It)”.

  • L’IA soffre di “brain rot”: lo studio rivela i danni dei “dati spazzatura”

    Uno studio condotto da ricercatori dell’Università del Texas ad Austin e della Purdue University, pubblicato su arXiv, evidenzia che anche le intelligenze artificiali possono soffrire di “brain rot”, una sorta di stordimento cognitivo simile a quello umano causato da un’eccessiva esposizione a contenuti digitali di bassa qualità.

    I modelli linguistici di Meta e Alibaba testati hanno mostrato un declino nelle capacità di ragionamento, memoria e comportamento etico quando addestrati con testi sensazionalistici e clickbait.

    Secondo Junyuan Hong, coautore dello studio, l’assunto che i contenuti virali siano buoni per l’addestramento è errato: i dati di scarsa qualità corrodono la logica e l’etica delle IA.

    Gli studiosi avvertono che anche le strategie di mitigazione non riescono a invertire del tutto i danni, richiamando l’attenzione su una regola valida tanto per l’uomo quanto per le macchine: “sei quello che mangi”.

    Link alla fonte:

    L’intelligenza artificiale soffre di ‘brain rot’, il rimbambimento da web: lo studio | Sky TG24

  • Class action USA contro Anthropic: l’uso non autorizzato di 7 milioni di libri potrebbe portare a risarcimenti miliardari  agli autori

    Il 17 luglio 2025 il giudice federale William Alsup ha certificato una class action nazionale che permette a tre autori—Andrea Bartz, Charles Graeber e Kirk Wallace Johnson—di rappresentare milioni di scrittori statunitensi i cui libri sarebbero stati scaricati dai siti pirata LibGen e PiLiMi per addestrare il modello Claude di Anthropic. La causa, distinta da un precedente parziale via libera al “fair use” per i testi regolarmente acquistati e digitalizzati, contesta l’archiviazione di circa 7 milioni di opere “piratate” e potrebbe costare all’azienda miliardi di dollari (almeno 750 $ per libro). Il processo sul materiale illegale è fissato per dicembre 2025, mentre il tribunale dovrà quantificare entro il 1 settembre il corpus effettivamente copiato. Il caso stabilisce un precedente cruciale che separa l’uso trasformativo di contenuti legali dalla pirateria e potrebbe influenzare controversie analoghe contro OpenAI, Meta o Microsoft, spingendo l’intero settore IA verso pratiche di licensing più trasparenti.

    Link alla fonte:
    https://www.spazio50.org/ia-e-copyright-arriva-la-prima-class-action-contro-anthropic/