Cosa succede a OpenAI e Anthropic se i clienti che generano più ricavi iniziano a spostare una parte consistente dei loro token altrove? L’AI ibrida potrebbe trasformare questo calcolo in una questione strategica.
A settembre 2026 i dati di Ramp hanno messo nero su bianco quello che molti sospettavano: l’1% dei clienti genera l’80% dei ricavi enterprise sia di OpenAI sia di Anthropic, una “concentrazione di rischio” senza precedenti nella storia del software. Perché, diciamocelo, anche in questo caso è di software che parliamo. In particolare, ad Anthropic due soli clienti (Cursor e GitHub Copilot) arrivano a pesare quasi un quarto del fatturato. E i ricavi arrivano soprattutto da usage-based pricing: più token bruci, più paghi.
In questo scenario, un pezzo di hardware apparentemente “di nicchia” come un Mac Studio M2 Ultra ricondizionato (metà 2023, 128 GB di RAM unificata, 2-4 TB SSD) a 3.800-4.600 € IVA inclusa in Italia diventa improvvisamente interessante. Non perché sostituisca i data center, ma perché rende economicamente razionale spostare una parte rilevante del carico su AI locale o ibrida. Di Mac ricondizionati come piattaforme di AI locale ne ho già parlato di recente, tra l’altro.
I grandi clienti non hanno davvero bisogno del “frontier” per qualsiasi cosa
La narrativa dominante (“serve sempre il modello più potente”) non regge di fronte ai numeri. La maggior parte del volume di token generato da quei clienti “top” è costituita da task ripetitivi, ad alto volume e a complessità medio-alta: coding agentico, completamento, RAG interni, generazione di contenuti, triage, elaborazioni batch. Su questi carichi il gap tra i frontier occidentali e i migliori modelli open-weight/cinesi (Qwen 3.x, DeepSeek V4, Kimi K2/K3, GLM) si è ridotto a pochi mesi di vantaggio, quando non si è già chiuso.
I dati di metà 2026 parlano chiaro:
- Su OpenRouter i modelli di origine cinese hanno raggiunto picchi del 46% dei token enterprise americani (da meno del 5% un anno prima).
- Cursor ha costruito parte del proprio Composer 2 su base Kimi.
- Lindy ha spostato il 100% del traffico da Claude a DeepSeek V4, dichiarando risparmi di milioni e performance uguali o migliori su molti use-case.
- Coinbase ha tagliato di circa il 50% la spesa AI con un default su modelli cinesi open-weight per gli ingegneri.
- Airbnb, Shopify, Siemens e altri hanno instradato carichi significativi su Qwen o Kimi.
Il frontier resta superiore (e spesso indispensabile) sui task più estremi: “ragionamento” multi-step di altissima complessità, coding estremo, scenari high-stakes dove ogni punto percentuale di accuratezza conta, tuttavia rappresenta una minoranza del volume globale. Il resto è già “sufficientemente buono” su alternative molto più economiche (spesso 5-35× più convenienti).
L’architettura che sta emergendo: necessariamente “ibrida”
La strategia dominante tra i grandi clienti non è “tutto cloud frontier” né “tutto locale”, ma piuttosto routing intelligente:
- Frontier (Claude, GPT) per i casi low-volume/high-stakes.
- Modelli cinesi/open (Qwen, DeepSeek, Kimi) per il volume alto e cost-sensitive.
- Locale/self-hosted (Mac Studio, cluster NVIDIA workstation o cloud privato) per privacy, dati sensibili e costi prevedibili.
Il già citato Mac Studio M2 Ultra ricondizionato entra esattamente in questa logica: costo di acquisizione contenuto, consumi bassissimi, silenzioso, capace di far girare modelli 30-70B in quantizzazione e anche carichi di generazione video/immagine locale. Non deve reggere tutto il traffico di un’azienda, ma piuttosto assorbire la fetta ripetitiva e privacy-sensitive a costo fisso, mentre il cloud gestisce i picchi e i frontier.
Possibilità di migrazione: breve e medio termine
Breve termine (6-12 mesi)
Probabilità medio-alta di una migrazione parziale ma significativa. I segnali sono già visibili: routing su modelli cinesi, sperimentazione di self-hosting, ottimizzazione aggressiva dei costi. Non sarà un esodo di massa, ma un trasferimento progressivo del 20-40% del volume token dei grandi clienti verso alternative più economiche. I fattori acceleranti sono il prezzo, la maturità dell’ecosistema open e la pressione sui budget AI (che in molte aziende è diventato una delle voci di spesa più visibili).
Medio termine (1-3 anni)
Probabilità alta di una ristrutturazione strutturale del mix. L’architettura ibrida diventerà lo standard de facto per chi spende tanto. I modelli open/cinesi continueranno a chiudere il gap (o a mantenerlo molto stretto), mentre i frontier si specializzeranno sempre di più sui task dove il vantaggio è ancora netto. L’hardware locale (Apple Silicon di nuova generazione e workstation NVIDIA) diventerà parte ordinaria della soluzione stack per molte organizzazioni. Il rischio geopolitico e le nuove clausole commerciali dei modelli cinesi (revenue share fino al 30% in alcuni casi per i grandi utenti di Kimi e possibili meccanismi simili per Qwen) introdurranno un certo “attrito”, ma non invertiranno la tendenza.
I freni principali restano, in sostanza: inerzia organizzativa, integrazioni esistenti, contratti enterprise pluriennali e, in alcuni settori regolati, considerazioni di compliance e supply-chain.
Conseguenze per OpenAI e Anthropic
Per i due big l’impatto non sarà un crollo improvviso, ma una compressione strutturale dei margini sull’inference e una maggiore pressione competitiva.
- Ricavi usage-based sotto pressione. Se anche solo una quota rilevante dell’1% sposta il 30-50% del volume su alternative più economiche, i ricavi calano in modo non lineare proprio perché quei clienti pesano tantissimo. Anthropic, più concentrata sull’enterprise e su pochi grandi account, risulta relativamente più esposta.
- Shift verso pricing e prodotti più sofisticati. I lab saranno spinti ad accelerare su tier differenziati, caching aggressivo, modelli “distillati” più economici e offerte enterprise che integrano routing ibrido (per non perdere del tutto i clienti).
- Concentrazione del valore sui frontier veri. Il business resterà solido sui task dove i modelli chiusi mantengono un vantaggio chiaro. Ma il volume di commodity inference si eroderà.
- Rischio di “commoditizzazione dal basso”. Se l’open-weight e i modelli cinesi continuano a migliorare a questo ritmo, il vantaggio competitivo dei frontier si restringe a una fascia sempre più sottile e premium.
Riassumendo: OpenAI e Anthropic non spariscono, e rimangono i fornitori di riferimento per la punta più alta della piramide, tuttavia il modello di business basato su volumi enormi di token a prezzi elevati diventa più fragile. La concentrazione dell’80% dei ricavi su un 1% di clienti, già oggi un rischio strutturale, si trasforma in un’arma a doppio taglio nel momento in cui quei clienti scoprono che possono fare di meglio (o altrettanto bene) spendendo molto meno.
Il Mac Studio M2 Ultra ricondizionato usato come esempio non è la soluzione a tutto, naturalmente, tuttavia rimane un simbolo concreto di come l’economia dell’AI stia cambiando: quando il costo marginale di generare un token in locale o su un modello open diventa sensibilmente più basso di quello del frontier, i grandi clienti iniziano a fare i conti. E quei conti, a settembre 2026, stanno già producendo i primi spostamenti concreti.
P.S. Dai un’occhiata a queste due guide, con cui rispettivamente sviluppare un’abilità di prompt design in grado di trarre il meglio da qualsiasi modello, anche locale, e ottenere tutte le informazioni più importanti per progettare e usare l’AI sul tuo computer, senza cloud. Le trovi entrambe in libreria e online:













