
L’AI torna sui dispositivi: privacy, costi, latenza e potenza spingono verso un modello ibrido in cui locale e cloud si dividono il lavoro.
Per anni l’intelligenza artificiale generativa è sembrata inseparabile dal cloud. Scrivi una richiesta sul computer, il dato parte verso un data center, un modello remoto elabora la risposta e il risultato torna sullo schermo. È un’architettura efficace, ma costosa: richiede infrastruttura, banda, energia e una relazione continua con il provider che ospita il modello.
Nell’ottobre 2026 Microsoft e Nvidia hanno rilanciato con forza un’alternativa: eseguire una parte crescente dell’AI direttamente sul computer. Il nuovo Surface Laptop Ultra, presentato il 7 ottobre, utilizza chip Nvidia RTX Spark e punta a gestire localmente carichi AI che fino a poco tempo fa sarebbero passati dal cloud. Microsoft ha parlato anche di “Hybrid Intelligence”, cioè di sistemi capaci di decidere quando usare il dispositivo e quando appoggiarsi ai data center. Reuters ha descritto il lancio come un tentativo di trasformare Windows in una piattaforma capace di far eseguire agli agenti attività complesse senza dipendere sempre dalla nuvola.
La domanda interessante, però, non è quale laptop vincerà. È capire se il futuro dell’AI sarà locale, cloud o ibrido.
Un modello locale viene eseguito sul dispositivo dell’utente: PC, smartphone, workstation o appliance dedicata. I dati necessari all’elaborazione possono rimanere sulla macchina e il risultato non richiede necessariamente una connessione remota.
È una differenza sostanziale rispetto al modello basato sui data center, dove il dispositivo personale è soprattutto un terminale che invia richieste verso infrastrutture molto più potenti.
L’AI locale non implica che l’intero modello debba essere piccolo o elementare. L’aumento della memoria disponibile sui dispositivi, l’uso di acceleratori specializzati e tecniche di quantizzazione permettono ormai di eseguire modelli più complessi su hardware personale. Il limite principale rimane la quantità di calcolo e memoria che può essere concentrata dentro una macchina dal costo e dal consumo accettabili.
Il cloud rimane superiore quando servono modelli enormi, capacità elastiche e accesso a infrastrutture che un singolo dispositivo non può replicare. Addestramento, inferenza su larga scala, generazione video pesante e servizi utilizzati contemporaneamente da milioni di persone continuano a dipendere da cluster di GPU e sistemi distribuiti.
Il nostro articolo sulle GPU per l’intelligenza artificiale spiega perché: gran parte delle prestazioni deriva dalla possibilità di eseguire enormi quantità di operazioni in parallelo. Il cloud consente di mettere insieme migliaia di acceleratori e di farli lavorare come una singola infrastruttura.
Inoltre offre un vantaggio economico alle aziende: non devono distribuire hardware molto potente a ogni utente. Pagano capacità centralizzata e possono aggiornare il modello senza intervenire su ogni dispositivo.
Se un modello può analizzare documenti, email o file senza inviarli a un server remoto, il vantaggio in termini di privacy è evidente. Questo non rende automaticamente sicuro il sistema: il dispositivo può comunque essere compromesso e il software può registrare informazioni. Ma riduce una superficie di esposizione importante.
È particolarmente rilevante per aziende che lavorano con codice proprietario, dati sanitari, documenti legali o informazioni riservate. In questi casi la possibilità di eseguire localmente alcune elaborazioni può diventare più importante della differenza di qualità rispetto al modello remoto più potente.
La privacy è importante, ma il motivo industriale più forte potrebbe essere il costo. Ogni richiesta elaborata nel cloud consuma capacità di calcolo pagata dal provider o dal cliente. Se una parte dei carichi viene spostata sui dispositivi, il costo dell’hardware viene sostenuto in gran parte dall’utente e non dal data center.
La nuova spinta di Microsoft e Nvidia arriva proprio mentre il costo dell’infrastruttura AI continua a crescere. Per uno sviluppatore che paga centinaia di euro al mese in servizi cloud, una macchina costosa può diventare conveniente se assorbe una parte consistente del lavoro.
Il dispositivo personale torna così a essere un luogo di calcolo importante dopo anni in cui l’industria aveva spinto in direzione opposta: software come servizio, storage remoto, applicazioni web, elaborazione centralizzata.
La contrapposizione “locale contro cloud” è utile per capire il problema, ma probabilmente non descrive il risultato finale. Un’applicazione può utilizzare un modello locale per attività private o rapide e chiamare il cloud quando serve maggiore potenza. Può eseguire una prima analisi sul dispositivo e inviare all’esterno soltanto una parte dei dati. Può usare il cloud per addestrare e aggiornare modelli che poi vengono distribuiti sui PC.
Questa architettura ibrida consente di ottimizzare quattro variabili: costo, privacy, latenza e qualità. Non esiste una combinazione migliore in assoluto. Un assistente che deve cercare un file sul computer ha esigenze diverse da un generatore video; un software sanitario è sottoposto a vincoli diversi da un chatbot pubblico.
C’è infine una conseguenza meno visibile. Se l’AI funziona soltanto nel cloud, chi controlla i data center controlla anche l’accesso ai modelli. Prezzi, disponibilità, policy e limiti dipendono dal provider. L’esecuzione locale può ridurre questa dipendenza e favorire modelli open-weight o software che continua a funzionare anche senza un servizio remoto.
Non significa la fine del cloud. Significa che una parte del potere computazionale può tornare ai dispositivi degli utenti. Il futuro dell’intelligenza artificiale potrebbe quindi assomigliare meno a un unico cervello remoto e più a una rete di capacità distribuite: alcune sul PC, altre nei data center, con il software che decide di volta in volta dove conviene lavorare.