Il vero limite dell’AI sono i dati: cosa succede dopo Internet

Internet ha fornito testi e immagini in abbondanza; biologia, robotica e scienza richiedono invece nuovi dati da produrre nel mondo reale.

L’intelligenza artificiale generativa ha potuto crescere rapidamente perché Internet esisteva già. Testi, fotografie, codice, discussioni, documenti e video hanno fornito una quantità enorme di materiale utilizzabile per addestrare modelli capaci di riconoscere e riprodurre pattern.

Ma questa abbondanza crea un’illusione: che per migliorare l’AI basti costruire modelli più grandi e aggiungere più calcolo. In molti settori il vero limite sta diventando un altro: i dati necessari non esistono ancora.

Il 7 ottobre 2026 Reuters ha raccontato il progetto Virtual Biology Initiative di Biohub, sostenuto da governo statunitense, Google, Meta e altri soggetti con investimenti complessivi annunciati per 1,8 miliardi di dollari. L’obiettivo è produrre grandi dataset aperti sul comportamento delle cellule per addestrare modelli capaci di prevedere fenomeni biologici. La notizia mostra una trasformazione fondamentale: invece di cercare dati già presenti sul web, bisogna costruire esperimenti per generarli.

Internet era un dataset creato per altri motivi

I grandi modelli linguistici hanno beneficiato di una situazione storicamente particolare. Per decenni miliardi di persone hanno scritto pagine, libri, forum, software e documentazione senza farlo per addestrare un’AI. Quando i modelli generativi sono arrivati, una gigantesca quantità di informazione era già disponibile.

È il motivo per cui l’articolo sui dataset per l’intelligenza artificiale è centrale per capire il funzionamento dei sistemi moderni: i modelli imparano dalle regolarità presenti nei dati che ricevono.

Ma il web rappresenta bene soltanto alcune parti della realtà. È ricchissimo di linguaggio e immagini; è molto meno ricco di misurazioni biologiche, interazioni molecolari, dati robotici o risultati sperimentali standardizzati.

La biologia non può essere semplicemente “scrapata”

Per costruire un modello capace di prevedere come una cellula risponde a un farmaco non basta raccogliere testi che descrivono studi precedenti. Servono misurazioni dirette: quali geni vengono attivati, come cambiano proteine e strutture cellulari, come varia il comportamento in condizioni differenti.

Questi dati devono essere prodotti con laboratori, strumenti scientifici e protocolli coerenti. Costano tempo e denaro. Inoltre devono essere abbastanza standardizzati da poter essere confrontati.

La Virtual Biology Initiative punta proprio a questa infrastruttura: creare dataset sperimentali su larga scala che possano diventare la base di modelli predittivi della biologia.

Il problema si ripete nella robotica

Un modello linguistico può leggere miliardi di frasi. Un robot che deve imparare a manipolare oggetti ha bisogno di dati sul mondo fisico: movimenti, forze, errori, attrito, deformazioni, geometrie, conseguenze delle azioni.

Una parte può essere prodotta in simulazione, ma la simulazione non replica perfettamente la realtà. Per questo le aziende raccolgono dati da robot reali, teleoperazione e sensori. Anche qui l’AI incontra un limite che il web non può risolvere da solo.

Il problema non è più trovare abbastanza testo, ma costruire un sistema capace di osservare e misurare il mondo.

I dati sintetici aiutano, ma non eliminano il problema

Una delle risposte è generare dati sintetici: esempi prodotti da modelli o simulatori invece che raccolti direttamente. Possono ampliare un dataset, coprire casi rari e ridurre alcuni costi.

Ma i dati sintetici partono comunque da una rappresentazione del mondo. Se il modello iniziale è incompleto, la generazione rischia di riprodurne errori e pregiudizi. Una simulazione fisica può produrre milioni di scenari, ma se una variabile importante non è rappresentata correttamente, il volume non compensa la mancanza.

Per questo dati reali e sintetici probabilmente continueranno a convivere. I primi ancorano il modello alla realtà; i secondi permettono di esplorare e moltiplicare le combinazioni.

Il valore economico si sposta verso chi può produrre dati

Quando Internet forniva materiale abbondante, il vantaggio competitivo era soprattutto nella capacità di addestrare modelli più grandi. In settori scientifici e industriali il vantaggio può spostarsi verso chi possiede laboratori, sensori, piattaforme sperimentali o accesso a popolazioni di utenti e dispositivi.

Questo cambia anche la geografia del potere nell’AI. Università, ospedali, aziende farmaceutiche, produttori di robot e imprese industriali possono possedere dati che le grandi piattaforme tecnologiche non hanno.

Le partnership diventano quindi inevitabili: il capitale e il calcolo delle Big Tech incontrano organizzazioni che controllano l’accesso al mondo fisico.

Più dati non significa automaticamente dati migliori

La corsa alla quantità può nascondere un problema di qualità. Un dataset enorme ma pieno di errori, misure incoerenti o campioni sbilanciati può produrre modelli apparentemente potenti ma poco affidabili.

Per applicazioni scientifiche la qualità diventa particolarmente importante perché l’errore può propagarsi dentro esperimenti costosi o decisioni cliniche. Servono quindi metadati, protocolli, tracciabilità e strumenti per capire come ogni osservazione è stata prodotta.

È una differenza profonda rispetto a molta AI consumer, dove un errore può essere fastidioso ma non necessariamente critico.

Dopo Internet, l’AI dovrà costruire i propri sensi

La prima fase dell’AI generativa ha utilizzato un mondo digitale già pieno di dati. La fase successiva potrebbe richiedere una nuova infrastruttura dedicata alla loro produzione.

Laboratori automatizzati, robot, sensori e simulazioni diventano così l’equivalente dei crawler che hanno raccolto il web. Non cercano soltanto informazioni esistenti: creano nuove osservazioni.

Questo suggerisce che il limite dell’intelligenza artificiale non sarà necessariamente la dimensione del prossimo modello. In molti campi sarà la capacità di costruire dataset che descrivano aspetti della realtà che Internet non ha mai registrato.

Dopo aver imparato dal web, l’AI dovrà quindi imparare a guardare il mondo. E farlo costerà molto più che scaricare una pagina.

Fonti e riferimenti

Leave a reply

Loading Next Post...
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...