(Fonte) Andrea Signorelli – 19 marzo 2025

Gli esperti avvertono che i modelli di intelligenza artificiale potrebbero presto affrontare una “carestia di dati”. I large language model consumano enormi quantità di testi per l’addestramento, ma le fonti disponibili sul web – come Common Crawl, Wikipedia o Reddit – stanno raggiungendo un limite, il cosiddetto data wall, cioè il punto in cui tutti i dati utili sono già stati utilizzati o diventano inaccessibili.

La crescita della domanda è enorme: GPT-3 ha richiesto 500 miliardi di token, mentre GPT-4 ne avrebbe utilizzati circa 13 mila miliardi. Tuttavia, il volume di contenuti testuali online non aumenta abbastanza velocemente per sostenere modelli sempre più grandi, che secondo la legge di scala richiedono più parametri, più potenza computazionale e soprattutto molti più dati. Questo rischio potrebbe frenare lo sviluppo futuro dell’IA.

Ricevi la nostra newsletter!

iscriviti con la tua mail per ricevere selezionati articoli settimanali sull'intelligenza artificiale pubblicati sul nostro blog

Grazie per esserti iscritt@!

Pin It on Pinterest

Share This