(Fonte) Ethan Mollick
“lontra su un aereo usando il Wi-Fi” è diventato uno dei miei test preferiti per testare i progressi nella generazione di immagini basate sull’intelligenza artificiale.
Le prime lontre che ho creato sono state realizzate con strumenti di generazione di immagini. Per gran parte della storia recente dell’IA, la generazione di immagini ha utilizzato un processo chiamato diffusione, che funziona in modo fondamentalmente diverso dai Large Language Model (LLM) come ChatGPT. Mentre i LLM generano il testo una parola alla volta, procedendo sempre in avanti, i modelli di diffusione partono da dati statici casuali e trasformano l’intera immagine simultaneamente attraverso decine di passaggi.
Ma ciò che rende interessanti i modelli di diffusione non è la loro crescente capacità di creare immagini fotorealistiche, quanto piuttosto il fatto che possano creare immagini in vari stili. Questo tocca il cuore del motivo per cui la generazione di immagini tramite IA è così controversa, poiché molti modelli di IA vengono addestrati su immagini provenienti dal web, comprese opere protette da copyright, e possono quindi replicare immagini nello stile di artisti viventi senza il loro permesso o compenso.
Vorrei mostrarvi un’ultima immagine di diffusione, ma questa è fondamentalmente diversa. L’ho creata sul mio computer di casa usando Flux . A differenza dei modelli di intelligenza artificiale proprietari come Midjourney o ChatGPT che girano nei data center aziendali, i modelli di pesi aperti possono essere scaricati, modificati ed eseguiti da chiunque, ovunque. Questa immagine di alta qualità non è stata generata dai server di un colosso della tecnologia, ma dalla scheda grafica del mio PC (potete vedere anche ComfyUI, l’interfaccia che ho usato per generare l’immagine). È notevolmente vicina alla qualità dei migliori modelli closed-source.

Per gran parte dell’era dei Large Language Model, quando un LLM come ChatGPT creava un’immagine, in realtà invocava uno di questi modelli di diffusione per crearla e mostrarne i risultati. Tutto è cambiato con il lancio della generazione di immagini multimodale da parte di OpenAI e Google negli ultimi due mesi. A differenza dei modelli di diffusione che trasformano il rumore in immagini, la generazione multimodale consente ai Large Language Model di creare immagini direttamente aggiungendo minuscole porzioni di colore una dopo l’altra, proprio come aggiungono parole una dopo l’altra. Questo conferisce all’IA un controllo approfondito sulle immagini che crea. Inoltre i modelli multimodali possono apportare modifiche e adattamenti specifici.
Ma c’è una domanda più profonda: l’IA capisce davvero cosa sta creando o si limita a ricombinare pattern tratti dai dati di addestramento? Per testare il vero ragionamento spaziale, possiamo costringere l’IA a disegnare usando il codice, senza feedback visivo, senza pattern di immagini pre-addestrate su cui basarsi. È come chiedere a qualcuno di dipingere bendato usando solo istruzioni matematiche. Un tipo di codice particolarmente impegnativo da usare per disegnare è TikZ, un linguaggio matematico utilizzato per produrre diagrammi scientifici in articoli accademici.
Se chiediamo a un modello recente, come Gemini 2.5 Pro, di disegnare la nostra lontra con TikZ, il risultato non è perfetto (e Gemini ha preso alla lettera “su un aereo” e ha fatto sedere la lontra sull’ala), ma rappresenta sicuramente un salto di qualità.

Questi disegni in sé non sono importanti quanto il fatto che i modelli stiano ragionando sulle relazioni spaziali partendo da zero. Ecco perché gli autori degli articoli “Sparks” hanno suggerito che questi sistemi non si limitino a un semplice pattern matching basato sui dati di training, ma sviluppino qualcosa di più vicino alla comprensione effettiva.
Se le immagini fisse mostrano progressi impressionanti, la generazione di video rivela la rapidità con cui l’intelligenza artificiale sta accelerando. E, continuando con il tema, ora ci sono modelli di intelligenza artificiale open-weight che possono essere eseguiti sul mio computer di casa, che sono indietro rispetto allo stato dell’arte, ma stanno recuperando terreno.
L’evoluzione delle lontre rivela due tendenze cruciali con importanti implicazioni. In primo luogo, è chiaro che continua a esserci un rapido miglioramento in un’ampia gamma di funzionalità di intelligenza artificiale, dalla generazione di immagini alla generazione di video fino alla generazione di codice LLM. In secondo luogo, i modelli di pesi aperti, sebbene non siano generalmente validi quanto i modelli proprietari, sono spesso solo di pochi mesi indietro rispetto allo stato dell’arte.
Se si mettono insieme queste tendenze, diventa chiaro che ci stiamo dirigendo verso un luogo in cui non solo le generazioni di immagini e video saranno probabilmente abbastanza valide da ingannare la maggior parte delle persone, ma che tali capacità saranno ampiamente disponibili e, grazie ai modelli aperti, molto difficili da regolamentare o controllare. Credo che dobbiamo prepararci a un mondo in cui sarà impossibile distinguere immagini e video reali da quelli generati dall’intelligenza artificiale, con implicazioni per un’ampia fascia della società, dall’intrattenimento che apprezziamo alla nostra fiducia nei contenuti online.
[ndr per vedere il video finale che fa capire i progressi nel campo, visitare il ilnk della fonte]
ParlanDonna