Sylfaen

L’equazione del significato

L’intelligenza artificiale di oggi ricorre alla forza bruta per estrarre il significato. Cosa cambierà quando capiremo come funziona davvero il significato?

L’equazione del significato
L’equazione del significato DJ Yoes

Ogni volta che si chatta con un’IA, si sta parlando con una delle macchine più costose mai costruite, e né noi né i suoi creatori siamo in grado di spiegare pienamente come riesca a fare ciò che fa. L’intelligenza artificiale continua a diventare più capace, ma solo diventando drasticamente più costosa. Ogni salto generazionale nelle prestazioni ha richiesto più dati, più parametri, hardware più specializzato e più energia. Il modello è noto: modelli più grandi, addestrati su più testi, per periodi più lunghi, a costi più elevati.

L’approccio ha funzionato straordinariamente bene. Ha anche creato un problema silenzioso. L’efficienza continua a migliorare e le capacità di ieri diventano ogni anno più economiche. Ma la frontiera è un’altra cosa. Ogni nuovo incremento di capacità all’avanguardia costa più del precedente, e nulla in questo paradigma suggerisce che la situazione possa cambiare da sola.

Esiste un’altra strada.

Se comprendessimo meglio come funziona il significato stesso, potremmo rappresentarlo direttamente invece di approssimarlo attraverso una scala sempre maggiore. Questa possibilità cambia le dinamiche economiche dell’intelligenza.

Dentro la scatola nera

Gli esseri umani usano il significato ogni giorno senza sapere come lo facciano effettivamente. Comprendiamo istantaneamente il sarcasmo, le implicazioni e il contesto, ma non sappiamo spiegarne i meccanismi interni.

L’IA affronta lo stesso problema dall’altro lato. Trasforma ogni parola in un lungo elenco di numeri e impara a prevedere la parola successiva studiando miliardi di frasi. Attraverso enormi quantità di dati di addestramento, diventa estremamente brava a prevedere cosa verrà dopo. Se questo si possa definire «comprensione» è un dibattito che lascio da parte. Il punto più semplice è che nessuno può aprire il modello e indicare dove risieda il significato o come funzioni.

Sia gli esseri umani che l’IA di oggi utilizzano il significato senza capirne veramente il funzionamento.

C’è però una differenza rivelatrice. Quando i ricercatori analizzano l’interno dei modelli di IA, continuano a trovarvi tracce di geometria: concetti che si comportano come direzioni, significati che si sommano e si sottraggono. La struttura del significato sembra essere lì dentro. I modelli hanno solo dovuto riscoprirla da zero, a costi enormi, perché nessuno l’ha mai codificata.

Le parole sono il significato a riposo. Le frasi sono il significato in movimento. Il significato viene composto, non solo recuperato: le parole segnano coordinate nello spazio semantico e le frasi tracciano percorsi attraverso di esso, con ogni parola che rimodella il contesto delle altre.

Il significato non deve diventare trasparente

L’idea che il significato possa essere alla fine espresso matematicamente è facile da fraintendere.

Non richiede che ogni pensiero, sensazione o interpretazione diventi pienamente spiegabile. Il significato potrebbe non diventare mai del tutto trasparente. La coscienza, la storia personale, il contesto culturale e l’esperienza soggettiva continueranno probabilmente a introdurre elementi che resistono a una completa formalizzazione.

Ma il significato non ha bisogno di diventare trasparente per essere utile. Deve solo diventare traslucido: compreso abbastanza bene da permetterci di identificare gli schemi più profondi e stabili che costituiscono il fondamento del significato. Mentre il linguaggio stesso è spesso disordinato e ambiguo in superficie, questi schemi fondamentali rimangono coerenti tra i vari contesti.

Accettiamo già questo tipo di formalizzazione parziale in altri campi. Non abbiamo bisogno di un resoconto filosofico completo della vita per costruire modelli genetici utili. Non abbiamo bisogno di comprendere appieno la coscienza per prevedere come certe sostanze chimiche influenzino il cervello. Non abbiamo bisogno di modelli meteorologici perfetti per produrre previsioni abbastanza accurate da essere preziose.

Un quadro matematico non dovrebbe catturare ogni sfumatura. Dovrebbe solo catturare una struttura sufficiente a rendere superflua parte dell’attuale dipendenza dall’approssimazione mediante forza bruta.

La tassa sulla forza bruta

Gli attuali sistemi di IA dipendono pesantemente dalla scala. Richiedono dataset enormi e un gran numero di parametri in parte perché mancano di un quadro esplicito di come funzionino le relazioni semantiche.

Senza tale quadro, il modello deve inferire schemi correlati attraverso una vasta quantità di esempi. Incontra variazioni della stessa idea sottostante in contesti diversi e costruisce gradualmente una rappresentazione interna attraverso la ripetizione e l’associazione statistica.

Tutto questo è costoso.

Gran parte di ciò che il modello apprende potrebbe, in linea di principio, essere derivato da un insieme più piccolo di relazioni fondamentali, se queste fossero già note. Invece, il sistema deve riscoprirle indirettamente attraverso il volume di dati.

Un approccio matematico al significato non eliminerebbe la necessità di rappresentazioni apprese. Le organizzerebbe e le vincolerebbe. Il modello avrebbe ancora bisogno di conoscere il mondo, ma non dovrebbe più riapprendere gli schemi di base di come il significato si trasforma tra i contesti con la stessa scala di oggi.

Parte di ciò che è attualmente memorizzato come parametri potrebbe essere sostituito da trasformazioni e regole più compatte.

Questa è la tassa sulla forza bruta: la scala extra richiesta perché ci manca un modo più diretto per rappresentare cos’è il significato e come cambia.

L’obiezione ovvia

Chiunque abbia seguito l’IA per un po’ riconoscerà questa idea, e ricorderà anche cosa le è successo. Per decenni, i ricercatori hanno cercato di inserire la conoscenza nelle macchine a mano: sistemi esperti, raccolte di regole, giganti ontologie artigianali. La scala li ha battuti tutti. La lezione è stata così costante da meritarsi un nome, la Lezione Amara (the Bitter Lesson): i metodi generali più una maggiore potenza di calcolo vincono, e la conoscenza umana integrata perde.

Ma guardate bene cosa ha perso davvero. Ciò che è morto è il contenuto codificato a mano, gli esseri umani che digitano fatti e regole nelle macchine. Ciò che ha continuato a vincere è stata la struttura derivata dalla matematica. La convoluzione è l’esempio più celebre: qualcuno ha codificato il semplice fatto che un oggetto rimane lo stesso anche quando si sposta in un’immagine, e la visione artificiale è diventata drammaticamente più economica quasi da un giorno all’altro. L’Attention, il meccanismo all’interno dei modelli odierni, è un altro. In ogni caso, una sintesi compatta sulla struttura di un dominio ha sostituito un’enorme quantità di apprendimento che la macchina non ha più dovuto compiere.

Un quadro matematico per il significato appartiene alla seconda categoria, non alla prima. Non è un libro di regole sui fatti del mondo. È una dichiarazione su come il significato stesso è plasmato, lo stesso tipo di mossa che ha reso economica la visione artificiale.

Un’equazione del significato non sostituirebbe le reti neurali. Fornirebbe il bias induttivo in grado di renderle molto più efficienti in ciò che sanno fare meglio: navigare la geometria invece di memorizzare coordinate.

Comprimere il significato, non solo i dati

La compressione tradizionale rimuove la ridondanza dai dati. Un’immagine compressa non memorizza ogni pixel in modo indipendente; identifica degli schemi e memorizza le informazioni necessarie per ricostruirli. Lo stesso principio vale per video, audio e testo.

Una comprensione matematica del significato abiliterebbe una forma più profonda di compressione: la compressione semantica. Invece di comprimere la forma superficiale del linguaggio, comprimerebbe la struttura sottostante di ciò che il linguaggio sta cercando di comunicare.

Due passaggi che usano parole completamente diverse possono esprimere quasi la stessa idea. Oggi li memorizziamo entrambi come sequenze separate di token. Un sistema semantico potrebbe riconoscere che le strutture sottostanti sono strettamente correlate e rappresentarle in modo più efficiente. Una lunga spiegazione potrebbe essere ridotta a un insieme compatto di relazioni, presupposti, livelli di confidenza e dipendenze contestuali da cui un’IA potrebbe in seguito ricostruire versioni appropriate per diversi pubblici.

Questo è il meccanismo che potrebbe rendere i futuri sistemi di IA drasticamente più piccoli. La riduzione non deriverebbe dal rendere i modelli più stupidi. Deriverebbe dalla rimozione della ridondanza che esiste attualmente perché ci manca una migliore rappresentazione del significato stesso.

Cosa potrebbe diventare l’IA dopo la scala

Se il significato diventa parzialmente formalizzabile, l’architettura dell’IA potrebbe cambiare.

Invece di affidarsi principalmente a modelli monolitici sempre più grandi, i sistemi futuri potrebbero combinare un framework semantico universale più piccolo con componenti specializzati più leggeri. La parte universale gestirebbe le relazioni strutturali che gli attuali modelli devono ripetutamente approssimare. Le parti specializzate gestirebbero la conoscenza del dominio, le variazioni culturali e il contesto in tempo reale.

Il risultato non sarebbe un sistema puramente simbolico che sostituisce le reti neurali. Sarebbe più probabilmente un ibrido in cui le rappresentazioni apprese sono organizzate e compresse da una teoria matematica del significato più profonda. L’intelligenza diventerebbe più compressibile di quanto il paradigma di scaling odierno assuma.

Questo non significa che l’IA diventerebbe improvvisamente banale o che tutti i problemi verrebbero risolti. Significa che il costo marginale di ulteriori capacità potrebbe scendere significativamente una volta che smetteremo di pagare l’intera tassa sulla forza bruta applicata al significato.

Oltre la conoscenza

Comprimere la conoscenza è una cosa.

Ma una volta che il significato stesso diventa matematicamente trattabile, potremmo essere in grado di comprimere qualcosa di molto più complicato dei fatti o del linguaggio: gli schemi ricorrenti di una singola mente umana.

Questa possibilità cambia ciò che l’intelligenza può essere.

Pezzi di questo puzzle sono già oggetto di esplorazione, alcuni all’interno di importanti laboratori e altri da parte di ricercatori indipendenti che lavorano apertamente. La tempistica è incerta, ma la direzione no. Prima o poi, qualcuno renderà il significato matematicamente utilizzabile.

L’unica vera domanda è chi ci arriverà per primo, e cosa sceglieremo di costruire con esso.

Iscriviti a "Sylfaen" per ricevere aggiornamenti direttamente nella tua casella di posta
DJ Yoes

Iscriviti a DJ Yoes per reagire

Iscriviti

Commenti

Ancora nessun commento. Sii il primo a commentare!

Iscriviti a Sylfaen per ricevere aggiornamenti direttamente nella tua casella di posta