Per centomila anni una sola cosa al mondo ha imparato una lingua umana fino alla padronanza piena: un bambino. Adesso ce ne sono due, e la seconda ha bisogno di centomila volte più parole. Llama 3.1 ne ha masticate quindici trilioni; i modelli di frontiera, stima Ethan Wilcox di Georgetown, forse dieci volte tanto. Un preadolescente cresciuto in una casa linguisticamente ricca ne ha sentite cento milioni, e con l’alfabetizzazione arriva forse a trecento milioni entro i vent’anni — ma le frasi grammaticalmente corrette cominciano molto prima, intorno ai dieci milioni. Wilcox rende la sproporzione visibile: stampate su carta, le parole di addestramento di un LLM formerebbero una pila che supera la Stazione spaziale internazionale; i cento milioni del preadolescente ne fanno venti metri. Michael Frank, di Stanford, la dice in un altro modo: «dobbiamo ancora bruciare una foresta e raschiare l’intera somma della conoscenza umana per ricreare un traguardo che nei nostri salotti si raggiunge in un anno». Il nome tecnico è data efficiency gap, e nessuno sa spiegarlo. Il pezzo di Elise Cutts ricostruisce prima perché la domanda sia imbarazzante per tutti. Negli anni Cinquanta Chomsky risponde a Skinner con la povertà dello stimolo: la sintassi è troppo complessa e l’esposizione del bambino troppo povera perché si possa imparare dalla sola statistica, quindi la conoscenza della grammatica dev’essere innata. Su quella premessa si costruisce la grammatica generativa, e con essa decenni di AI simbolica che prova a scrivere le regole a mano, fallisce, e finisce nell’inverno degli anni Settanta. Poi arrivano BERT e GPT-2, e i modelli imparano la sintassi proprio nel modo che la linguistica generativa dichiarava impossibile. La concessione più netta è di Alison Gopnik, che non è una scettica dell’AI: «non pensavo sarebbe risultato vero, e credo che la maggior parte delle persone non pensasse che si potesse guardare la statistica di un grande campione di lingua e ricavarne la grammatica». Solo che quel risultato non chiude la questione, la sposta: la statistica basta, ma a un costo che nessun bambino paga. Da qui nasce BabyLM, la competizione fondata nel 2022 da Alex Warstadt e Leshem Choshen: addestrare modelli su un corpus «plausibile dal punto di vista dello sviluppo», cento milioni di parole — dieci milioni nel binario neonatale — presi da libri illustrati, dialoghi, sottotitoli, Simple English Wikipedia e trascrizioni di parlato rivolto ai bambini, valutati con i test che gli psicolinguisti usano sugli esseri umani. Quattro anni di risultati hanno soprattutto smontato le intuizioni: il curriculum learning, partire dal semplice e salire — l’approccio più popolare alla prima edizione, perché somiglia a come crediamo di imparare — non ha funzionato; i modelli sociali, quelli che imparano interagendo con altri modelli, non hanno battuto gli standard; e il campione 2024, GPT-BERT, non è ispirato ai neonati affatto. È un dato con un doppio taglio: su cento milioni di parole GPT-BERT supera Llama 2 70B su uno dei benchmark, il che è molto, e insieme i modelli-bambino restano incapaci di produrre testo, il che è tutto. Il corpo è l’altra pista: il progetto SAYCam ha messo telecamere in testa a tre bambini, Brenden Lake ha addestrato su sessantuno ore di quel materiale un modello che impara a legare oggetti e parole senza nessuno dei bias che la psicologia dello sviluppo riteneva necessari — «si può partire con molto meno di quanto molte teorie suggerissero», dice, ma «alla fine dell’addestramento non ne esce un bambino di due anni». Uri Hasson ha appena registrato i primi mille giorni di vita di diciassette bambini, dodici ore al giorno: «per la prima volta abbiamo l’input». Le due risposte più interessanti alla domanda «cosa manca» non riguardano la scala. Gopnik: i bambini non guardano il mondo passare, esplorano attivamente, cioè scelgono i propri dati, e ciò che cercano è l’empowerment, la capacità di produrre un effetto prevedibile sul mondo. Elizabeth Bonawitz: i bambini sanno di non sapere e hanno una spinta a colmare la lacuna, e soprattutto «non stanno ragionando solo sull’evidenza che viene loro presentata: ragionano sull’insegnante, su cosa l’insegnante sa, e sul perché stia dicendo loro proprio quella cosa». Nessuna delle due è una proprietà che si ottiene aggiungendo token. Il che spiega la posizione di Gopnik sull’industria: i laboratori di frontiera non stanno correndo a imitare i bambini, e sarà semmai la generazione successiva di AI — qualunque cosa sostituisca il transformer — a prendere lezioni dalla psicologia dello sviluppo. Meta è l’unica interessata, e ha declinato l’intervista insieme a Google DeepMind e OpenAI. Restano due ragioni per archiviarlo. La prima è politica e attraversa il pezzo senza esservi dichiarata: David Samuel, ceco che lavora a Oslo, fa notare che una lingua minoritaria come il sami dispone forse di qualche decina di milioni di token, cioè la scala dell’esposizione di un bambino di due anni. Finché il prezzo d’ingresso è quindici trilioni, l’efficienza dei dati decide chi può avere un modello nella propria lingua e chi dovrà usare quello di qualcun altro. La seconda è la formula con cui Warstadt chiude, ed è la più esportabile: «finalmente abbiamo un modello — non nel senso di language model, ma nel senso di organismo modello». Gli LLM come oggetto di psicologia comparata, su cui si possono fare esperimenti che sui bambini sarebbero impensabili: privarli dell’esposizione a una forma grammaticale, simulare gradi diversi di bilinguismo. Richard Futrell: come insegnare una lingua a un alieno e poi aprirgli il cervello per vedere cos’è successo.
Kids outlearn AI—and we still don’t know why
Strumento concettuale Il divario di efficienza fra un bambino e un LLM è di cinque ordini di grandezza e nessuno sa spiegarlo: finché regge, chi non dispone di quindici trilioni di token non può addestrare nulla, e l’efficienza dei dati diventa una questione di sovranità prima che di ingegneria.
In dialogo con → Jensen Huang Thinks A.I. Alarmism Has Gone Too Far