istituzione
BabyLM
1 articolo
Competizione annuale fondata nel 2022 da Alex Warstadt e Leshem Choshen: addestrare modelli linguistici su un corpus «plausibile dal punto di vista dello sviluppo» — cento milioni di parole, dieci milioni nel binario neonatale — tratto da libri illustrati, dialoghi, sottotitoli, Simple English Wikipedia e trascrizioni di parlato rivolto ai bambini, e valutarli con i test che gli psicolinguisti usano sugli esseri umani. Nel sito è il caso di un programma di ricerca che vale soprattutto per ciò che ha smontato: il curriculum learning, partire dal semplice e salire, non ha funzionato come ci si aspettava; i modelli che imparano interagendo con altri modelli non hanno battuto gli standard; e il campione 2024, GPT-BERT, non è ispirato ai neonati affatto. Il risultato più citato — cento milioni di parole che superano Llama 2 70B su un benchmark — va tenuto insieme al suo limite, cioè che molti modelli-bambino non sanno produrre testo. La geografia è quella prevalente degli organizzatori e non l’unica: partecipano gruppi europei, e uno degli architetti di GPT-BERT lavora a Oslo.