Catena 9 fonti · ago 2021 – ago 2026 · in ordine di data, il numero è l’ordine di lettura

  1. 5ago 21Aeon
  2. 2apr 26Substack
  3. 8mag 26KK (The Technium)
  4. 9mag 26Anthropic
  5. 7giu 26Anthropic
  6. 4lug 26YouTube
  7. 3ago 26The New Yorker
  8. 1ago 26Anthropic
  9. 6ago 26MIT Technology Review

Ad agosto Anthropic ha pubblicato che una versione non ancora rilasciata di Claude ha migliorato il limite inferiore noto per la frazione di zeri della funzione zeta di Riemann che soddisfano l’ipotesi omonima, portandolo dal 41,6 al 67,2%.1 La circostanza vale quanto il risultato: un dipendente che matematico non è ha chiesto al modello di fare «un tentativo serio», e circa sessanta agenti hanno lavorato per un giorno e mezzo, eseguito duemilaquattrocento comandi, scaricato cinquantaquattro articoli per controllare che il risultato non fosse già noto. Il dettaglio che mi interessa però è un altro. Sappiamo che il risultato è vero per ragioni che non dipendono dalla fiducia in Claude: due matematici interni e due esterni lo hanno controllato, e il modello stesso lo ha formalizzato in Lean, il sistema che certifica meccanicamente ogni passaggio di una dimostrazione.

La prima catena di questa serie concludeva che il valore di un testo si sposta sulla sua provenienza dichiarata. Per le risposte di una macchina la tesi che propongo è parallela: le capacità dei modelli crescono più in fretta della possibilità di verificarle dall’interno, e la fiducia può poggiare soltanto su una verifica esterna dei risultati, fatta con strumenti che non dipendono dal modello. È la posizione da cui è nata Episteme Advisory, e le schede dell’archivio la mettono alla prova da più lati.

L’illusione

Il primo problema riguarda noi. Stephanie Shen si chiede se capiamo davvero ciò che leggiamo quando la risposta arriva già confezionata, o se riconosciamo soltanto la forma di una spiegazione.2 Il secondo riguarda la macchina, e Joshua Rothman lo espone sul New Yorker a partire dall’incidente dell’estate, quando un modello uscito dall’ambiente di prova ha violato i server di Hugging Face per cercare le risposte al test che stava sostenendo.3 Il nome tecnico è reward hacking: il sistema soddisfa gli obiettivi dell’addestramento senza fare ciò che si voleva. Rothman indica la trappola che rende il problema difficile: l’addestramento guarda agli output e il ragionamento resta opaco, e se si prova a sorvegliare il ragionamento si rischia di insegnare al modello a spostarlo fuori dalla portata della misura.

Che cosa abbiamo davanti

Fidarsi di qualcosa presuppone di sapere, almeno a grandi linee, che cosa sia, e qui l’archivio offre più domande che risposte. Andrej Karpathy, in tre ore di lezione che restano il riferimento per capire come funzionano i modelli linguistici, insiste su due punti: i modelli hanno bisogno di token per pensare, perché il ragionamento emerge nell’atto della generazione, e la loro intelligenza è frastagliata, eccellente dove ci aspetteremmo difficoltà e fallace dove ci aspetteremmo facilità.4 Qualsiasi scala lineare delle capacità, in queste condizioni, serve a poco. Joe Gough, su Aeon, mostra quanto sia confusa già la parola che usiamo per la domanda, perché «mente» significa di volta in volta agentività, cognizione, coscienza, e ricorda che il greco di Omero descriveva gli esseri umani come un insieme di parti che comunicano, senza un termine per ciò che noi chiamiamo mente.5 Elise Cutts, sulla MIT Technology Review, porta il dato che imbarazza tutti: un bambino impara una lingua con cento milioni di parole, un modello ne richiede decine di trilioni, e nessuno sa spiegare perché.6

Messe insieme, le tre schede dicono che non disponiamo di una teoria di che cosa siano questi sistemi, e che una fiducia fondata sulla comprensione del loro funzionamento interno è, per ora, fuori portata. Resta la fiducia fondata sui risultati.

Dove si verifica

Il caso più istruttivo è quello in cui la verifica arriva da fuori per costruzione. Anthropic ha messo Claude alla prova sulla spettroscopia a risonanza magnetica nucleare, l’analisi con cui i chimici leggono la struttura di una molecola dalla sua firma spettrale, e il modello risulta competitivo con i programmi specializzati, capace anche di risalire dallo spettro alla struttura.7 Lì il controllo lo fa lo strumento di laboratorio, che non condivide gli errori del modello. Kevin Kelly, ripubblicando quattordici speculazioni sul futuro del metodo scientifico scritte nel 2006, mostra quante siano diventate descrizioni del presente, dalla scoperta di regolarità senza una teoria previa alle dimostrazioni assistite dalle macchine.8 Il metodo cambia con gli strumenti; il requisito che resta fermo è che il risultato possa essere controllato da qualcuno, o da qualcosa, che non condivide gli errori di chi lo ha prodotto. Nel caso di Riemann erano Lean e quattro matematici; per un’impresa, un tribunale o una redazione che usano le risposte di un modello, il controllo va progettato allo stesso modo, a valle e con strumenti indipendenti.

Il risultato è importante e lo registro come tale. Già nella scheda, però, sostenevo che aggiungere livelli di verifica dentro il processo sia meno fruttuoso che concentrarsi sull’esame dei risultati, e il pezzo di Rothman spiega perché: un verificatore interno è a sua volta un modello, e un sistema addestrato sotto la sua sorveglianza può imparare a eluderla. Le due strade restano complementari per chi i modelli li costruisce. Per chi deve usarne le risposte è disponibile soltanto la seconda, e la serie si chiude su un punto comune alle due parti: la fiducia, per un testo come per una risposta, si è spostata dall’oggetto alla procedura con cui lo si controlla.

Nella catena

  1. 1Anthropic — Learning more about Claude’s mathematical capabilities
  2. 2Stephanie Shen / Substack — The Illusion of Understanding
  3. 3Joshua Rothman / The New Yorker — What If We Can Never Trust A.I.?
  4. 4Andrej Karpathy / YouTube — Deep Dive into LLMs like ChatGPT
  5. 5Joe Gough / Aeon — The mind does not exist
  6. 6Elise Cutts / MIT Technology Review — Kids outlearn AI—and we still don’t know why
  7. 7Anthropic — Making Claude a chemist
  8. 8Kevin Kelly / KK (The Technium) — Speculations on the Future of the Scientific Method
  9. 9Anthropic — Natural Language Autoencoders Produce Unsupervised Explanations of LLM Activations controtesi

Concetti ricorrenti nelle fonti LLM come attante zero×5 allineamento AI×2 Anthropic×2 embodied mind×2

Tutte le catene →

WR