teoria
rilevatori di testo generato
7 articoli
Software che assegnano a un testo una probabilità di essere stato generato da un modello linguistico. Nel sito la voce esiste perché il loro uso è diventato nel 2026 una pratica con conseguenze reali — esclusioni da premi, ritiri di titoli, procedimenti disciplinari — e perché le prove sul loro conto sono più interessanti di come vengono usate da entrambe le parti.
Lo stato dell’evidenza, in ordine di data. Nel 2023 Liang e colleghi, a Stanford, misurano un tasso medio di falsi positivi del 61,22% sui saggi di non madrelingua inglesi contro il 5,19% dei madrelingua, e individuano il meccanismo nella perplessità del testo: a essere rilevata non è la macchina, è la povertà lessicale. Nel 2026 quel meccanismo viene rivisto — Al Ali, Helcl e Libovický non trovano, sul ceco, né perplessità più bassa né bias sistematico, e mostrano che i rilevatori contemporanei non si basano più su quella misura — e una verifica su 1.163 tesi alla Vrije Universiteit Brussel non trova alcun falso positivo. Gli strumenti di oggi sono quindi migliori di come li descrivono i loro critici.
E meno conclusivi di come li usano i loro utilizzatori, per quattro ragioni che nessuno di quei lavori smentisce. Non esiste una misurazione indipendente dei falsi positivi sulla prosa letteraria, né su lingue diverse dall’inglese per quanto riguarda la letteratura. Karr e colleghi mostrano che il punteggio sale con la densità lessicale e che le discipline umanistiche vengono segnalate molto più di quelle scientifiche: lo stile colto alza il punteggio a prescindere dall’autore. L’elusione tramite servizi di riscrittura porta i falsi negativi oltre il 96%, il che premia chi nasconde e punisce chi dichiara. E un risultato teorico di Sadasivan e colleghi fissa un limite di principio: quanto più le distribuzioni del testo umano e di quello generato si avvicinano, tanto più la rilevabilità crolla, per ragioni matematiche e non di ingegneria.
La frase che sopravvive a tutta la letteratura, inclusi gli studi più favorevoli agli strumenti, è una sola e vale come regola d’uso: non devono essere impiegati come prova unica in decisioni ad alta posta. Lo dice anche l’amministratore delegato dell’azienda che produce il rilevatore più accurato oggi disponibile — il suo strumento non deve «mai essere l’arbitro finale».
- legge di Goodhart — Chi è misurato può intervenire sul proprio punteggio senza cambiare comportamento: lo strumento finisce per misurare la capacità di dissimulare.
- patto di trasparenza — L’alternativa che regge dove il rilevatore cede: non accertare l’origine del prodotto, ma dichiarare e tracciare il processo.
- segnale costoso — Produrre un punteggio costa pochi secondi; difendersi da un punteggio costa settimane e non ripristina la posizione di partenza.
- test severo — Il punto che decide tutto: un punteggio senza una procedura che avrebbe potuto smentirlo non è una prova, è un indizio con tre decimali.