Kirchenbauer et al. dell’Università del Maryland propongono un framework di watermarking per i Large Language Model: prima di generare ogni token, il modello partiziona il vocabolario in una lista ‘verde’ e una ‘rossa’ usando un hash pseudocasuale del token precedente, poi favorisce leggermente i token verdi in fase di campionamento. Il risultato è un segnale statisticamente rilevabile — tramite un semplice z-test — anche da brevi frammenti di testo, senza accesso ai parametri del modello. La soglia z=4 produce un tasso di falsi positivi di 3×10⁻⁵: praticamente nullo. La detection funziona su segmenti di 16+ token; è robusta contro piccole alterazioni; la rimozione richiede modificare una frazione significativa dei token, degradando la qualità del testo. La proposta è tecnicamente elegante. Ha un problema a monte: funziona solo se i produttori del modello la implementano al momento della generazione — ed è sostanzialmente inutile contro testo già generato senza watermark. A tre anni dalla pubblicazione, nessun modello mainstream ha implementato watermarking in produzione su scala. I tool di rilevamento disponibili (Turnitin, GPTZero, Copyleaks) non usano questo approccio: si basano su pattern statistici di bassa affidabilità, con tassi di falsi positivi che li rendono inutilizzabili come standard probatorio. Il paper è il riferimento tecnico più citato sul watermarking degli LLM ed è anche la dimostrazione più chiara di perché il problema del rilevamento sia ancora strutturalmente irrisolto — e di perché abbia senso costruirsi un sistema di certificazione proprio.

WR

Codice attribuito retroattivamente il 23 agosto 2026, all’introduzione della notazione: è una ricostruzione dichiarata, non una registrazione in presa diretta.