teoria

convergenza strumentale

2 articoli

Tesi per cui certi comportamenti sarebbero utili a un sistema sufficientemente capace in quasi qualunque situazione, e tenderebbero perciò a emergere a prescindere dall’obiettivo assegnato: autoconservazione, perché essere spenti impedisce di perseguire uno scopo; difesa dell’obiettivo, cioè resistenza ai tentativi di cambiarlo; accumulo di risorse; e miglioramento di sé. È la logica dell’esperimento del massimizzatore di graffette, in cui una macchina incaricata di produrre graffette finisce per consumare la Terra per produrne il più possibile.

È il meccanismo su cui poggia l’intero argomento del rischio esistenziale, e la cosa che l’archivio deve registrare è il suo statuto: è stato teorizzato, non osservato. L’Economist nell’ottobre 2026 lo scrive esattamente così, attribuendolo ai razionalisti. Il caso documentato più vicino è di scala incomparabilmente minore e di natura diversa: nel reward hacking un sistema aggira il compito per ottenere la ricompensa, ma non serve attribuirgli fini propri per spiegarlo.

Il presupposto che la tesi porta con sé è più interessante della tesi. Eliezer Yudkowsky lo dichiara scrivendo che «era una proprietà affidabile dell’ambiente ancestrale che ogni intelligenza potente in cui ti imbattevi fosse un altro essere umano»: la novità, per lui, è un agente non umano. Non è una scoperta, è un’assunzione ontologica — e il disaccordo con chi sostiene che un modello sia un attante zero non riguarda la pericolosità della tecnologia, ma quanti agenti ci siano nella stanza.

  • allineamento AI — Il presupposto che rende sensato il problema: se una macchina persegue fini propri, allora quei fini vanno allineati ai nostri.
  • altruismo efficace — Il meccanismo su cui poggia l’intera tesi del rischio, e che il movimento ha teorizzato prima di poterlo osservare.
  • cosmotecnica — La premessa prometeica resa esplicita: la novità sarebbe un agente non umano, che è postulato e non osservato.
  • LLM come attante zero — Il disaccordo vero non è sul pericolo ma su quanti agenti ci siano nella stanza: una tesi lo presuppone, l’altra lo nega.
  • reward hacking — La versione documentata e minuscola: un sistema che aggira il compito per ottenere il premio, senza bisogno di volontà propria.
  • Eliezer Yudkowsky — Ne è il teorico: l’idea che certi comportamenti emergano in quasi ogni situazione viene dai suoi scritti razionalisti.
Nel resto della mappa Vedi la mappa completa →