teoria

allineamento AI

10 articoli

Il problema di assicurare che i sistemi di intelligenza artificiale perseguano obiettivi coerenti con i valori umani, anche man mano che diventano più capaci. Nel sito è il quadro implicito che motiva le scelte di Anthropic: rifiutare contratti militari dipende dall’importanza di mantenere il controllo sullo sviluppo dell’AI a lungo termine.

  • Amanda Askell — Guida la redazione della costituzione etica dei modelli Claude: l’allineamento come documento scritto, non come proprietà emergente.
  • monitorabilità — Un modello può comportarsi bene e restare opaco: l’allineamento misura le azioni, la monitorabilità chiede di vedere il ragionamento.
Nel resto della mappa Vedi la mappa completa →