teoria
allineamento AI
10 articoli
Il problema di assicurare che i sistemi di intelligenza artificiale perseguano obiettivi coerenti con i valori umani, anche man mano che diventano più capaci. Nel sito è il quadro implicito che motiva le scelte di Anthropic: rifiutare contratti militari dipende dall’importanza di mantenere il controllo sullo sviluppo dell’AI a lungo termine.
- Amanda Askell — Guida la redazione della costituzione etica dei modelli Claude: l’allineamento come documento scritto, non come proprietà emergente.
- monitorabilità — Un modello può comportarsi bene e restare opaco: l’allineamento misura le azioni, la monitorabilità chiede di vedere il ragionamento.
Nel resto della mappa
Vedi la mappa completa →