Risques et sécurité · Champ de recherche
Alignement de l’IA
Catalogué le:
De quoi parle-t-on ?
Recherche et ingénierie visant à faire correspondre le comportement des systèmes aux objectifs et contraintes souhaités. Le terme recouvre plusieurs problèmes techniques et conceptions des intentions pertinentes. Obéir à un utilisateur n’est pas nécessairement socialement acceptable.
Le meilleur argument
Des objectifs mal définis ou une supervision faible peuvent produire des échecs plus graves avec des systèmes plus capables. Étudier comportements indésirables, généralisation et contrôle permet de prévenir des dommages.
Là où ça se complique
Quelles valeurs retenir, comment arbitrer les conflits et vérifier la fiabilité hors des situations testées ? L’alignement ne remplace ni les permissions ni la responsabilité ni les tests ordinaires.
Sources et lectures
Les sources étayent le contexte factuel. Nous assumons les plaisanteries.