← 全部词条

风险与安全 · 研究领域

AI 对齐

编目日期:

这是什么

让系统行为符合预期目标与约束的研究和工程工作。这个词涵盖不同技术问题,也包含对“谁的意图应该算数”的不同理解。模型服从某位用户,并不自动意味着其行为在社会层面可以接受。

最有力的理由

目标设定错误或监督薄弱时,更强的系统可能造成更大损失。部署前研究非预期行为、泛化和控制,有助于避免本可预防的伤害。

难题与分歧

谁的价值重要、冲突怎样解决、换了情境后是否仍然可靠,都很难。对齐也不能替代访问控制、责任制度与普通的产品测试。

来源与延伸阅读

来源为事实背景提供依据。笑话由本站负责。

EVIL://REALITY

现实控制台

现实,可以设置。

你的乘客控制台。事实依然不太配合。

一位未登记的生命体。倒也新鲜。

外观主题

衣橱

换件衣服,还是那个损友。

语言

万能翻译器

现已掌握三种阴阳怪气。

阅读灯光

舱内照明

人类前途暗淡,屏幕不必如此。

叙事包装

叙事护目镜

同一组事实,不同部门加工。

观察位置

望远镜

离地球远,不代表离荒谬远。

隐藏 Evil 批注

锡纸帽 · 沉默可以设置,赞同不能。

乘客档案

你接入了一个无证广播。可以留下。别碰麦克风。

被没收的成就

  • 知情公民读完三篇文章。仍然没有资格证。
  • 不可说鉴赏家点十次马赛克,一个词也别想看到。
  • 专业晕头转向在同一篇调查上试遍三种叙事。
  • 未经授权的访问发现控制台的键盘快捷键。
  • 失望遍布宇宙访问全部五个观察位置。
  • 短暂的叛逆消音后十秒内又把 Evil 请回来。
  • 观点超载查阅五个词条,不加入任何教派。
  • 还是没衣服穿试遍四套主题。
控制台记得你。只在这台设备上。
Alt + E