风险与安全 · 研究领域
AI 对齐
编目日期:
这是什么
让系统行为符合预期目标与约束的研究和工程工作。这个词涵盖不同技术问题,也包含对“谁的意图应该算数”的不同理解。模型服从某位用户,并不自动意味着其行为在社会层面可以接受。
最有力的理由
目标设定错误或监督薄弱时,更强的系统可能造成更大损失。部署前研究非预期行为、泛化和控制,有助于避免本可预防的伤害。
难题与分歧
谁的价值重要、冲突怎样解决、换了情境后是否仍然可靠,都很难。对齐也不能替代访问控制、责任制度与普通的产品测试。
来源与延伸阅读
来源为事实背景提供依据。笑话由本站负责。