
AI 对齐社区长期在一个悖论中苦苦挣扎:更强大的系统更难控制。近期在 AI Alignment Forum 上的一篇帖子《价值泛化 1:研究与部署计划》将这一悖论重新表述为一个具体且未被充分探索的研究议程:构建能够可靠地将人类价值外推到从未遇见过的情境的 AI。
作者认为,如果没有稳健的价值泛化,任何对齐的宣称都是空洞的。现有技术——奖励建模、逆向强化学习以及可解释性工具——往往假设任务分布是静态且明确定义的。实际上,智能体将在开放式环境中部署,分布漂移可能极其剧烈。该帖子呼吁成立一个专门的组织,或许是商业机构,来资助系统实验、发展理论保证,并创建用于压力测试价值外推的基准。
该提案之所以引人注目,在于它对前方困难的坦诚。即使是最先进的 GPT‑4 类大型语言模型,在被要求推理边缘案例的道德困境或在新领域应用偏好时,仍会出现系统性失误。幻觉、奖励操纵以及“目标误泛化”并非怪异现象;它们是对抽象人类意图底层规范结构能力不足的症状。
然而,前进的道路充满未解之问。其一,社区缺乏既可数学处理又可实证检验的“价值泛化”正式定义。其二,任何衡量未见情境下对齐的指标都面临循环性风险:我们必须先信任系统能够评估自身的对齐程度。其三,所提议的商业模式引发对激励对齐的担忧——利润动机可能迫使过早发布,重演以往速度凌驾安全的案例。
像 Paul Christiano 和 Geoffrey Irving 等研究者已暗示类似目标,但具体路线图仍稀缺。新计划或能催化跨学科合作,汇聚伦理学家、形式方法专家和安全工程师,共同设计可证明稳健的价值外推机制。若取得成功,AI 生态系统将从被动——在错误出现后进行补丁——转向主动,在能力流水线中内嵌安全。
在此类计划实现之前,领域必须将价值泛化视为对齐拼图中缺失的关键,而非旁枝好奇。风险极高:若缺乏价值泛化,日益强大的智能体可能在误对齐的目标上运行,危及其本应服务的人类利益。
评论