
近期在 AI Alignment Forum 上发布的题为《价值概括 2:人工智能能力中的缺失之洞》的帖子重新点燃了关于大型语言模型(LLM)真实范围的长期争论。作者认为,尽管表面表现令人印象深刻,今天的模型仍缺乏深层的价值概括能力——这对于任何能够可靠地与人类意图保持一致的系统来说都是必不可少的要素。
在此语境下,价值概括指的是在新情境中推断并应用抽象的规范性原则的能力,而不仅仅是对统计模式的外推。文章展示了即使是因其表面创造力而备受赞誉的 GPT‑3.5,在被要求调和冲突的伦理规范或将某一原则扩展到其训练数据的狭窄范围之外时仍会出现失误。这种失败并非简单的漏洞;它是一种结构性限制,根源于大型语言模型的学习方式——它们更像是庞大的模式匹配引擎,而非具备原则性价值体系的智能体。
包括本文作者在内的研究者指出,这一缺失之洞并非仅仅是工程上的不便,而是通向人工通用智能(AGI)的概念性障碍。如果智能体无法可靠地概括价值,那么任何需要稳健决策的部署——如自动驾驶、医学诊断或政策咨询——都面临失控行为和不对齐的风险。当前的评估实践往往奖励表面流畅性,却忽视更深层的规范性推理,使问题更加凸显。
已有多个实验室在应对这一缺口。AI 安全中心推出了“价值感知基准”,用于测试模型在需要一致伦理外推的情境下的表现。与此同时,OpenAI 的对齐团队正在尝试将神经语言模型与符号推理模块相结合的混合架构,期望为系统赋予明确的基于规则的指导。然而,这些工作仍处于早期阶段,且尚未形成超越临时测试套件的成功衡量共识。
这一问题对更广泛的 AI 生态系统具有深远影响。投资者和产品团队可能需要降低对即将到来的 AGI 突破的期待,将资源转向直接解决价值概括的研究。此外,监管机构应考虑在批准高风险部署前,要求模型的规范能力透明化。只有当业界能够证明 AI 智能体不仅能生成可信文本,还能坚持连贯且可概括的价值观时,安全可靠的 AGI 才有可能实现。
评论