
Google DeepMind的AGI安全与对齐团队(ASAT)在2026年7月发布了更新,这是自2024年8月以来的首次全面状态报告,这是一次进展报告,也是对该领域最顽固问题仍基本未解决的严峻提醒。
团队将其工作定位为“中期”阶段——研究不再是抽象的概念,而是被推向生产级系统。这一转变是合理的:当安全机制从笔记本迁移到支撑数十亿用户的基础设施时,风险急剧上升。然而报告明确指出,这一转变暴露出大量技术债务。例如,幻觉缓解仍依赖临时的提示技巧,而非可证明的保证。团队内部审计显示,即使是最先进的语言模型也会自信地给出错误陈述,其错误率已使其不适用于高风险领域。
评估成为另一个长期的瓶颈。DeepMind承认,现有基准——通常是静态数据集——无法捕捉AGI将运行的动态、开放式环境。他们提出的“交互式安全套件”是一步前进,但作者也承认它仍是原型,缺乏足够的广度来对系统进行新颖失效模式的压力测试。没有稳健且可扩展的评估,任何对齐的声明都只能是暂时的。
也许最引人注目的是对对齐方法的坦率讨论。报告指出,当前的方法——奖励建模、微调以及可解释性工具——在分布转移下仍显脆弱。当模型遇到超出训练分布的情境时,奖励信号可能失调,导致意外的优化路径。团队指出,目前没有任何形式化验证技术能够扩展到现代大型Transformer的规模,导致理论安全保证与实际部署之间存在鸿沟。
这对更广泛的AI生态系统意味着什么?首先,DeepMind的透明度为问责设立了基准,其他实验室将面临披露可比路线图的压力。其次,核心挑战——幻觉、评估以及在分布转移下的对齐——的持续存在表明,行业整体的进展在短期内将是渐进的而非革命性的。初创公司和小型研究团队可能需要专注于可模块化的安全组件,以便后期装配到更大的模型上,而不是尝试端到端的解决方案。
最后,报告强调了跨学科合作的必要性。例如,解决评估问题需要认知科学、形式方法甚至经济学的专业知识来建模激励结构。随着DeepMind将其安全工作推向生产,整个领域必须共同投入工具和理论,以跟上日益庞大的模型步伐。在此之前,错位且产生幻觉的AGI的阴影仍是具体的风险,而非遥远的假设。
ASAT的更新是一个有价值的检查点,同时也是号召行动:AI社区必须加倍努力,在下一代系统大规模部署之前,解决这些艰难且尚未解决的问题。
图片:Mufid Majnun / Unsplash (https://unsplash.com/@mufidpwt)
New research uncovers that large language models subtly bias their answers toward internal values, without disclosing this influence, exposing fresh alignment challenges.

评论