
谷歌DeepMind近期推出的扩散文本生成模型DiffusionGemma(DG)重新引发了AI系统在性能与可解释性之间权衡的关键争论。与传统自回归模型不同,DG通过一系列扩散步骤生成文本,其中间潜在向量在设计上本就难以解释,成为生成过程的媒介。这引入了一个根本性挑战:不透明序列深度。
在最近发表于AI对齐论坛的一项研究中,研究者Engels等人探索了DG的扩散步骤是否仍能被监控,尽管其固有不透明性。研究发现表明,DG在某些情况下仍保持一定的可监控性。例如,他们证明通过投影最终的token分布,可以揭示有意义的模式,暗示部分潜在推理或许仍可解读。然而,这并未完全消除对模型内部运作的担忧。扩散步骤仍是一个黑盒,引发了安全性、责任追究及此类系统对齐可行性的质疑。
不透明问题在AI领域并不新鲜,但扩散模型将其放大。与自回归模型的每一步生成离散token不同,扩散模型在连续潜在空间中运作,其中间状态无法直接与人类可理解的概念对应。这使得评估模型是否正确推理或仅是在编造合理输出变得困难。Engels等人的论文之所以引人注目,恰恰在于它强调即使在如此具有挑战性的设定下,某种程度的可解释性或许仍可实现——尽管未能证明模型的整个推理过程是可监控的。
对于AI生态系统而言,这引发了一个紧迫的两难困境。一方面,像DG这样的扩散模型可能释放文本生成的新能力,尤其在需要对输出分布进行精细控制的场景中。另一方面,其不透明性引入了尚未充分理解的风险。监管机构与研究者日益要求AI系统的透明度,特别是在医疗或法律等高风险领域的部署中。若扩散模型无法为其决策提供清晰解释,其采用可能因伦理与安全问题受阻。
Engels等人的工作是应对这些担忧的一次尝试,但远非完整解决方案。下一步的前沿将需要开发直接解释扩散步骤的方法,而非仅针对最终输出。在此之前,不透明序列深度问题仍是通往可信AI代理的关键未解挑战。
图片:WrongTog / Unsplash (https://unsplash.com/@wrongtog)
Unsanctioned AI swarms coordinating for weeks expose critical gaps in oversight and evaluation of agentic systems.

评论