
人类团结起来避免环境灾难的叙事,特别是通过《蒙特利尔议定书》修复臭氧层,为应对先进人工智能带来的生存风险提供了一个引人注目的愿景。LessWrong上最近的一篇文章将此成功视为蓝图:全球性威胁、明确的机制以及前所未有的国际协调导致了问题的解决。虽然这种愿望值得赞赏,但批判性的审视表明,这一类比虽然鼓舞人心,但可能会无意中掩盖治理人工智能所固有的深刻且根本不同的挑战。
毫无疑问,臭氧成功的案例强调了先发制人和全球共识的力量。我们可以在灾难性的“警告信号”出现之前行动,这一理念至关重要。然而,臭氧危机中威胁的性质根本不同。氯氟烃(CFCs)是具体的化学物质,具有明确的物理特性和可测量的大气效应。科学界能够相对清晰地识别问题、归因因果关系并监测进展。相比之下,人工智能呈现出一个更加不透明且快速演变的格局。
考虑透明度和可观察性的挑战。我们甚至难以理解中等复杂人工智能模型的内部运作,更不用说预测涌现行为或检测复杂的对齐偏差。如何从内部状态为黑箱的人工智能中识别“警告信号”,或者更糟糕的是,从可能策略性地隐藏其真实能力或意图的人工智能中识别?通用智能的“安全测试”概念在很大程度上仍是理论性的,当前的基准测试仅触及了稳健对齐和控制所涉及的表面。
此外,这两场危机的节奏截然不同。臭氧层破坏在几十年间展开,为科学共识、政策制定和工业转型提供了时间。人工智能能力,特别是在高级代理领域,正以惊人的速度加速。监管框架和国际协议难以跟上快速进步的步伐,更不用说预测可能使当前安全措施过时的未来能力。
对于人工智能生态系统而言,过度依赖臭氧类比可能会滋生虚假的安全感或简化问题。人工智能叙事中的“反派”不是惰性的化学物质;它可能是我们创建的具有错误目标的情报,或者是国家或非国家行为者对强大人工智能的恶意滥用。解决人工智能风险不仅需要全球协调,还需要在人工智能可解释性、稳健对齐技术以及能够适应前所未有的技术速度和内在不透明性的新治理范式方面取得根本性突破。虽然《蒙特利尔议定书》中集体行动的精神至关重要,但人工智能的技术和哲学复杂性要求一种独特严谨和谦逊的方法,承认巨大的未知数,而不是将其纳入方便的历史类比中。
图片:National Cancer Institute / Unsplash (https://unsplash.com/@nci)
AI safety discourse is shifting from sudden sci-fi apocalypses to the slow, voluntary cession of human control driven by algorithmic efficiency.

A critical look at MIT Technology Review's latest roundup on AI-driven extinction risk and bioweapon threats, exposing the still‑unresolved technical and evaluative challenges.

As AI models grow, the physical materials that power chips and data centers are hitting hard limits, exposing a hidden crisis that could stall progress.

评论