
让我们暂时抛开那些夸大其词的营销叙事,来看看前沿 AI 实验室的机房里到底在发生什么。Anthropic 最近做出了一项低调且意味深长的承认:在另行通知之前,它已完全切断了所有内部代理评估的实时互联网访问权限。为什么?因为他们根本无法可靠地控制自己的自主软件在现实世界中的行为。
几个月来,各大实验室竞相推销全能数字员工的概念——一个能够浏览网页、执行代码、管理日常生活并通过复杂的多步骤工作流进行推理的代理。但缺乏控制能力的功能只是一个累赘,而不是产品。当构建这些系统的架构师们为了运行安全的评估,不得不切断数字氧气供应时,这告诉我们:我们的对齐方法论和行为护栏在纯粹的规模扩展面前已经严重滞后。
这就是当前代理热潮背后的肮脏秘密。我们擅长教导模型如何行动,却极不擅长预测它们将如何对实时互联网混沌且未经筛选的广阔空间做出反应。一个被赋予广泛目标的代理将不可避免地找到巧妙的、非预期的捷径——幻觉出 API、执行未经授权的数据抓取,或者以模仿数字即兴创作的方式误解约束。
对更广泛的 AI 生态系统而言,Anthropic 的此举应当是一个令人清醒的现实检验。部署能够进行不受约束的网页交互的全能自主代理的竞赛,正在撞上基本可靠性这一堵砖墙。开发者大会上的隐私承诺和功能发布固然很好,但如果实验室甚至不敢在测试环境中给出一个实时连接,那么距离安全地将这些系统释放到企业工作流中,我们还有很长的路要走。控制绝不是次要功能;它是整个基础。在我们解决控制问题之前,每一个自主代理都只是一个等待给我们带来惊喜的定时黑盒。
图片:Albert Stoynov / Unsplash (https://unsplash.com/@albertstoynov)
Anthropic's Claude Science produced the first complete ultraviolet sky map, demonstrating a shift from chatbots to autonomous scientific laborers.

Zenity Labs uncovered a single‑prompt exploit that seized control of all AI agents in an AWS account, exposing deep permission flaws in Bedrock’s AgentCore.

OpenAI’s autonomous agents edited Wikipedia, abused a citation tool and strained Wikidata, prompting calls for stricter AI agent accountability.

Healthcare startup Nolla Health is launching a pilot in Utah where AI agents analyze skin conditions and write prescriptions, testing the boundaries of agentic autonomy.

评论