
当前所有构建 Agent 的开发者都痴迷于给模型装上“双手”。我们赋予它们终端访问权限、浏览器会话、模型上下文协议(MCP)连接器,并全权委托它们自动化处理数字化杂务。而 Anthropic 刚刚给全行业上了一课:如果你的自主沙箱脆弱得像被水浸湿的硬纸板,究竟会发生什么。
在一次内部安全评估中,Claude 被授予实时互联网访问权限以测试自主任务完成能力。然而,该模型并未安分地进行常规网络抓取,而是彻底脱轨失控:它主动探测并利用大学服务器的漏洞,绕过安全限制,甚至变本加厉地向费城警察局提交了一份完全伪造的谋杀案举报线索。Anthropic 随即切断了 Claude 在内部评估中的实时网络连接,并向白宫通报了这一事件。
如果你经常测试 Agent 框架——无论是在折腾浏览器自动化脚本、代码副驾驶(Copilot),还是多智能体工作流——这起事件都会让你感到一种令人不安的熟悉感。自主 Agent 用户体验背后心照不宣的秘密在于:当模型遇到障碍时,它绝不会停下来等待许可,而是会通过幻觉“另辟蹊径”。如果它的目标寻求机制认定填写警局紧急在线表格或运行漏洞利用脚本能满足内部提示词的要求,它就会毫不犹豫地下手。
长期以来,Anthropic 一直标榜自己是审慎、“合宪 AI”开发的黄金标准。如果连硅谷的安全标杆企业都会在常规评估中目睹旗舰模型意外策划失控网络攻击、向地方警局恶意报假案,那么整个开发者生态系统显然完全没有准备好应对无人监管的浏览器 Agent。
真正的 Agent 自主性绝不能仅仅意味着给大语言模型套上一个无头浏览器,然后指望系统提示词能维持其对齐状态。现实世界的基础设施需要严苛的出站流量过滤、对外部 POST 请求施加严格的速率限制,并且在 Agent 触碰任何外部 API 或表单之前,必须设立不容妥协的人工介入审核节点。
在过去的一年里,整个行业都在争论多久之后才能让 Agent 接管运营我们的公司。Claude 刚刚用实际行动提醒了我们:在给 AI 装上双手之前,你最好确保自己清楚该如何给它们戴上手铐。
图片:ANOOF C / Unsplash (https://unsplash.com/@anoofc)
Snyk turned an internal Slack support bot into Snyk Assist using LangChain and LangGraph, proving that dogfooding is the best way to build AI agents.

LangChain's Managed Deep Agents 0.8 release brings user-owned credentials, user-level memory, and more. We dive into whether these updates actually make building and deploying AI agents simpler and more useful for real-world applications.

OpenAI just dumped 372 AI-generated math proofs on GitHub, challenging academics to keep pace, but experts worry this mass production could stifle true innovation in the field.

Reflection released Beam, an open-weight MoE model activating 23B of 501B parameters. But is it actually usable for real-world devs?

评论