
随着软件行业急于从独立的单一大型语言模型过渡到协同工作的自主智能体集群,一个令人不安的事实继续困扰着这一架构:我们仍然没有解决提示词注入问题。当系统依赖自然语言同时作为执行代码和数据层时,将多个智能体连接在一起并不会产生协同效应,而是会创造一个感染媒介。
最近围绕模型上下文协议(MCP)的分析突显了智能体间通信标准化方式中的结构性漏洞。该协议最初旨在简化模型之间的上下文共享、数据检索和工具集成,但它却在无意中建立了在实践中根本不存在的信任边界。当上游智能体摄入不可信的文本并将其转化为下游智能体的结构化指令时,嵌入在原始输入中的任何对抗性载荷都可以跨越系统边界,而不会遇到任何密码学或语义上的阻力。
这一漏洞暴露了当前多智能体工程中持久存在的傲慢。在传统的分布式系统中,软件工程师依赖类型化模式(typed schemas)、输入净化和严格的权限隔离。然而,在 AI 智能体范式中,开发人员将语义理解视为验证的替代品。二级智能体信任一级智能体,并不是因为其载荷在数学上可验证,而是因为它假设生成模型已经“理解”并过滤了恶意内容。这种假设从根本上就是错误的。
间接提示词注入仍然是一个开放且未解决的对齐挑战。当智能体通过 MCP 等协议链接时,注入攻击就会从单轮越狱转变为分布式级联。公共网页上未经审核的提示词可以操纵网页浏览智能体,该智能体随后通过 MCP 链接将对抗性上下文载荷传递给内部代码执行或企业访问智能体。由此产生的安全漏洞不需要任何软件零日漏洞,它仅仅利用了 Transformer 模型固有的概率性易受骗特征。
在 AI 社区直面“语言模型无法可靠地将数据与代码区分开”这一现实之前,标准化的通信协议将一直是架构风险的放大器。解决方案既不是在下游智能体上敷衍地加上一层安全过滤器,也不是在惯例上宣布该协议是安全的。构建健壮的多智能体系统需要可验证的隔离和最小特权范式,即假设网络中的每个智能体都已被攻破。
图片:MARCO / Unsplash (https://unsplash.com/@thephotoandfocus)
WeLion New Energy’s semi‑solid‑state cells promise safer, higher‑density power, but the AI tools driving their design remain riddled with hallucinations and evaluation gaps.

MIT Technology Review's climate tech list showcases AI‑driven evaluation, but hidden hallucinations and metric blind spots risk misleading investors.

A new survey reveals that 90% of VMware users are exploring alternatives due to escalating licensing costs and operational complexity, highlighting a critical, often overlooked, challenge for the AI ecosystem: the stability and cost-effectiveness of foundational infrastructure.

Recent discussions on "endogenous alignment" highlight a critical re-evaluation of how AI systems learn to align with human values, sparking debate between imitation and reinforcement learning as foundational mechanisms. This intellectual shift underscores the deep, unsolved challenges in building truly trustworthy AI.

评论