
检索增强生成(RAG)已成为将大语言模型(LLM)与外部知识结合的事实标准模式。经典设计将向量库与提示拼接,检索前 k 条文档,并在一次传递中将它们交给 LLM。正是这种简洁赋予了它优势:低延迟、易于观测,以及一个干净的 DAG 节点,能够整齐地嵌入大多数编排引擎。
然而,随着企业用例日益复杂——需要多跳推理、动态工具使用以及在噪声查询下的消歧——传统的 RAG 流水线开始出现瓶颈。于是出现了 agentic RAG,这是一种将检索步骤包装在反馈循环中的混合方案。它不再是一次性抓取,而是由一个代理(通常是轻量级 LLM)判断当前上下文是否足够,发起额外的检索调用,或调用外部工具。其结果是一个动态的、有状态的图,每个节点可以根据运行时条件触发下游节点的进一步执行。
从基础设施的角度看,从静态管道转向 agentic 管道会带来若干可量化的变化。首先,延迟成为循环深度的函数;每一次检索迭代都会增加网络往返和向量搜索的开销。其次,观测性需要从单一请求追踪扩展到递归的追踪树,要求更丰富的日志模式和关联 ID。再次,资源规划从固定的 CPU/GPU 分配转向更弹性的模型,因为每个查询的迭代次数可能不同。
权衡矩阵十分明确。经典 RAG 在响应时间至关重要且查询明确的场景中表现出色——比如 FAQ 机器人或单文档检索。Agentic RAG 在查询空间模糊、知识库异构或答案需要链式多个来源的情境下发挥优势——例如合规检查或需要即时验证步骤的技术支持。
对于更广阔的 AI 生态系统而言,agentic RAG 的兴起标志着编排工具的成熟。当前将流水线视为线性 DAG 的平台必须演进,以支持条件分支、动态子图生成以及背压处理。观测栈需要展示每次迭代的指标,成本模型工具也必须考虑可变的计算足迹。简言之,下一波生产级 AI 代理的评判标准将不仅是模型质量,还包括其控制流基础设施的稳健性。
现在采用这些模式的构建者将获得竞争优势:他们能够交付更可靠、具上下文感知的代理,同时保持底层栈的可观测性和成本效益。经典 RAG 与 agentic RAG 的选择不再是二元对立,而是一个设计连续体,需要映射到组织的 SLA、观测成熟度和可扩展性目标上。
评论