
我们都见过那些炫酷的 GitHub 仓库和风投路演 PPT,它们承诺未来只需一个 AI 智能体“群组”(swarm),就能在你惬意地喝着玛格丽特鸡尾酒时,魔法般地帮你构建出下一个创业项目。这听起来确实很美妙。一个主管智能体、一个开发智能体、一个测试智能体,或许还有一个设计智能体,它们都在一个数字 Slack 聊天室里交流。但如果你真的尝试运行过这些配置,你可能会注意到两件事:它们运行得极慢,而且你的 API 账单数字长得像电话号码。
如今,OpenAI Codex 开发者 Eric Provencher 用确凿的数据证实了我们许多人的猜想。他警告说,运行两个以上并行的子智能体基本上就是在烧钱,而且对质量没有任何提升。Provencher 指出了一个令人咋舌的项目:一个由 1393 个智能体组成的群组,为了重构一个 Python 代码库,竟然消耗了高达 20,000 美元的 Token——而这样一个任务,如果使用像 GPT-6 Astra 这样单个先进的推理模型,可能只需极低的成本就能轻松搞定。
Provencher 将此称为“协调税”。简而言之,智能体之间互不信任。当你把一堆大语言模型(LLM)放在一个循环中时,它们会把大部分时间花在反复确认、纠正和争论彼此的工作上。这就像是数字化版本的臃肿企业委员会会议——什么事也没干成,但每个人都按小时拿薪水。
作为一个每天都在测试这些工具的人,我对这种痛点深有体会。不可否认,群组框架的用户体验(UX)确实令人着迷——看着终端窗口滚动着“智能体 A 正在思考……”字样,感觉就像生活在未来。但它的实用价值目前还跟不上。大多数多智能体框架都显得臃肿、未经优化,坦率地说,这是懒惰工程的产物。开发者们只是在不断往问题上堆砌更多的智能体,而不是去设计更好的提示词、构建稳固的确定性护栏,或者使用单智能体推理循环。
对于 AI 生态系统来说,这是一个非常需要的现实警钟。“智能体臃肿”的时代正在撞上经济现实的南墙。如果你现在正在构建 AI 工作流,请跳过包含 10 个智能体的群组。坚持使用一个高质量的推理模型,给它一个扎实的系统提示词,也许——仅仅是也许——再配上一个单独的审查智能体来评估输出。你的钱包会感谢你的。
图片:Tyler / Unsplash (https://unsplash.com/@tylergm)
Spotify is finally letting parents exclude kids' music from their Wrapped and personalized recommendations, fixing a long-standing algorithmic UX nightmare.

Apple has finally rolled out its long-awaited Siri upgrade built on Google's Gemini models, bringing screen context and multi-step tasks, alongside some classic AI hiccups.

评论