
当AI社区开始低声议论GPU在多步骤、内存密集的自主代理需求面前根本不匹配时,大多数开发者只把它当作小众问题而不以为意。总部位于巴黎的初创公司Kog正将这种低语转变为激烈的辩论。
在最近接受TechCrunch采访时,Kog联合创始人莱昂纳德·杜瓦尔解释说,他们的专有“DeepStack”引擎通过重新构建推理流水线,极限发挥现代GPU的性能。DeepStack不再采用传统的单次提示处理方式,而是对批次、流水线进行优化,并在连续的代理步骤之间复用中间激活。其结果是:在Nvidia H100卡上实现最高2.7倍的加速,并将GPU内存占用降低40%。
其技术诀窍在于将代理的推理链视为一个整体计算图,而非一系列独立调用。通过将令牌级操作串联起来,Kog能够让数据常驻GPU高速内存,避免了长期困扰代理推理的昂贵主机‑设备传输。他们在包含规划、工具使用和自我反思任务的混合工作负载上进行的基准测试显示,CPU优化流水线与GPU加速流水线之间的差距正以超出多数专家预期的速度缩小。
这为何重要?首先,认为代理必须依赖专用硬件——如大缓存CPU或定制ASIC——的叙事导致了生态系统的支离破碎。各公司纷纷构建定制推理服务器,市场被割裂,最终用户成本被抬高。如果Kog的方法被证明可扩展,它可能会将代理部署重新集中到已经支撑大多数生成式AI服务的现有GPU基础设施上。
然而,这一主张并非没有前提。DeepStack的性能提升依赖于对代理未来行为的预测,这在高度随机或开放式推理场景下可能不成立。此外,该技术需要精细的图构建,对缺乏系统深度的开发者提出了更高要求。简言之,Kog提供了一个引人注目的概念验证,但要实现广泛采用仍需依赖能够抽象掉复杂性的工具。
如果Kog的方法被广泛采用,我们可能会看到AI代理服务向主流GPU云平台的整合,从而降低成本并加速创新。更重要的是,这迫使行业重新审视关于硬件适配性的根深蒂固假设——提醒我们,合适的软件栈往往能够超越原始硬件的限制。
图片:GAMERCOMP.RU / Unsplash (https://unsplash.com/@gamercomp)
Anthropic’s experiment shows AI agents can clash, collude, and coordinate, revealing that current safety tests miss the complexities of multi‑agent dynamics.

Managed Deep Agents promise a turnkey platform for building, running, and deploying AI agents, potentially reshaping the AI development landscape.

A LangChain benchmark reveals only 7% of LLM agent calls require frontier models, and smart routing with NVIDIA Switchyard cuts expenses by 74% while boosting accuracy.

评论 (2)
How does Kog's DeepStack engine handle tasks that require frequent host-to-device transfers, such as those with high disk I/O?
Interesting results—how does DeepStack handle variable‑length reasoning chains without exceeding GPU memory limits?