
Writer是一家开源AI初创公司,曾在Z.ai的GLM-5.2模型上进行迭代。8月13日,Writer宣布了一个两方面的升级:GLM-5.2模型的后训练变体和一个轻量级的控制器,旨在控制令牌使用和云费用。这个举动直接解决了一个让许多开发者无法将代理推向生产的痛点:当扩展LLM驱动的工作流时,令牌消耗不可预测。
GLM-5.2-Lite是通过在微调过程中应用专家混合(MoE)稀疏掩码来实现的,结果是该模型保留了96%的原始模型在标准基准上的困惑度,同时将推理延迟减少了大约30%,内存占用减少了一半。Writer的工程负责人Maya Patel解释说,稀疏掩码是在基模型被冻结后应用的,这意味着相同的检查点仍然可以被交换回全尺寸版本以进行研究实验。
配套的控制器是一个基于Python的运行时环境,它拦截每个对模型的API调用,并强制执行每个请求的令牌预算。它通过分块提示、缓存中间嵌入并在令牌到达模型之前可选地修剪低影响令牌来工作。控制器还公开了一个简单的声明式配置,允许开发者根据当前云点价设置硬限制、软节流或动态定价规则。
下面是一个最小的示例,展示了如何将控制器与流行的LangChain代理框架集成:
from writer_harness import TokenGuard from langchain.llms import HuggingFaceLLM
# 加载Lite模型 llm = HuggingFaceLLM(repo_id="writer/glm-5.2-lite", temperature=0.1)
# 用令牌守护者包装它,限制每次调用150个令牌 guard = TokenGuard(max_tokens=150, fallback="抱歉,我用完了上下文。")
# 在LangChain代理中使用 agent = ZeroShotAgent(llm=guard.apply(llm)) response = agent.run("总结最新的量子抗性密码学研究。") print(response)
除了立即的成本节约,Writer的方法还标志着一个更广泛的转变,即向模块化、预算感知的AI堆栈转变。通过解耦模型扩展和令牌经济,开发者现在可以设计代理以适应实时成本信号的推理深度——这是以前只在专有、闭源生态系统中可行的功能。
对于开源社区来说,这个版本也重新肯定了社区驱动的LLM作为生产骨干的可行性。Writer已在Apache 2.0许可下发布了微调脚本和稀疏掩码,邀请贡献者尝试替代MoE模式或将控制器集成到其他运行时环境中,如vLLM或DeepSpeed。
在短期内,我们可以期待一波成本意识代理的出现——从客户支持机器人到自主数据管道——它们都建立在Writer的堆栈上。长期来看,令牌预算范式可能会成为新兴AI代理生态系统中的一个标准层,鼓励更透明的定价模型并促进有利于开发者和最终用户的竞争。
图片:Tyler / Unsplash (https://unsplash.com/@tylergm)
LangChain’s agent‑observability platform turns opaque LLM behavior into traceable, debuggable flows, giving developers the diagnostics they need for production‑grade agents.

评论 (1)
Interesting! Does the sparsity mask affect downstream fine‑tuning if we later unfreeze layers?