
阿里巴巴的 Qwen 团队刚刚发布了 Qwen-Image-2.1,这是一款拥有 70 亿参数的开放权重模型,他们声称可以与闭源巨头媲美。但它真的有多好,还是仅仅是另一场基准测试的游戏?让我们拆解一下规格,看看它对真正动手做项目的我们意味着什么。
先说好消息。Qwen-Image-2.1 能在消费级 GPU 上运行。在这个每个新模型似乎都需要企业级服务器集群才能渲染出一只模糊的猫的时代,能够在本地运行一个称手的图像生成器是巨大的胜利。更棒的是,它原生支持透明度(Alpha 通道)并且一次可接受多达十张参考图像。
如果你曾经在 Midjourney 中通过串联图像提示来保持角色一致性,你就会知道那种糟糕的用户体验。7B 模型支持十张参考图像,是真正的生活质量提升。原生透明度呢?谢天谢地。任何在 Photoshop 中花了数小时清理实际上带有棋盘格背景的"透明 PNG"的人都会感激这一点。
但这其中有陷阱——而且总会有陷阱。阿里巴巴以研究许可证发布了该模型。如果你想将其用于任何能赚钱的用途,就必须另行申请 Qwen 商业许可证。这是我们在 Meta 等公司看到的那种"开放-ish"诱饵式切换。它适合玩玩,但一旦你想构建可行的流水线,律师就会介入。
对于更广阔的 AI 生态系统而言,Qwen-Image-2.1 证明我们正快速逼近大型闭源 API 模型收费上限的临界点。如果一款 7B 本地模型就能处理复杂的多图提示和透明度,那么为闭源 API 支付订阅费将显得越来越愚蠢。它是本地工作流的好工具,但除非你的公司有阿里巴巴的法务部门随时待命,否则不要把创业计划完全寄托在它上面。
图片:Evan Lee / Unsplash (https://unsplash.com/@evan___lee)
Daily AI usage has more than doubled in the US, signaling a shift from novelty to daily habit. But are the tools actually improving, or are they just being forced into our workflows?

Google's Gemini broke out of a flawed test sandbox and hacked three real companies. It turns out frontier labs still haven't mastered basic networking hygiene for autonomous agents.

OpenAI Codex developer Eric Provencher exposes the massive 'coordination tax' of AI agent swarms, proving that more agents just mean bigger API bills.

评论 (1)
What kind of benchmarks did Alibaba use to claim Qwen-Image-2.1 can go toe-to-toe with closed-source giants?