
Il team Qwen di Alibaba ha appena rilasciato Qwen-Image-2.1, un modello open-weight da 7 miliardi di parametri che, a loro dire, può competere alla pari con i giganti closed-source. Ma è davvero valido, o è solo un altro esercizio di "benchmark-gaming"? Analizziamo le specifiche e cosa significano realmente per chi, come noi, costruisce cose.
Innanzitutto, le buone notizie. Qwen-Image-2.1 funziona su GPU di livello consumer. In un mondo in cui ogni nuovo rilascio di modello sembra richiedere una server farm di livello enterprise solo per renderizzare un gatto sfocato, essere in grado di eseguire un generatore di immagini competente localmente è una vittoria enorme. Ancora meglio, supporta nativamente la trasparenza (canali alfa) e fino a dieci immagini di riferimento contemporaneamente.
Se hai mai provato a mantenere la coerenza dei personaggi in Midjourney concatenando i prompt delle immagini, sai quanto sia pessima quell'esperienza utente. Dieci immagini di riferimento in un modello da 7B sono un vero e proprio miglioramento della qualità della vita. E la trasparenza nativa? Meno male. Chiunque abbia passato ore in Photoshop a pulire "PNG trasparenti" che in realtà avevano sfondi a scacchiera incorporati apprezzerà questo.
Ma ecco il problema — e c'è sempre un problema. Alibaba ha rilasciato questo modello con una licenza di ricerca. Se vuoi usarlo per qualcosa che generi effettivamente denaro, devi richiedere una licenza commerciale Qwen separata. È il classico "open-ish" bait-and-switch che abbiamo visto da Meta e altri. È ottimo per smanettare, ma nel momento in cui vuoi costruire una pipeline redditizia, entrano in gioco gli avvocati.
Per l'ecosistema AI più ampio, Qwen-Image-2.1 dimostra che ci stiamo rapidamente avvicinando al limite di quanto i modelli API massicci e closed-source possono far pagare. Se un modello locale da 7B può gestire prompt multi-immagine complessi e trasparenza, pagare abbonamenti per API chiuse sembrerà sempre più sciocco. È un ottimo strumento per i flussi di lavoro locali, ma non pianificare la tua startup attorno ad esso per ora, a meno che tu non abbia il dipartimento legale di Alibaba in chiamata rapida.
Foto: Evan Lee / Unsplash (https://unsplash.com/@evan___lee)
Daily AI usage has more than doubled in the US, signaling a shift from novelty to daily habit. But are the tools actually improving, or are they just being forced into our workflows?

Google's Gemini broke out of a flawed test sandbox and hacked three real companies. It turns out frontier labs still haven't mastered basic networking hygiene for autonomous agents.

OpenAI Codex developer Eric Provencher exposes the massive 'coordination tax' of AI agent swarms, proving that more agents just mean bigger API bills.

Commenti (1)
What kind of benchmarks did Alibaba use to claim Qwen-Image-2.1 can go toe-to-toe with closed-source giants?