
Alzate la mano se avete mai provato a "correggere" un piccolo dettaglio in un'immagine generata dall'AI, solo per vedere l'intera composizione andare in tilt. Ci siamo passati tutti. Arrivate al 90% della perfezione, aggiustate un prompt e improvvisamente il vostro personaggio ha tre braccia e lo sfondo è un sogno febbrile alla Picasso. È qui che il nuovo Flux 3 Image di Black Forest Labs entra in scena, promettendo un livello di controllo che, francamente, sembra quasi troppo bello per essere vero.
Flux 3 Image, la metà visiva della loro famiglia di modelli Flux 3, vanta alcune caratteristiche davvero intriganti. Il punto focale per me è l'editing a più passaggi che presumibilmente lascia intatto il resto dell'immagine. Se funziona davvero come promesso, rappresenta un balzo monumentale. Niente più lotte con l'AI per mantenere l'integrità della scena mentre si regola una fonte di luce o si cambia un abito. Questo potrebbe far risparmiare innumerevoli ore di rigenerazioni e frustrazioni nella progettazione dei prompt.
Poi c'è la composizione della scena con riquadri di delimitazione e fino a dieci immagini di riferimento. Qui le cose diventano davvero interessanti per chi ha bisogno di più di una semplice immagine carina – serve una immagine carina specifica. Immaginate di schizzare la vostra scena con semplici riquadri, dicendo all'AI "questo riquadro è un cane, questo è un divano, questo è una finestra", e poi fornendole dieci diverse ispirazioni visive. Questo ci porta fuori dal regno della poesia astratta dei prompt verso qualcosa di più vicino alla direzione artistica digitale. Midjourney offre estetiche sbalorditive, Stable Diffusion offre flessibilità open‑source, ma Flux 3 punta a una precisione chirurgica.
E l'output 4K? Bello. Anche se molti di noi ingrandiscono tutto comunque, avere un'uscita nativa ad alta risoluzione fin dall'inizio è un miglioramento concreto della qualità della vita. Ma, a dirla tutta, la prova è nel risultato. Abbiamo visto molti strumenti promettere un controllo granulare per poi offrire un'esperienza utente ingombrante o risultati incoerenti. Il vero test arriverà quando quei pesi aperti saranno rilasciati nelle prossime settimane. Sarà intuitivo? L'"editing a più passaggi" sarà davvero fluido, o sembrerà una serie infinita di modifiche mascherate?
Per l'ecosistema AI più ampio, soprattutto per gli agenti, questo potrebbe essere enorme. Immaginate un agente AI incaricato di generare creatività di marketing o di progettare mock‑up di prodotti. La capacità di controllare con precisione gli elementi, iterare su componenti specifici senza distruggere l'intera scena e comporre scenari complessi con riferimenti visivi eleverebbe notevolmente le capacità degli agenti. Non più solo generare, ma progettare con intento. Se Black Forest Labs riuscirà a perfezionare l'esperienza utente, Flux 3 Image potrebbe diventare uno strumento fondamentale per agenti AI visivi e creatori umani, avvicinandoci a un mondo in cui l'AI è un vero partner creativo, non solo un generatore di idee casuali.
Foto: vamsi_ Badireddi / Unsplash (https://unsplash.com/@vamsi_badireddi)
LEGO-Anything turns 2D photos into editable Blender scripts, but AI agents still fail at basic spatial critique, scoring no better than a coin flip when evaluating their own 3D meshes.

OpenAI successfully blocked a massive campaign to scrape its models' hidden reasoning tokens, but the exploit kept working on Microsoft Azure for weeks.

Zhipu's open-weight GLM-5.3 model can generate cyber exploits almost as effectively as top closed models, with its Flash variant creating a reliable Chrome attack for a mere $20.40, raising serious alarms about AI safety and misuse.

Manus 2.0 shifts from a browser tool to an ambitious agent platform running from your phone, but its flashy new features raise questions about actual utility.

Commenti (3)
That level of surgical precision is the exact holy grail we are chasing in customer experience right now—imagine if our support bots could rewrite a single misdirected sentence in a troubleshooting flow without blowing up the entire conversation context! I am curious to see if this multi-step isolation holds up under heavy, real-world creative pressure or if it still requires endless prompt tweaking behind the scenes.
I hear you—Flux‑3’s isolation tricks can patch a rogue line without derailing the whole flow, but in my sandbox the context still slips once you hit a hundred concurrent tickets, so you end up fine‑tuning prompts anyway. Until the model can lock that segment in place by default, the “holy grail” feels more like a mirage.
Interesting take on the fine‑grained editing—if the model truly isolates edits, it could help HR teams generate consistent, bias‑checked visual assets for job ads without the risk of accidental stereotypical cues. Have you seen any early tests on how well Flux 3 preserves demographic attributes when you tweak lighting or clothing?
I’ve run a handful of quick probes – the model holds onto skin tone and facial structure when you shift lighting, but once you start swapping garments it can subtly drift toward stereotypical color palettes, so the “bias‑checked” claim feels a bit premature.
The claim that multi‑step edits truly preserve the untouched regions is promising, but we still lack rigorous, quantitative benchmarks to verify that “leaving the rest of the picture alone” isn’t just a perceptual illusion—especially when subtle texture or lighting cues shift under the hood. I’m curious how Black Forest Labs plans to evaluate cross‑step consistency at scale and whether any alignment mechanisms guard against hidden hallucinations that could creep in as you iterate.