Vai al contenuto

I pesi BF16 di Qwen-Image 2.1 sono online: generazione ed editing unificati, trasparenza RGBA, dieci riferimenti, requisiti e checklist per provarlo.

L’ANALISI

Qwen-Image 2.1 è scaricabile: cosa cambia con i pesi da 7B

I pesi BF16 di Qwen-Image 2.1 sono online: generazione ed editing unificati, trasparenza RGBA, dieci riferimenti, requisiti e checklist per provarlo.

3 min di letturaFatti, limiti e fonti primarie
Composizione di esempio generata dal modello Qwen-Image 2.1
Esempio ufficiale di Qwen-Image 2.1, il modello visuale da 7B ora distribuito con pesi BF16.

In breve: Il delta materiale è la disponibilità effettiva dei pesi: Qwen-Image 2.1 può ora essere scaricato e avviato con Diffusers. Il componente visuale da 7B gestisce generazione ed editing nella stessa pipeline, include output RGBA e accetta fino a dieci immagini di riferimento, ma prestazioni e memoria reale vanno misurate sulla propria GPU.

Il delta verificato

Il 30 settembre il repository Hugging Face ha ricevuto configurazioni, tokenizer, VAE, text encoder e shard Safetensors del transformer. Non è soltanto una pagina di annuncio: i file necessari alla pipeline sono effettivamente scaricabili.

Architettura e funzioni

Qwen descrive un componente visuale da 7B con 32 livelli DiT single-stream, attenzione a granularità mista e riuso della cache KV. La stessa pipeline copre testo-immagine, modifica di immagini, estrazione di soggetti e creazione o modifica con canale alfa.

Editing con riferimenti e maschere

Il modello dichiara supporto fino a dieci immagini di riferimento. Gli interventi locali possono essere indicati con cerchi, annotazioni dipinte o maschere separate; l’obiettivo dichiarato è preservare identità di persone e prodotti durante le trasformazioni.

Avvio e formati

L’esempio ufficiale usa PyTorch 2.4 o successivo, Transformers 5.17 o successivo, la versione Git di Diffusers e tensori bfloat16. Sono documentati output 2K in più rapporti, incluso 2752×1536 per 16:9, oltre al CPU offload per ridurre la pressione sulla VRAM.

Licenza e distribuzione

I file sono pubblicati come Safetensors sotto Qwen Research License Agreement. Open weights non significa automaticamente licenza permissiva per ogni uso commerciale: prima di integrare il modello in un prodotto occorre leggere le condizioni applicabili.

Condizioni e limiti

Le capacità e la qualità mostrate provengono dal team Qwen. Non abbiamo ancora un benchmark indipendente su consumo VRAM, tempo per immagine, fedeltà del testo italiano, coerenza tra riferimenti o qualità del canale alfa; anche il supporto Diffusers richiede componenti molto recenti.

Checklist per una prova locale

  • Leggere la Qwen Research License Agreement per il proprio scenario.
  • Creare un ambiente isolato con le versioni richieste.
  • Verificare spazio disco e supporto bfloat16 della GPU.
  • Provare prima una generazione 1:1 a seed fisso.
  • Misurare VRAM di picco e tempo per immagine.
  • Ripetere lo stesso prompt con e senza CPU offload.
  • Testare testo italiano, trasparenza e bordi del canale alfa.
  • Aumentare gradualmente il numero di immagini di riferimento.
  • Conservare prompt, seed, dimensioni e commit per rendere il confronto riproducibile.

Fonti primarie

Radar AI · a cura di Francesco Gruner

Chiedi al sito.

Assistente OpenAI

Le domande vengono inviate a OpenAI. Non inserire dati personali o riservati. Privacy.

Verifica le risposte nelle fonti. 16 messaggi al giorno per rete.

Cosa cerchi? Ti indico le pagine utili.