L’ANALISI
GLM-5.3-Flash pubblica i pesi FP8, ma resta un modello da cluster
Z.ai rende disponibile GLM-5.3-Flash: 320 miliardi di parametri totali, 18 miliardi attivi, multimodalità nativa e ricette ufficiali vLLM e SGLang.

In breve: Z.ai rende disponibile GLM-5.3-Flash: 320 miliardi di parametri totali, 18 miliardi attivi, multimodalità nativa e ricette ufficiali vLLM e SGLang.
Che cosa cambia
Il checkpoint FP8 è disponibile su Hugging Face dal 7 settembre.
L’architettura dichiarata combina sparse e linear attention.
Le ricette ufficiali puntano a vLLM e SGLang.
Perché conta adesso
Il delta modifica ciò che un team può scaricare, eseguire, misurare o mettere in sicurezza oggi, distinto dall’annuncio originario del progetto.
Impatto operativo
La decisione utile è verificare compatibilità, costi e confini di sicurezza sul proprio ambiente prima di estendere il rollout.
Condizioni e limiti
Il repository pesa circa 328 GB: non è un modello desktop e richiede serving multi-GPU; benchmark e qualità sono dichiarazioni del fornitore.
Checklist pratica
- Calcola spazio disco e memoria GPU prima del download.
- Conferma la licenza e i termini d’uso.
- Valida tool use e multimodalità sul proprio workload.