Vai al contenuto

Z.ai rende disponibile GLM-5.3-Flash: 320 miliardi di parametri totali, 18 miliardi attivi, multimodalità nativa e ricette ufficiali vLLM e SGLang.

L’ANALISI

GLM-5.3-Flash pubblica i pesi FP8, ma resta un modello da cluster

Z.ai rende disponibile GLM-5.3-Flash: 320 miliardi di parametri totali, 18 miliardi attivi, multimodalità nativa e ricette ufficiali vLLM e SGLang.

1 min di letturaFatti, limiti e fonti primarie
Schermata della fonte primaria: GLM-5.3-Flash pubblica i pesi FP8, ma resta un modello da cluster
Pagina ufficiale usata per verificare il delta e la data dell’evento.

In breve: Z.ai rende disponibile GLM-5.3-Flash: 320 miliardi di parametri totali, 18 miliardi attivi, multimodalità nativa e ricette ufficiali vLLM e SGLang.

Che cosa cambia

Il checkpoint FP8 è disponibile su Hugging Face dal 7 settembre.

L’architettura dichiarata combina sparse e linear attention.

Le ricette ufficiali puntano a vLLM e SGLang.

Perché conta adesso

Il delta modifica ciò che un team può scaricare, eseguire, misurare o mettere in sicurezza oggi, distinto dall’annuncio originario del progetto.

Impatto operativo

La decisione utile è verificare compatibilità, costi e confini di sicurezza sul proprio ambiente prima di estendere il rollout.

Condizioni e limiti

Il repository pesa circa 328 GB: non è un modello desktop e richiede serving multi-GPU; benchmark e qualità sono dichiarazioni del fornitore.

Checklist pratica

  • Calcola spazio disco e memoria GPU prima del download.
  • Conferma la licenza e i termini d’uso.
  • Valida tool use e multimodalità sul proprio workload.

Fonti primarie

Radar AI · a cura di Francesco Gruner

Il sito, in una chat.

Servizi, guide e idee da approfondire

Sono l’assistente AI di questo sito. Ti aiuto a orientarti tra il lavoro di Francesco, il blog, Radar AI e i video, con i link alle fonti.

Risposte AI da verificare nelle fonti. 16 messaggi al giorno per rete.