L’ANALISI
SGLang 0.5.20: nuovi modelli, sampling mask e throughput
La release integra nuovi modelli tra cui GLM-5.3-Flash e Qwen3.8-Flash-Next e restituisce sampling mask e log-probabilità per riprodurre correttamente rollout RL.

In breve: Il valore non è solo la lista di modelli: sampling mask e log-probabilità permettono a un trainer di riprodurre il supporto effettivo usato dal sampler senza ricostruire top-k o top-p.
Nuovi modelli
La release aggiunge modelli autoregressivi e diffusion, con cookbook dedicati per i percorsi supportati.
Sampling mask per RL
Ogni passo può restituire supporto del sampler e log-probabilità del token scelto, migliorando la fedeltà del replay.
Scheduling e prestazioni
Le mask lavorano con overlap scheduling; i numeri pubblicati sono specifici di modello e batch.
Condizioni e limiti
L’ampiezza della release aumenta il rischio di regressioni: compatibilità, memoria e kernel vanno verificati per configurazione.
Checklist pratica
- Leggere il cookbook del modello scelto.
- Riprodurre un rollout con mask attive.
- Confrontare throughput a parità di batch.
- Bloccare la versione prima di aggiornare produzione.