Vai al contenuto

Minima comprime Qwen3.8-27B a 17,5 GiB con NVFP4 W4A4 su tutti i layer. Risultati dichiarati, limiti e procedura di verifica locale.

L’ANALISI

Minima porta Qwen3.8-27B a 17,5 GiB con NVFP4 su tutti i layer

Minima comprime Qwen3.8-27B a 17,5 GiB con NVFP4 W4A4 su tutti i layer. Risultati dichiarati, limiti e procedura di verifica locale.

2 min di letturaFatti, limiti e fonti primarie
Pagina ufficiale arXiv del paper Minima, con titolo, autori e abstract del lavoro su NVFP4.
Pagina ufficiale arXiv del paper Minima, con titolo, autori e abstract del lavoro su NVFP4.

In breve: Il paper Minima quantizza in NVFP4 W4A4 tutti i 496 layer lineari di Qwen3.8-27B, inclusa la parte ricorrente Gated DeltaNet. Gli autori riportano 17,5 GiB e un prefill più rapido del 14-19% nelle configurazioni confrontate.

Cosa è stato pubblicato

Il paper Minima quantizza in NVFP4 W4A4 tutti i 496 layer lineari di Qwen3.8-27B, inclusa la parte ricorrente Gated DeltaNet. Gli autori riportano 17,5 GiB e un prefill più rapido del 14-19% nelle configurazioni confrontate.

Perché conta

Il lavoro mette alla prova l’idea che gli strati ricorrenti debbano restare a precisione più alta e propone una ricetta riproducibile per ridurre memoria e tempo di prefill.

Come leggere i numeri

17,5 GiB, il vantaggio di prefill e lo scarto medio dichiarato derivano dal setup del paper. Hardware, runtime, kernel e lunghezza del contesto possono cambiare il risultato.

Condizioni e limiti

È un preprint degli autori del checkpoint, non una replica indipendente. Il risultato dipende inoltre da kernel compatibili e dalla corretta gestione delle scale globali e della KV cache.

Checklist pratica

  1. Verificare supporto NVFP4 reale di GPU e runtime.
  2. Controllare che le scale per modulo non vengano fuse in modo incompatibile.
  3. Confrontare lo stesso prompt set con BF16 o un quant noto.
  4. Misurare qualità e velocità a 4K, 32K e sul contesto operativo.

Fonti primarie

← Edizione completa

Radar AI · a cura di Francesco Gruner

Il sito, in una chat.

Servizi, guide e idee da approfondire

Sono l’assistente AI di questo sito. Ti aiuto a orientarti tra il lavoro di Francesco, il blog, Radar AI e i video, con i link alle fonti.

Risposte AI da verificare nelle fonti. 16 messaggi al giorno per rete.