L’ANALISI
MiniCPM5-2B: ora ci sono GGUF, MLX e GPTQ ufficiali
OpenBMB ha aggiunto formati ufficiali GGUF, MLX 4-bit e GPTQ 4-bit al checkpoint BF16 di MiniCPM5-2B, sostituendo l’unico percorso community come riferimento operativo.

In breve: OpenBMB ha reso disponibili repository ufficiali GGUF, MLX 4-bit e GPTQ 4-bit. Per chi usa llama.cpp, Ollama, LM Studio, Apple Silicon o runtime GPU, il cambiamento pratico è poter partire da artefatti del produttore invece che da sole conversioni community.
Che cosa è cambiato
Il checkpoint BF16 era già disponibile. L’8 settembre sono comparsi i repository ufficiali OpenBMB per GGUF, MLX e GPTQ, insieme ai file e alle istruzioni di caricamento.
Quale formato scegliere
GGUF è il percorso indicato per llama.cpp, Ollama e LM Studio; MLX 4-bit è dedicato ad Apple Silicon; GPTQ 4-bit è pensato per runtime GPU compatibili. BF16 resta il riferimento non quantizzato.
Perché il delta è materiale
La prima copertura seguiva undici GGUF pubblicati da un account community. I nuovi repository ufficiali cambiano provenienza, supporto e scelta dei runtime e rendono il pacchetto più utile per una valutazione locale riproducibile.
Condizioni e limiti
Ufficiale non significa automaticamente più veloce o più accurato. Quantizzazione, template chat, contesto, tool calling e supporto effettivo dipendono dalle versioni dei runtime e dall’hardware.
Checklist di prova
- Fissare la revisione esatta del repository scelto.
- Scaricare il formato coerente con il runtime e verificare hash e licenza.
- Misurare RAM o VRAM, tempo al primo token e token al secondo.
- Provare contesto lungo e tool calling con casi riproducibili.
- Confrontare almeno un formato quantizzato con il BF16 o con una baseline nota.