Vai al contenuto

OpenBMB aggiunge formati ufficiali GGUF, MLX 4-bit e GPTQ 4-bit per MiniCPM5-2B, con percorsi distinti per runtime locali.

L’ANALISI

MiniCPM5-2B: ora ci sono GGUF, MLX e GPTQ ufficiali

OpenBMB ha aggiunto formati ufficiali GGUF, MLX 4-bit e GPTQ 4-bit al checkpoint BF16 di MiniCPM5-2B, sostituendo l’unico percorso community come riferimento operativo.

2 min di letturaFatti, limiti e fonti primarie
MiniCPM5-2B ora dispone di 11 quantizzazioni GGUF community, da IQ2_M a Q8_0.
MiniCPM5-2B è disponibile in repository OpenBMB distinti per BF16, GGUF, MLX e GPTQ.

In breve: OpenBMB ha reso disponibili repository ufficiali GGUF, MLX 4-bit e GPTQ 4-bit. Per chi usa llama.cpp, Ollama, LM Studio, Apple Silicon o runtime GPU, il cambiamento pratico è poter partire da artefatti del produttore invece che da sole conversioni community.

Che cosa è cambiato

Il checkpoint BF16 era già disponibile. L’8 settembre sono comparsi i repository ufficiali OpenBMB per GGUF, MLX e GPTQ, insieme ai file e alle istruzioni di caricamento.

Quale formato scegliere

GGUF è il percorso indicato per llama.cpp, Ollama e LM Studio; MLX 4-bit è dedicato ad Apple Silicon; GPTQ 4-bit è pensato per runtime GPU compatibili. BF16 resta il riferimento non quantizzato.

Perché il delta è materiale

La prima copertura seguiva undici GGUF pubblicati da un account community. I nuovi repository ufficiali cambiano provenienza, supporto e scelta dei runtime e rendono il pacchetto più utile per una valutazione locale riproducibile.

Condizioni e limiti

Ufficiale non significa automaticamente più veloce o più accurato. Quantizzazione, template chat, contesto, tool calling e supporto effettivo dipendono dalle versioni dei runtime e dall’hardware.

Checklist di prova

  1. Fissare la revisione esatta del repository scelto.
  2. Scaricare il formato coerente con il runtime e verificare hash e licenza.
  3. Misurare RAM o VRAM, tempo al primo token e token al secondo.
  4. Provare contesto lungo e tool calling con casi riproducibili.
  5. Confrontare almeno un formato quantizzato con il BF16 o con una baseline nota.

Fonti primarie

Radar AI · a cura di Francesco Gruner

Il sito, in una chat.

Servizi, guide e idee da approfondire

Sono l’assistente AI di questo sito. Ti aiuto a orientarti tra il lavoro di Francesco, il blog, Radar AI e i video, con i link alle fonti.

Risposte AI da verificare nelle fonti. 16 messaggi al giorno per rete.