Vai al contenuto

K2 Horizon MoVA 36B-A4B e 0.9B: pesi, requisiti, limiti e checklist di prova.

L’ANALISI

K2 Horizon MoVA 36B-A4B e 0.9B: pesi disponibili, due test molto diversi

IFM completa due estremi della famiglia: un MoE locale da 36B totali e 4B attivi, e un modello denso da 0.9B. I pesi sono reali, ma requisiti e promesse vanno verificati separatamente.

2 min di letturaFatti, limiti e fonti primarie
Grafico ufficiale dei benchmark di K2 Horizon MoVA 36B-A4B
Benchmark ufficiali IFM del MoVA 36B-A4B. Il grafico descrive risultati del produttore, non una prova indipendente.

In breve: i repository contengono ora pesi, tokenizer, configurazioni e codice eseguibile per entrambi i modelli. Il 36B-A4B è il candidato per serving efficiente su più GPU; il 0.9B è il candidato per misurare quanto reasoning e tool use sopravvivano con memoria limitata.

Che cosa è diventato scaricabile

Il delta verificato è concreto: 48 shard safetensors e indice completo per MoVA 36B-A4B, un singolo shard per 0.9B, più codice del modello, tokenizer, template chat e configurazioni. Non è un semplice aggiornamento della scheda.

MoVA 36B-A4B: capacità e costo attivo

Il modello conserva 36B parametri ma ne attiva circa 4B per token combinando MoE e Mixture-of-Value Attention. La ricetta SGLang ufficiale usa tensor ed expert parallel su due H200: il numero di parametri attivi non equivale quindi a un requisito da 4B su una GPU consumer.

0.9B: piccolo, ma non automaticamente edge

Il modello denso dichiara 128K token e risultati competitivi su matematica e codice. La ricetta raccomanda reasoning high e fino a 32.768 token di output: latenza, energia e memoria KV possono dominare anche quando i pesi sono piccoli.

Serving e confine di fiducia

Entrambi richiedono trust_remote_code e parser specifici per reasoning e tool calling. Prima di collegare strumenti reali conviene fissare lo SHA, revisionare il Python remoto e isolare rete, filesystem e credenziali.

Condizioni e limitazioni

I confronti e i benchmark provengono da IFM. Il codice di training e il report tecnico risultano ancora in preparazione; per 0.9B alcuni checkpoint RL sono incompleti. Il contesto massimo dichiarato non prova qualità o sostenibilità al limite.

Checklist pratica

  • Fissare lo SHA e revisionare modeling_k2_horizon.py prima di usare trust_remote_code.
  • Misurare BF16 prima delle quantizzazioni, registrando VRAM, latenza e token al secondo.
  • Per 36B-A4B confrontare una e due GPU, verificando router, tensor parallel ed expert parallel.
  • Per 0.9B provare 8K, 32K e 128K con documenti a risposta nota e output limitati.
  • Testare tool calling con argomenti errati, timeout e azioni negate.
  • Conservare prompt, revisione, backend e risultati per una prova ripetibile.

Fonti primarie

Radar AI · a cura di Francesco Gruner

Il sito, in una chat.

Servizi, guide e idee da approfondire

Sono l’assistente AI di questo sito. Ti aiuto a orientarti tra il lavoro di Francesco, il blog, Radar AI e i video, con i link alle fonti.

Risposte AI da verificare nelle fonti. 16 messaggi al giorno per rete.