Vai al contenuto

Cosa contiene la famiglia K2 Horizon, quali taglie sono scaricabili e quali limiti verificare prima del serving.

L’ANALISI

K2 Horizon dai 900M ai 36B: cosa si può scaricare e servire

La famiglia K2 Horizon ora offre checkpoint di più taglie, pesi aperti e ricette di inferenza, ma non tutti i modelli hanno lo stesso stato di completamento.

2 min di letturaFatti, limiti e fonti primarie
Grafico ufficiale IFM dei benchmark K2 Horizon 7B
Benchmark pubblicati da IFM per K2 Horizon 7B; vanno riprodotti sul proprio harness prima di usarli per decisioni operative.

In breve: Il delta utile è la disponibilità reale dei pesi in cinque taglie: si può partire dal 900M per prove leggere, passare ai dense 3.7B e 7B, oppure valutare 32B e MoVA 36B-A4B. Il 32B, però, resta marcato Stage 1.

Che cosa è arrivato sui repository

Il monitor HF ha osservato 466 nuovi fatti: 452 appartengono a cinque repository K2 Horizon e comprendono shard safetensors, revisioni, configurazioni e asset. Le revisioni sono state caricate tra le 06:00 e le 06:08 ora italiana del 12 settembre.

Le taglie che cambiano la prova

K2 Horizon 0.9B dichiara 128K di contesto; 3.7B e 7B arrivano a 512K nativi. Il 7B include un comando SGLang su singola GPU, mentre il 32B documenta una ricetta vLLM con tensor parallelism 2 e limite operativo mostrato di 131.072 token.

Pesi aperti non significa stesso costo

I repository usano licenza Apache 2.0 e pubblicano pesi BF16. La taglia cresce da circa 900 milioni a 34,8 miliardi di parametri per il dense 32B; MoVA 36B-A4B usa una struttura sparse con circa 4 miliardi attivi. Disco, RAM, VRAM e cache KV restano vincoli distinti.

Condizioni e limiti

Il 32B è descritto come Stage 1 e annuncia un checkpoint finale futuro. Le model card chiedono parser dedicati per reasoning e tool calling, versioni compatibili dei runtime e, in alcuni casi, trust_remote_code. I benchmark non sono ancora test indipendenti su italiano o hardware consumer.

Checklist per una prova riproducibile

  • Scegliere la taglia in base a VRAM, RAM, disco e lunghezza di contesto reale.
  • Fissare la revisione esatta del repository e verificare gli hash degli shard.
  • Usare la ricetta SGLang o vLLM indicata per quella taglia.
  • Abilitare i parser K2 Horizon solo per reasoning e tool calling.
  • Provare prima prompt italiani, codice e tool su dati non sensibili.
  • Misurare latenza, throughput, memoria e tasso di errore sul proprio carico.

Fonti primarie

Radar AI · a cura di Francesco Gruner

Il sito, in una chat.

Servizi, guide e idee da approfondire

Sono l’assistente AI di questo sito. Ti aiuto a orientarti tra il lavoro di Francesco, il blog, Radar AI e i video, con i link alle fonti.

Risposte AI da verificare nelle fonti. 16 messaggi al giorno per rete.