Vai al contenuto

K2-Horizon 3.7B e 7B con contesto 512K e versioni MLX: pesi, serving, benchmark dichiarati, requisiti e checklist di prova.

L’ANALISI

K2-Horizon: 3.7B, nuovo 7B e versioni MLX a confronto

La famiglia K2-Horizon ora comprende modelli densi 3.7B e 7B con contesto 512K, più conversioni MLX: cosa è scaricabile, come servirli e quali limiti misurare.

3 min di letturaFatti, limiti e fonti primarie
Grafico ufficiale IFM dei benchmark di K2-Horizon-3.7B
Benchmark ufficiali di IFM per K2-Horizon-3.7B rispetto ad altri modelli densi open-weight di piccola taglia.

In breve: il nuovo 7B è un rilascio IFM completo, non una semplice conversione. Offre pesi, codice, checkpoint intermedi e ricette vLLM/SGLang; le versioni MLX restano invece artefatti della community utili su Apple Silicon. Il contesto nominale 512K e i benchmark ufficiali richiedono ancora verifica sul proprio hardware e carico.

Che cosa cambia con il 7B

Il repository K2-Horizon-7B rende disponibili 36 shard Safetensors, configurazione, tokenizer, codice del modello, checkpoint intermedi e figure di valutazione. Rispetto al 3.7B già pubblicato, aumenta la capacità del modello mantenendo architettura densa e finestra nativa di 524.288 token.

Benchmark dichiarati

IFM riporta 70,6 su SWE-bench Verified, 39,1 su Terminal-Bench 2.1 e 59,0 su BrowseComp. Sono risultati del produttore: la stessa scheda segnala che BrowseComp usa il protocollo Discard-all@95k e che i confronti possono adottare harness differenti.

Serving e requisiti

La ricetta vLLM usa bfloat16, tensor parallel 1, parser dedicati per reasoning e tool call e limita il contesto iniziale a 131.072 token. SGLang dispone di una revisione validata. Entrambe le strade eseguono codice remoto del repository, che va revisionato e bloccato a commit.

Rapporto con 3.7B e MLX

Il 3.7B resta l’opzione più compatta della famiglia. Le conversioni MLX consentono prove su Apple Silicon, ma non sono release IFM né supporto nativo di mlx-lm. Il 7B ufficiale è quindi un nuovo artefatto scaricabile; MLX è un percorso operativo separato.

Contesto 512K e memoria

La finestra dichiarata non equivale a una prova end-to-end. La KV cache cresce con il contesto e il quickstart ufficiale parte da 128K. Vanno misurati prefill, throughput, memoria di picco e capacità di recupero prima di decidere se il modello è adatto a documenti molto lunghi.

Condizioni e limiti

Mancano test indipendenti sufficienti su italiano, sicurezza del codice remoto, qualità a 512K e confronto a parità di harness. I punteggi ufficiali orientano una prova, ma non dimostrano il risultato sul proprio stack.

Checklist pratica

  • Bloccare commit e hash dei pesi prima del download.
  • Revisionare modeling_k2_horizon.py prima di abilitare trust-remote-code.
  • Partire dalla ricetta ufficiale a 131.072 token.
  • Misurare VRAM, prefill, token al secondo e latenza.
  • Confrontare 3.7B e 7B sugli stessi prompt italiani.
  • Provare tool calling e formato reasoning.
  • Aumentare il contesto per gradini verificando recupero e stabilità.
  • Separare i risultati IFM da quelli delle conversioni MLX.

Fonti primarie

Radar AI · a cura di Francesco Gruner

Chiedi al sito.

Assistente OpenAI

Le domande vengono inviate a OpenAI. Non inserire dati personali o riservati. Privacy.

Verifica le risposte nelle fonti. 16 messaggi al giorno per rete.

Cosa cerchi? Ti indico le pagine utili.