Vai al contenuto

K2 Horizon completa i pesi 7B, MoVA 36B-A4B e 0.9B, mentre Cloudflare, llama.cpp e Gemini aggiornano controllo dei crawler, inferenza e agenti vocali.

Radar AI / Edizione giornaliera

IL PUNTO SULL’AI

15 settembre 2026

K2 Horizon completa i pesi 7B, MoVA 36B-A4B e 0.9B, mentre Cloudflare, llama.cpp e Gemini aggiornano controllo dei crawler, inferenza e agenti vocali.

7 notizie2 min di letturaVerificato alle 00:30

OPEN WEIGHTS01
Benchmark ufficiali IFM per K2 Horizon 3.7B

IFM ha unito sul branch main i checkpoint SFT2 da 2.500 step di K2 Horizon 3.7B e 32B. Chi scarica main riceve ora la revisione post-addestrata, mentre la cronologia conserva il checkpoint precedente e permette di fissare l’hash esatto per confronti e rollback.

Limiti da conoscere

Limite: IFM non pubblica nel commit una valutazione indipendente prima/dopo. Il 32B resta descritto come Stage 1 e il cambio di main può rompere la riproducibilità se la revisione non è fissata.

CRAWLER AI02
Illustrazione ufficiale Cloudflare sui controlli del traffico AI

Cloudflare consente ora di gestire separatamente crawler di ricerca, agenti che agiscono in tempo reale e bot usati per addestramento. Dal 15 settembre i nuovi domini bloccano Agent e Training sulle pagine con annunci, mentre Search resta consentito; i crawler con più scopi seguono la regola più restrittiva.

Limiti da conoscere

Limite: la classificazione e il rilevamento dipendono da Cloudflare. Il segnale robots.txt esprime una preferenza, non applica da solo un blocco, e BotBase resta una funzione Enterprise.

INFERENZA03
Pagina ufficiale della release llama.cpp b10981 dedicata alle modifiche OpenVINO

La pre-release b10981 aggiorna il backend OpenVINO: corregge uno split errato delle KV head che produceva output corrotto con Gemma 4, estende il decode stateful, aggiunge una scelta di requantizzazione a 4 bit e consente di spostare su disco i buffer dei pesi. Include binari OpenVINO per Linux e Windows.

Limiti da conoscere

Limite: è una pre-release e i numeri di velocità riportati arrivano dagli autori su configurazioni specifiche. Requantizzazione e spill possono ridurre la pressione sulla memoria, ma qualità, latenza e I/O vanno misurati sul proprio hardware Intel.

INFERENZA04
Pagina ufficiale della release llama.cpp b10982 con sparse Flash Attention per Vulkan

La pre-release b10982 aggiunge sparse Flash Attention al backend Vulkan di llama.cpp per DSV4 e GLM. Il merge include tuning, test, rimozione di atomicAdd non deterministico e decode vettoriale cm2; sono disponibili binari Vulkan per Linux e Windows.

Limiti da conoscere

Limite: è una pre-release e non pubblica uno speedup generalizzabile. Nella pull request è stato segnalato un problema sul contesto lungo, poi non riprodotto dall’autore: correttezza, memoria e velocità vanno provate sul proprio hardware Vulkan.

AGENTI VOCALI05
Copertina ufficiale Google di Gemini 3.8 Live e Live Extended Thinking

Google avvia il rollout di Gemini 3.8 Live e Live Extended Thinking in Gemini API e AI Studio. Entrambi accettano audio, immagini, video e testo fino a 128K token; la variante Extended Thinking punta a flussi vocali complessi mentre continua a parlare durante il ragionamento e le chiamate agli strumenti.

Limiti da conoscere

Limite: benchmark, qualifica production-ready e latenza sono dichiarazioni Google. La model card ammette allucinazioni, lentezza o timeout occasionali e un knowledge cutoff a gennaio 2025; non è ancora una prova indipendente su carichi reali.

OPEN WEIGHTS06
Grafico ufficiale dei benchmark di K2 Horizon 7B

Il repository K2 Horizon 7B ora contiene 36 shard safetensors, codice del modello, tokenizer e configurazioni. La model card dichiara un contesto nativo di 524.288 token, ma le ricette validate per vLLM e SGLang partono da 131.072 token e richiedono codice remoto personalizzato.

Limiti da conoscere

Limite: benchmark, capacità agentiche e confronto con altri modelli sono dichiarazioni IFM. Il download dei pesi non dimostra che 512K token siano utilizzabili su una singola GPU consumer, né che qualità e memoria restino stabili sul proprio carico.

OPEN WEIGHTS07
Grafico ufficiale dei benchmark di K2 Horizon MoVA 36B-A4B

Sul Hub sono comparsi i pesi completi del MoVA 36B-A4B in 48 shard e del denso 0.9B in un singolo shard. Il primo attiva circa 4B parametri per token e dichiara 512K di contesto; il secondo dichiara 128K ed è pensato per test compatti.

Limiti da conoscere

Limite: i benchmark sono del produttore. Il 36B richiede una ricetta validata su due H200, mentre il 0.9B richiede codice remoto e output di ragionamento lunghi: non sono ancora prove indipendenti su workstation o dispositivi edge.

LA COMMUNITY SCEGLIE

Quale notizia merita un test?

Scegli una notizia qui sotto o usa “Mi interessa” nella sua scheda. Un voto per edizione su questo dispositivo, senza iscrizione.

Radar AI · a cura di Francesco Gruner

Il sito, in una chat.

Servizi, guide e idee da approfondire

Sono l’assistente AI di questo sito. Ti aiuto a orientarti tra il lavoro di Francesco, il blog, Radar AI e i video, con i link alle fonti.

Risposte AI da verificare nelle fonti. 16 messaggi al giorno per rete.