IL PUNTO SULL’AI
15 settembre 2026
K2 Horizon completa i pesi 7B, MoVA 36B-A4B e 0.9B, mentre Cloudflare, llama.cpp e Gemini aggiornano controllo dei crawler, inferenza e agenti vocali.
In questa edizione 7 notizie

IFM ha unito sul branch main i checkpoint SFT2 da 2.500 step di K2 Horizon 3.7B e 32B. Chi scarica main riceve ora la revisione post-addestrata, mentre la cronologia conserva il checkpoint precedente e permette di fissare l’hash esatto per confronti e rollback.
Limiti da conoscere
Limite: IFM non pubblica nel commit una valutazione indipendente prima/dopo. Il 32B resta descritto come Stage 1 e il cambio di main può rompere la riproducibilità se la revisione non è fissata.

Cloudflare consente ora di gestire separatamente crawler di ricerca, agenti che agiscono in tempo reale e bot usati per addestramento. Dal 15 settembre i nuovi domini bloccano Agent e Training sulle pagine con annunci, mentre Search resta consentito; i crawler con più scopi seguono la regola più restrittiva.
Limiti da conoscere
Limite: la classificazione e il rilevamento dipendono da Cloudflare. Il segnale robots.txt esprime una preferenza, non applica da solo un blocco, e BotBase resta una funzione Enterprise.

La pre-release b10981 aggiorna il backend OpenVINO: corregge uno split errato delle KV head che produceva output corrotto con Gemma 4, estende il decode stateful, aggiunge una scelta di requantizzazione a 4 bit e consente di spostare su disco i buffer dei pesi. Include binari OpenVINO per Linux e Windows.
Limiti da conoscere
Limite: è una pre-release e i numeri di velocità riportati arrivano dagli autori su configurazioni specifiche. Requantizzazione e spill possono ridurre la pressione sulla memoria, ma qualità, latenza e I/O vanno misurati sul proprio hardware Intel.

La pre-release b10982 aggiunge sparse Flash Attention al backend Vulkan di llama.cpp per DSV4 e GLM. Il merge include tuning, test, rimozione di atomicAdd non deterministico e decode vettoriale cm2; sono disponibili binari Vulkan per Linux e Windows.
Limiti da conoscere
Limite: è una pre-release e non pubblica uno speedup generalizzabile. Nella pull request è stato segnalato un problema sul contesto lungo, poi non riprodotto dall’autore: correttezza, memoria e velocità vanno provate sul proprio hardware Vulkan.

Google avvia il rollout di Gemini 3.8 Live e Live Extended Thinking in Gemini API e AI Studio. Entrambi accettano audio, immagini, video e testo fino a 128K token; la variante Extended Thinking punta a flussi vocali complessi mentre continua a parlare durante il ragionamento e le chiamate agli strumenti.
Limiti da conoscere
Limite: benchmark, qualifica production-ready e latenza sono dichiarazioni Google. La model card ammette allucinazioni, lentezza o timeout occasionali e un knowledge cutoff a gennaio 2025; non è ancora una prova indipendente su carichi reali.

Il repository K2 Horizon 7B ora contiene 36 shard safetensors, codice del modello, tokenizer e configurazioni. La model card dichiara un contesto nativo di 524.288 token, ma le ricette validate per vLLM e SGLang partono da 131.072 token e richiedono codice remoto personalizzato.
Limiti da conoscere
Limite: benchmark, capacità agentiche e confronto con altri modelli sono dichiarazioni IFM. Il download dei pesi non dimostra che 512K token siano utilizzabili su una singola GPU consumer, né che qualità e memoria restino stabili sul proprio carico.

Sul Hub sono comparsi i pesi completi del MoVA 36B-A4B in 48 shard e del denso 0.9B in un singolo shard. Il primo attiva circa 4B parametri per token e dichiara 512K di contesto; il secondo dichiara 128K ed è pensato per test compatti.
Limiti da conoscere
Limite: i benchmark sono del produttore. Il 36B richiede una ricetta validata su due H200, mentre il 0.9B richiede codice remoto e output di ragionamento lunghi: non sono ancora prove indipendenti su workstation o dispositivi edge.
LA COMMUNITY SCEGLIE
Quale notizia merita un test?
Scegli una notizia qui sotto o usa “Mi interessa” nella sua scheda. Un voto per edizione su questo dispositivo, senza iscrizione.