IL PUNTO SULL’AI
7 settembre 2026
Pesi locali e serving accelerano con GLM-5.3-Flash, Granite, SGLang, ExLlamaV3 e Ollama; sicurezza, memoria e agenti ibridi impongono nuovi controlli operativi.
In questa edizione 11 notizie

OpenBMB ha pubblicato il checkpoint finale da 2,52 miliardi di parametri con contesto 131K, tool calling e licenza Apache 2.0. La cronologia del repository colloca il caricamento effettivo dei pesi il 6 settembre, distinto dal precedente annuncio della famiglia.
Limiti da conoscere
Limite: prestazioni e primati sono dichiarazioni del produttore; contesto lungo, qualità delle quantizzazioni e velocità vanno misurati sul runtime scelto.

La release 1.4.8 consolida l’inferenza ExLlamaV3 con offload CPU; test community su Qwen 3.8 riportano vantaggi su llama.cpp, da replicare sul proprio hardware.
Limiti da conoscere
Limite: I rapporti di velocità non sono benchmark del progetto e dipendono da GPU, modello, quantizzazione, contesto e quota offloaded.

SGLang 0.5.19 aggiunge supporto a Qwen 3.8, Ling 3.0, MiniCPM-SALA e Granite 4.2, oltre a beam search e ottimizzazioni Hopper e Blackwell.
Limiti da conoscere
Limite: Le guide e i backend hanno requisiti hardware diversi; un modello elencato non implica prestazioni ottimali su ogni GPU.

Z.ai rende disponibile GLM-5.3-Flash: 320 miliardi di parametri totali, 18 miliardi attivi, multimodalità nativa e ricette ufficiali vLLM e SGLang.
Limiti da conoscere
Limite: Il repository pesa circa 328 GB: non è un modello desktop e richiede serving multi-GPU; benchmark e qualità sono dichiarazioni del fornitore.

IBM distribuisce Granite 4.2 in taglie 3B, 8B e 30B con varianti GGUF, MLX, FP8, MXFP4 e NVFP4; SGLang 0.5.19 aggiunge il supporto.
Limiti da conoscere
Limite: La disponibilità di molte quantizzazioni non sostituisce test di qualità; 30B e precisioni alte richiedono molta più memoria.

La release candidate integra i modelli Ollama in ChatGPT Desktop per macOS e migliora tool search, compaction e structured output su Apple Silicon.
Limiti da conoscere
Limite: È una release candidate: API, stabilità e compatibilità possono cambiare prima della versione stabile.

Un cluster GitHub Advisory su CodeWhale, Omnigent, Claude Code Templates, OpenClaw Feishu e CKAN MCP espone bypass di approvazioni, shell injection, accesso host e leak.
Limiti da conoscere
Limite: Le vulnerabilità colpiscono progetti e versioni specifiche, non tutti i coding agent; “Claude Code Templates” non è il prodotto Anthropic Claude Code.

OpenClaw abilita di default lo swarm concorrente e amplia visibilità delle sessioni e accesso agent-to-agent, insieme a connected accounts e hardening di rete.
Limiti da conoscere
Limite: I default più aperti aumentano la necessità di restringere visibilità a agent o self; le advisory Feishu vanno valutate separatamente per versione.

Uno studio controllato su 48 storie misura la portabilità della memoria: gli schemi fissi restano stabili, note compresse ed embedding possono degradare dopo il cambio modello.
Limiti da conoscere
Limite: Il dataset è sintetico e circoscritto; i risultati non quantificano ogni stack RAG o memoria in produzione.

CUA-Universe addestra un modello 9B su traiettorie ibride: gli autori dichiarano più successo e meno token rispetto agli agenti che usano quasi solo la GUI.
Limiti da conoscere
Limite: I numeri sono del paper e del suo ambiente; devono essere replicati su applicazioni, permessi e sistemi operativi reali.

xAI introduce Grok Bot for Enterprise con computer isolato, controlli di rete e accesso, audit, routine e template condivisibili per Grok e Cursor Enterprise.
Limiti da conoscere
Limite: Il periodo gratuito dura due settimane e il valore operativo dipende da policy, audit e integrazioni; non è un benchmark indipendente.
LA COMMUNITY SCEGLIE
Quale notizia merita un test?
Scegli una notizia qui sotto o usa “Mi interessa” nella sua scheda. Un voto per edizione su questo dispositivo, senza iscrizione.