Vai al contenuto

Pesi locali e serving accelerano con GLM-5.3-Flash, Granite, SGLang, ExLlamaV3 e Ollama; sicurezza, memoria e agenti ibridi impongono nuovi controlli operativi.

Radar AI / Edizione giornaliera

IL PUNTO SULL’AI

7 settembre 2026

Pesi locali e serving accelerano con GLM-5.3-Flash, Granite, SGLang, ExLlamaV3 e Ollama; sicurezza, memoria e agenti ibridi impongono nuovi controlli operativi.

11 notizie2 min di letturaVerificato alle 23:28

MODELLI LOCALI01
Pagina ufficiale Hugging Face di OpenBMB MiniCPM5-2B

OpenBMB ha pubblicato il checkpoint finale da 2,52 miliardi di parametri con contesto 131K, tool calling e licenza Apache 2.0. La cronologia del repository colloca il caricamento effettivo dei pesi il 6 settembre, distinto dal precedente annuncio della famiglia.

Limiti da conoscere

Limite: prestazioni e primati sono dichiarazioni del produttore; contesto lungo, qualità delle quantizzazioni e velocità vanno misurati sul runtime scelto.

RICERCA AGENTI09
Schermata della fonte primaria: Cambiare modello può rompere la memoria dell’agente

Uno studio controllato su 48 storie misura la portabilità della memoria: gli schemi fissi restano stabili, note compresse ed embedding possono degradare dopo il cambio modello.

Limiti da conoscere

Limite: Il dataset è sintetico e circoscritto; i risultati non quantificano ogni stack RAG o memoria in produzione.

LA COMMUNITY SCEGLIE

Quale notizia merita un test?

Scegli una notizia qui sotto o usa “Mi interessa” nella sua scheda. Un voto per edizione su questo dispositivo, senza iscrizione.

Radar AI · a cura di Francesco Gruner

Il sito, in una chat.

Servizi, guide e idee da approfondire

Sono l’assistente AI di questo sito. Ti aiuto a orientarti tra il lavoro di Francesco, il blog, Radar AI e i video, con i link alle fonti.

Risposte AI da verificare nelle fonti. 16 messaggi al giorno per rete.