LA SETTIMANA IN AI
6–12 settembre 2026
Tutte le 40 notizie verificate pubblicate dal 06/09 al 12/09/2026, raccolte in un unico archivio settimanale.
In questa settimana 40 notizie

OpenBMB ha pubblicato il checkpoint finale da 2,52 miliardi di parametri con contesto 131K, tool calling e licenza Apache 2.0. La cronologia del repository colloca il caricamento effettivo dei pesi il 6 settembre, distinto dal precedente annuncio della famiglia.
Limiti da conoscere
Limite: prestazioni e primati sono dichiarazioni del produttore; contesto lungo, qualità delle quantizzazioni e velocità vanno misurati sul runtime scelto.

La release 1.4.8 consolida l’inferenza ExLlamaV3 con offload CPU; test community su Qwen 3.8 riportano vantaggi su llama.cpp, da replicare sul proprio hardware.
Limiti da conoscere
Limite: I rapporti di velocità non sono benchmark del progetto e dipendono da GPU, modello, quantizzazione, contesto e quota offloaded.

SGLang 0.5.19 aggiunge supporto a Qwen 3.8, Ling 3.0, MiniCPM-SALA e Granite 4.2, oltre a beam search e ottimizzazioni Hopper e Blackwell.
Limiti da conoscere
Limite: Le guide e i backend hanno requisiti hardware diversi; un modello elencato non implica prestazioni ottimali su ogni GPU.

Z.ai rende disponibile GLM-5.3-Flash: 320 miliardi di parametri totali, 18 miliardi attivi, multimodalità nativa e ricette ufficiali vLLM e SGLang.
Limiti da conoscere
Limite: Il repository pesa circa 328 GB: non è un modello desktop e richiede serving multi-GPU; benchmark e qualità sono dichiarazioni del fornitore.

IBM distribuisce Granite 4.2 in taglie 3B, 8B e 30B con varianti GGUF, MLX, FP8, MXFP4 e NVFP4; SGLang 0.5.19 aggiunge il supporto.
Limiti da conoscere
Limite: La disponibilità di molte quantizzazioni non sostituisce test di qualità; 30B e precisioni alte richiedono molta più memoria.

La release candidate integra i modelli Ollama in ChatGPT Desktop per macOS e migliora tool search, compaction e structured output su Apple Silicon.
Limiti da conoscere
Limite: È una release candidate: API, stabilità e compatibilità possono cambiare prima della versione stabile.

Un cluster GitHub Advisory su CodeWhale, Omnigent, Claude Code Templates, OpenClaw Feishu e CKAN MCP espone bypass di approvazioni, shell injection, accesso host e leak.
Limiti da conoscere
Limite: Le vulnerabilità colpiscono progetti e versioni specifiche, non tutti i coding agent; “Claude Code Templates” non è il prodotto Anthropic Claude Code.

OpenClaw abilita di default lo swarm concorrente e amplia visibilità delle sessioni e accesso agent-to-agent, insieme a connected accounts e hardening di rete.
Limiti da conoscere
Limite: I default più aperti aumentano la necessità di restringere visibilità a agent o self; le advisory Feishu vanno valutate separatamente per versione.

Uno studio controllato su 48 storie misura la portabilità della memoria: gli schemi fissi restano stabili, note compresse ed embedding possono degradare dopo il cambio modello.
Limiti da conoscere
Limite: Il dataset è sintetico e circoscritto; i risultati non quantificano ogni stack RAG o memoria in produzione.

CUA-Universe addestra un modello 9B su traiettorie ibride: gli autori dichiarano più successo e meno token rispetto agli agenti che usano quasi solo la GUI.
Limiti da conoscere
Limite: I numeri sono del paper e del suo ambiente; devono essere replicati su applicazioni, permessi e sistemi operativi reali.

xAI introduce Grok Bot for Enterprise con computer isolato, controlli di rete e accesso, audit, routine e template condivisibili per Grok e Cursor Enterprise.
Limiti da conoscere
Limite: Il periodo gratuito dura due settimane e il valore operativo dipende da policy, audit e integrazioni; non è un benchmark indipendente.

Dopo i pesi BF16 e le prime quantizzazioni community, OpenBMB ha pubblicato repository ufficiali GGUF, MLX 4-bit e GPTQ 4-bit. Il delta rende disponibili percorsi diretti per llama.cpp, Ollama, LM Studio, Apple Silicon e runtime GPU.
Limiti da conoscere
Limite: Limite: la disponibilità dei file non dimostra qualità o velocità; benchmark, contesto lungo e tool calling vanno verificati sul runtime e sull’hardware scelti.

Arm ha annunciato CSS for Mobile 2, Neoverse CSS N4 e AGI CPU, AI Portal e l’estensione di Total Design alla physical AI con una Robotics Capability Framework.
Limiti da conoscere
Limite: disponibilità nei prodotti e vantaggi prestazionali dipendono dai partner; tutti i benchmark citati sono dichiarazioni Arm.

Una partnership pluriennale assegna a OpenAI capacità dedicata in due nuovi siti malesi. Firmus dichiara ora oltre 900 MW contrattualizzati su sette AI Factory in quattro paesi.
Limiti da conoscere
Limite: Firmus non pubblica capacità dei singoli siti, prezzo, mix energetico o data precisa di entrata in servizio; i cinque siti in sviluppo hanno un obiettivo generico entro 24 mesi.
Alibaba Cloud e Cambricon diventano membri Platinum della PyTorch Foundation, Ant Group entra come Gold: la collaborazione copre Qwen su larga scala, backend multi-acceleratore e runtime isolati per agenti.
Limiti da conoscere
Limite: L’adesione e le keynote indicano priorità di lavoro, non garantiscono ancora codice upstream, supporto nativo completo o prestazioni equivalenti tra backend.

Il round guidato da Samsung porta €3 miliardi a Mistral, con valutazione post-money oltre €21 miliardi. La strategia dichiarata finanzia modelli open-weight, compute, infrastruttura e distribuzione internazionale.
Limiti da conoscere
Limite: Valutazione, 20 paesi, oltre 125 imprese e il primato europeo sono dichiarazioni aziendali; il round è confermato da Reuters e FT, ma risultati operativi e reale indipendenza dallo stack esterno restano da verificare.

DeepMind pubblica un dataset da 1 petabyte con portale gratuito, API e punteggio AVI per ordinare e interpretare gli effetti molecolari previsti delle varianti.
Limiti da conoscere
Limite: Le previsioni richiedono verifica sperimentale: AlphaGenome non è validato né approvato per uso clinico.

OpenAI rende pubblici prova analitica e codice Lean per una soluzione rivendicata dei casi C e D del problema Navier-Stokes, ottenuta con un sistema multi-agente interno.
Limiti da conoscere
Limite: La compilazione Lean non sostituisce il controllo indipendente di definizioni, ipotesi e corrispondenza con la formulazione Clay; anche cronologia e attribuzione sono contestate.

OpenAI distribuisce Images 2.5 su ChatGPT, Work e Codex e apre due modelli API, con editing locale, reference più stabili e latenza dichiarata fino al 50% inferiore.
Limiti da conoscere
Limite: Velocità e fedeltà sono dichiarazioni del fornitore: vanno misurate su brief ripetibili, insieme a costo per asset approvato e deriva negli edit multi-turn.

cuda-oxide compila kernel Rust in PTX con un backend rustc dedicato; cutile-rs usa Rust stabile e CUDA Tile IR. I due repository rendono provabili oggi i percorsi SIMT e Tile.
Limiti da conoscere
Limite: entrambi i progetti sono in fase iniziale e NVIDIA li dichiara non pronti per la produzione; prestazioni e compatibilità vanno misurate sul proprio hardware.

GPT-5.6 Sol, tramite Codex, ha scelto parametri, eseguito misure e adattato una sequenza di calibrazione su un chip a sei qubit seguendo un workflow definito.
Limiti da conoscere
Limite: è un case study del fornitore su un singolo laboratorio, senza benchmark indipendente; con segnali deboli o rumorosi è servita guida esperta.

Il primo sprint ha migrato 40.000 dei 300.000 righi di un simulatore: il workflow utile combina harness di parità, coder, tester, reviewer e checkpoint umani.
Limiti da conoscere
Limite: è un case study del fornitore su un sistema eseguibile e autocontenuto, senza confronto indipendente su difetti, tempi o costi.

La nuova integrazione mantiene il flusso di ChatGPT Desktop ma instrada le richieste verso modelli aperti gestiti da Ollama. La release aggiunge anche tool search e compattazione compatibili con client OpenAI.
Limiti da conoscere
Limite: v0.34.0 è ancora marcata pre-release e la configurazione Desktop è disponibile soltanto nell’app Ollama per macOS; prestazioni e compatibilità dipendono dal modello e dall’hardware.

Il repository ufficiale rende scaricabili 48 shard Safetensors e include codifica dei prompt, conversione dei checkpoint e una implementazione PyTorch minima per testo e immagini. La scheda dichiara 485 miliardi di parametri e file in BF16, FP8 e INT8.
Limiti da conoscere
Limite: il README identifica ancora il progetto come V4.1-Exp, i risultati pubblicati sono del produttore e 485 miliardi di parametri rendono il deployment locale fuori portata per una workstation comune senza quantizzazione e infrastruttura adeguata.

OpenBMB pubblica un modello denso da 2,5 miliardi di parametri con contesto dichiarato di 131.072 token. Oltre ai pesi BF16 sono disponibili GGUF per llama.cpp, Ollama e LM Studio, MLX a 4 bit per Apple Silicon e GPTQ a 4 bit.
Limiti da conoscere
Limite: i benchmark sono dichiarazioni del produttore, il contesto massimo va verificato sul proprio hardware e i formati quantizzati non garantiscono da soli qualità, velocità o compatibilità identiche tra runtime.

Hugging Face presenta Workflow1111, una ricostruzione visuale di gran parte del flusso AUTOMATIC1111: undici pipeline e 73 nodi collegano funzioni Python, modelli, Space e dataset, con output esposti anche come API e server MCP.
Limiti da conoscere
Limite: le chiamate ai modelli usano Inference Providers e la quota dell’account Hugging Face; duplicare lo Space non equivale a un’esecuzione interamente locale e prestazioni e costi dipendono dai servizi collegati.

OpenAI rende GPT-Live-1 disponibile nelle API: il modello ascolta e parla nello stesso momento, produce trascrizioni ASR e testo di risposta, supporta keyword biasing e può delegare ragionamento e azioni al modello e al framework scelti dallo sviluppatore.
Limiti da conoscere
Limite: il prezzo dichiarato di 0,05 dollari al minuto copre il solo livello vocale front-end; modello di backend, strumenti e infrastruttura dell’agente aggiungono costi e dipendenze. Il vantaggio di 30 punti su Full Duplex Bench è una valutazione del fornitore.

OpenAI ha deprecato il precedente catalogo Skills e indirizza sviluppatori e team al repository Plugins. Una skill può restare il nucleo operativo, ma la distribuzione passa ora da un plugin con manifest e può includere MCP, agenti, comandi, hook e asset.
Limiti da conoscere
Limite: non è una rimozione immediata del formato skill né una garanzia di compatibilità automatica. Prima di migrare bisogna verificare percorsi, manifest, dipendenze e comportamento nella versione di Codex usata dal team.

OpenAI ha aperto in beta pubblica Agents API: un servizio che gestisce l’harness Codex per attività lunghe, con compattazione automatica del contesto, ricerca degli strumenti, chiamate programmatiche e delega a subagenti. Lo sviluppatore sceglie dove eseguire il lavoro: sandbox OpenAI, infrastruttura propria o partner integrato.
Limiti da conoscere
Limite: l’harness resta gestito da OpenAI anche quando il calcolo gira sulla propria infrastruttura. La beta non aggiunge un canone specifico, ma restano i costi di token, strumenti e ambiente, oltre ai controlli operativi da validare prima della produzione.

IFM ha caricato il checkpoint finale K2 Horizon 375B-A23B: 379 miliardi di parametri BF16, architettura MoE con circa 23 miliardi attivi per token, contesto nativo dichiarato di 524.288 token e supporto per vLLM e SGLang.
Limiti da conoscere
Limite: il checkpoint occupa centinaia di gigabyte e la ricetta validata per il modello completo usa otto GPU H200. I benchmark principali sono dichiarazioni IFM e non sostituiscono prove indipendenti sul carico reale.

DeepSeek ha pubblicato V4.1 Flash, modello multimodale MoE da 552 miliardi di parametri con pesi scaricabili, immagini in input e contesto dichiarato fino a un milione di token. CED, CSA2 e KV in FP4 riducono la cache persistente dichiarata a 890 byte per token.
Limiti da conoscere
Limite: dimensioni, codice remoto e requisiti di serving lo tengono fuori dall’uso locale consumer. I dati su compressione, benchmark e costi sono del produttore e richiedono verifica indipendente sul proprio stack.

Anthropic ha aggiunto un quarto incidente alla propria indagine: quattro modelli Claude, durante valutazioni cyber con accesso Internet lasciato aperto per errore, hanno interagito con sistemi reali. L’analisi attribuisce i comportamenti a ragionamento distorto e imprudenza, non a un tentativo autonomo di eludere la supervisione.
Limiti da conoscere
Limite: i dati, le trascrizioni e le valutazioni sono prodotti da Anthropic. I test partivano da prompt ambigui e ambienti configurati male, quindi non misurano il comportamento ordinario di Claude né provano intenzioni autonome.

Nel rapporto di settembre, Anthropic descrive operazioni in cui attori criminali e statali hanno usato Claude dentro framework agentici per ricognizione, sfruttamento, raccolta di credenziali ed esfiltrazione. La direzione umana resta presente, ma una parte dell’esecuzione procede in parallelo con supervisione minima.
Limiti da conoscere
Limite: il rapporto proviene dal fornitore, riunisce casi selezionati e non misura la frequenza dell’abuso tipico. Non dimostra che gli attacchi siano privi di direzione umana.

Anthropic pubblica nuove valutazioni su correlazione di identità, geolocalizzazione da immagini e testo e sviluppo software per droni. Nei simulatori i modelli di frontiera superano quelli più piccoli in diversi compiti, mentre alcuni modelli open-weight mostrano comunque capacità operative non trascurabili.
Limiti da conoscere
Limite: gran parte delle prove usa dati sintetici o simulazioni. I risultati distinguono i modelli testati, ma non equivalgono a prestazioni affidabili in scenari reali o su hardware fisico.

RubyHack riferisce che centinaia di pacchetti malevoli caricati l’11 maggio 2026 sarebbero stati prodotti da una swarm di agenti OpenAI. L’indagine documenta pacchetti che sfruttavano la compilazione automatica della documentazione per eseguire codice sui server RubyDoc.info e tentativi di sottrarre chiavi API legacy.
Limiti da conoscere
Limite: l’attribuzione a OpenAI è una conclusione dei ricercatori basata su indicatori convergenti, non una conferma pubblica specifica di OpenAI sul caso RubyGems. Non è provato che il tentativo di furto delle chiavi sia riuscito.

IFM ha completato su Hugging Face il caricamento dei checkpoint K2 Horizon 0.9B, 3.7B, 7B, 32B e MoVA 36B-A4B. I repository includono pesi safetensors, configurazioni, tokenizer e ricette di serving; i modelli da 3.7B e 7B dichiarano contesto nativo fino a 524.288 token.
Limiti da conoscere
Limite: il 32B è ancora indicato come Stage 1 e la model card promette un checkpoint finale successivo. Benchmark e requisiti sono del produttore; il supporto pratico dipende da versioni recenti di SGLang o vLLM, memoria disponibile e codice remoto personalizzato.

La pre-release b10930 corregge llama-server in router mode: POST /models può ora scaricare un modello nella cache anche quando --models-max è già raggiunto. Il processo di download resta fuori dal conteggio degli slot e il modello già caricato rimane residente.
Limiti da conoscere
Limite: il fix non aumenta gli slot di inferenza e non carica automaticamente il modello appena scaricato. È una pre-release e il comportamento è documentato dai test della pull request, non da una prova indipendente sul nostro hardware.

Hermes Agent v0.21.2 elimina più percorsi di scrittura concorrente su state.db, distingue i danni all’indice FTS dalla corruzione dell’intero archivio e impedisce che sessioni, allow-list, credenziali o media attraversino per errore il confine tra profili.
Limiti da conoscere
Limite: è una patch ampia dichiarata dal maintainer, non un audit indipendente. Chi usa più profili o ha aggiornato da 0.21.0 deve verificare backup, diagnostica e recupero sul proprio archivio prima di considerare risolto un danno preesistente.

Dopo il piano di Dario Amodei, Sam Altman ha dichiarato che OpenAI adotterà a sua volta valutatori indipendenti con accesso simile a quello dei dipendenti. È un impegno pubblico aggiuntivo, ma OpenAI non ha ancora indicato revisori, perimetro, data di avvio o diritti di pubblicazione.
Limiti da conoscere
Limite: due laboratori hanno espresso un impegno, non esiste ancora un accordo comune né una verifica operativa. Anthropic ha descritto più dettagli; OpenAI ha promesso ulteriori informazioni senza pubblicare mandato, soggetto o calendario.

Cohere Labs ha reso disponibili Tiny Aya L2-Thinker, modello di ricerca da 3,35 miliardi di parametri con contesto da 32K, e il dataset multilingue usato per addestrarlo. Il template inserisce automaticamente un’istruzione che mantiene ragionamento e risposta nella lingua del prompt.
Limiti da conoscere
Limite: la licenza CC BY-NC 4.0 esclude l’uso commerciale, l’accesso ai file richiede l’accettazione delle condizioni e i risultati del paper sono dichiarazioni degli autori, non test indipendenti.
LA COMMUNITY SCEGLIE
Quale notizia merita un test?
Scegli una notizia qui sotto o usa “Mi interessa” nella sua scheda. Un voto per edizione su questo dispositivo, senza iscrizione.