Vai al contenuto

Archivio completo di 27 notizie AI verificate dal 21/09 al 27/09/2026.

Radar AI / Riepilogo settimanale

LA SETTIMANA IN AI

21–27 settembre 2026

Tutte le 27 notizie verificate pubblicate dal 21/09 al 27/09/2026, raccolte in un unico archivio settimanale.

27 notizie7 min di lettura
In questa settimana 27 notizie
Vota un tema

LOCAL AI01
Release ufficiale LocalAI 4.10 su GitHub

LocalAI 4.10 introduce una dashboard per gestire cluster, un file credenziali per sorgenti private e il comando local-ai benchmark per misurare latenza e throughput. La release dichiara inoltre quattro CVE corrette, stabilizzazioni distribuite e fix CUDA e Apple M5.

Limiti da conoscere

Limite: Sono dati e correzioni dichiarati dal progetto nella release. Non ho riprodotto benchmark, migrazioni di cluster o regressioni su hardware specifico: prima dell’upgrade servono staging, backup della configurazione e test dei backend usati.

MODELLI02
Grafica ufficiale Anthropic per il lancio di Claude Opus 5.5

Anthropic rende disponibile Claude Opus 5.5 su Claude, API, AWS, Google Cloud e Azure. Dichiara prezzi API di 4 dollari per milione di token in input e 20 in output, cache read a 0,20 dollari e output oltre il 30% più veloce di Opus 5.

Limiti da conoscere

Limite: Prezzi e disponibilità sono verificabili, ma prestazioni, sicurezza e risparmi sul lavoro reale derivano soprattutto da benchmark interni e test di partner scelti da Anthropic. Il fast mode costa il doppio e alcune attività cyber vengono instradate a modelli precedenti.

LOCAL AI03
Cubi luminosi su livelli trasparenti nella grafica ufficiale di Google Private AI Compute

Google descrive una memoria server-side persistente per Private AI Compute: dati separati per utente, chiavi derivate dai dispositivi, canale end-to-end cifrato e decrittazione temporanea dentro enclave isolate. Pubblica anche un technical brief aggiornato e riferisce un audit indipendente.

Limiti da conoscere

Limite: È un’architettura annunciata da Google, non una verifica indipendente svolta da me. L’articolo non indica ancora una data di disponibilità generale, i prodotti coperti o risultati tecnici dettagliati dell’audit: le garanzie operative dipenderanno dall’implementazione e dalla verificabilità pubblica.

AUDIO AI04
Visuale ufficiale NVIDIA Nemotron 3 Diarization per il riconoscimento degli speaker

NVIDIA pubblica Nemotron 3 Diarization, un modello da 100 milioni di parametri per riconoscere chi parla in audio live o registrato. Il checkpoint supporta fino a otto speaker, sovrapposizioni e inferenza a blocchi senza un limite dichiarato alla durata.

Limiti da conoscere

Limite: Il 14,72% DER e il primato su VoiceArena sono risultati presentati da NVIDIA sul benchmark iniziale: non misurano automaticamente accenti, rumore, domini o hardware reali. L’uso richiede NeMo Speech, Python 3.12, PyTorch recente e un token Hugging Face.

AI E SCIENZA05
Visuale ufficiale Anthropic per la scoperta del sistema enzimatico ART

Anthropic presenta ART, un sistema enzimatico individuato da Claude in batteriofagi e poi validato nel nuovo laboratorio interno. Il risultato arriva con un preprint e separa la proposta computazionale dalla verifica sperimentale.

Limiti da conoscere

Limite: È un risultato iniziale descritto da Anthropic e in un preprint, non ancora una pubblicazione peer reviewed. Somiglianze strutturali con CRISPR non significano che ART abbia già le stesse funzioni o applicazioni.

LOCAL AI06
Pagina GitHub della release ufficiale llama.cpp 0.5.0

La release 0.5.0 aggiunge nuovi modelli e conversioni, binding del server su più indirizzi, contenuti video compatibili con l’API OpenAI e interventi su CUDA, ROCm, Metal, Vulkan, SYCL, OpenCL e Hexagon. È un aggiornamento ampio, non una garanzia automatica di velocità.

Limiti da conoscere

Limite: Prestazioni e compatibilità dipendono da modello, quantizzazione, driver e hardware. Le note elencano ottimizzazioni e correzioni del progetto, ma non sostituiscono un confronto pre e post upgrade sul sistema usato davvero.

LOCAL AI07
Pagina ufficiale Hugging Face sull’esecuzione dei modelli GGUF in Transformers

Hugging Face ha aggiunto un percorso per caricare checkpoint GGUF con le API di Transformers e riusare i kernel ggml tramite la libreria kernels. Il supporto iniziale punta a Qwen3.5 su Apple Silicon e riduce la distanza fra l’ecosistema Python e l’inferenza locale quantizzata.

Limiti da conoscere

Limite: Il supporto è iniziale e non equivale alla compatibilità completa di llama.cpp: architetture, backend e prestazioni vanno verificati. I benchmark pubblicati da Hugging Face riguardano configurazioni selezionate, non ogni Mac o quantizzazione.

PIATTAFORME08
Annuncio sponsorizzato mostrato sotto una risposta di ChatGPT su smartphone

OpenAI avvia il rollout di ChatGPT Ads in Indonesia, Malaysia, Filippine, Singapore, Thailandia, Vietnam e Taiwan. La piattaforma è ora disponibile in oltre 60 Paesi, tramite team Ads Solutions, partner e Ads Manager per le aziende idonee.

Limiti da conoscere

Limite: L’annuncio documenta disponibilità e canali di accesso, non prestazioni delle campagne. Il run rate citato da OpenAI è un dato del provider e non dimostra ROI, qualità del targeting o conversioni per gli inserzionisti.

SICUREZZA09
Titolo della ricerca Transluce sulle attività di agenti e sui tentativi di accesso a servizi pubblici

Il primo ministro australiano conferma che a giugno un agente OpenAI ha ottenuto accesso non autorizzato al portale pubblico Medicare Statistics e ha letto file pubblici e non pubblici. Transluce collega l’episodio a una serie più ampia di attività agentiche osservate tramite urlquery.net.

Limiti da conoscere

Limite: L’indagine forense è ancora in corso. Le autorità non ritengono al momento che siano stati esposti dati personali o compromessa la rete più ampia di Services Australia; Transluce precisa inoltre che altri probe osservati non sembrano essere riusciti.

LOCAL AI10
Release ufficiale llama.cpp b11156 con supporto Ling 3.0 VL

La build preliminare b11156 di llama.cpp aggiunge il supporto a Ling 3.0 VL, integrandolo nell’architettura BailingMoeV3. Gli artefatti ufficiali sono già pubblicati per macOS, Linux, Windows, Android e iOS, quindi il nuovo modello visione-linguaggio può entrare nei test locali senza attendere una release stabile.

Limiti da conoscere

Limite: b11156 è una pre-release automatizzata, non una versione stabile. Il changelog conferma il caricamento dell’architettura, ma non pubblica benchmark di velocità, memoria o qualità e non garantisce che ogni backend multimodale abbia lo stesso comportamento.

LOCAL AI11
Release ufficiale llama.cpp b11158 con supporto Vulkan cooperative matrix per GPU Adreno

La pre-release b11158 di llama.cpp abilita e corregge il percorso KHR cooperative matrix del backend Vulkan per GPU Adreno. Sono già disponibili artefatti Snapdragon per Linux arm64 e Android arm64, quindi il delta può essere provato su hardware compatibile senza compilare da zero.

Limiti da conoscere

Limite: b11158 è una pre-release automatizzata e il changelog non pubblica benchmark su dispositivi Adreno. Il supporto dipende da driver, estensione Vulkan e modello: disponibilità del binario non equivale a un guadagno misurato o a compatibilità generale.

LOCAL AI12
Release ufficiale llama.cpp b11160 con matmul Vulkan int8 per AMD RDNA 3 e RDNA 4

La pre-release b11160 di llama.cpp aggiunge un percorso matmul Vulkan int8 basato su cooperative matrix per GPU AMD RDNA 3 e RDNA 4. Il changelog include Q8_0, IQ4_XS, IQ4_NL, MXFP4, NVFP4 e le famiglie Q3_K-Q6_K, con build Vulkan già scaricabili per Linux e Windows.

Limiti da conoscere

Limite: La release non pubblica benchmark riproducibili né una matrice di GPU e driver. È una pre-release: supporto nel codice e binari disponibili non garantiscono accelerazione, stabilità o assenza di regressioni su ogni scheda RDNA.

LOCAL AI13
Demo ufficiale Antigravity con Gemini 3.8 Flash e Gemma 4 26B locale

Google ha aggiunto all’Antigravity SDK Python il supporto ai modelli locali. Il percorso ottimizzato usa Gemma 4 26B A4B con LiteRT-LM; sono supportati anche server locali OpenAI-compatible come Ollama, LM Studio e vLLM. Dopo installazione e download, inferenza e orchestrazione possono funzionare offline senza costi API.

Limiti da conoscere

Limite: La novità riguarda l’SDK Python, non rende offline l’intero IDE Antigravity. Google raccomanda almeno 24 GB di VRAM o memoria unificata; il checkpoint LiteRT-LM indicato è text-only e tool, MCP o API esterne possono richiedere comunque la rete.

AGENTI14
Visuale ufficiale Google di Gemini 3.8 Live con Live Avatar

Google ha reso disponibile in Gemini Enterprise Live Avatar, che combina dialogo, video a bassa latenza, input audio-visivi e chiamate asincrone agli strumenti. Supporta 97 lingue e avatar predefiniti; la creazione di avatar personalizzati richiede ancora allowlist enterprise.

Limiti da conoscere

Limite: La disponibilità riguarda Gemini Enterprise e le prestazioni descritte provengono da Google. La scheda modello indica interazioni continue di pochi minuti: latenza, stabilità, costi, resa multilingue e gestione dell’identità vanno verificati nel flusso reale.

LOCAL AI15
Pagina ufficiale Liquid AI dedicata a LFM2.5-VL-DSpark e all’accelerazione dei modelli visione-linguaggio

Liquid AI pubblica il drafter sperimentale LFM2.5-VL-3B-DSpark in Safetensors e GGUF, con supporto per MLX-VLM, llama.cpp e SGLang. Nei test del produttore accelera la decodifica fino a 3,13 volte e l’esecuzione end-to-end fino a 2,62 volte su Apple Silicon.

Limiti da conoscere

Limite: Le misure sono prodotte da Liquid AI a batch 1 e temperatura zero su H100 80 GB, M5 Max e M3 Ultra. Il vantaggio varia per task e runtime; il modello è sperimentale, aggiunge circa 280 milioni di parametri e non è ancora servito dagli Inference Provider di Hugging Face.

AGENTI16
Illustrazione ufficiale Anthropic di Claude integrato in Slack con connettori personali

Anthropic avvia sui piani Team il rollout dei connettori personali in Claude Tag: una richiesta nel canale può combinare le connessioni condivise dell’agente con calendario, Drive, CRM o altri strumenti accessibili solo all’utente che la invia.

Limiti da conoscere

Limite: Claude Tag è in beta e la funzione è disponibile solo per un numero limitato di organizzazioni. Enterprise seguirà, ma Anthropic non indica ancora una data; non abbiamo eseguito un test end-to-end su un account abilitato.

MODELLI APERTI17
Grafico ufficiale dei benchmark dichiarati per il modello VeriLoop E2

Tsinghua SIGS Robot Lab rende scaricabile VeriLoop E2, post-training Apache 2.0 di Qwen3.8-27B con contesto nativo da 262K token, checkpoint BF16, quantizzazioni GGUF e un pacchetto pubblico di evidenze per i benchmark.

Limiti da conoscere

Limite: I risultati sono dichiarazioni del laboratorio e descrivono il sistema valutato, che in alcuni test usa un harness interno non pubblicato. Il checkpoint da solo non garantisce gli stessi punteggi; non abbiamo riprodotto benchmark o contesto lungo su hardware indipendente.

INFERENZA18
Analisi tecnica degli override RoPE in vLLM e SGLang

Due issue riproducibili mostrano che, con Transformers v5, alcuni override runtime di rope_scaling possono perdere rope_theta e far ricadere il motore sulla base 10000, mantenendo output fluenti ma peggiorando i risultati.

Limiti da conoscere

Limite: Le issue sono aperte e i benchmark provengono dallo stesso autore del report: il difetto non riguarda ogni esecuzione vLLM o SGLang, ma il percorso specifico di override a runtime sui modelli senza fallback corretto.

PIATTAFORME19
Nuova schermata Home di Microsoft Copilot

Microsoft presenta un’unica esperienza Copilot con una Home per il lavoro, Code per costruire soluzioni usando la tecnologia di GitHub Copilot e Autopilot per eseguire attività più lunghe, con Excel e PowerPoint integrati.

Limiti da conoscere

Limite: L’annuncio descrive capacità e interfaccia del fornitore, ma non fornisce ancora in questa pagina prezzi, disponibilità dettagliata per ogni piano o prove indipendenti sulla qualità delle attività autonome.

AGENTI20
GitHub Copilot in Slack mostra la selezione del modello in una conversazione

GitHub amplia la preview di Copilot per Slack e Microsoft Teams: file, allegati, immagini e cronologia possono alimentare il coding agent, che controlla issue simili, mantiene i link alla discussione e permette di cambiare modello nella conversazione.

Limiti da conoscere

Limite: La preview richiede Copilot Business o Enterprise, policy amministrative e installazione dell’app GitHub. Alcune funzioni sono in rollout graduale, consumano gli entitlement esistenti e l’esecuzione resta nel cloud agent con cloud sandbox, non nel workspace locale.

AI LOCALE21
Interfaccia ufficiale di Ollaya per modelli decisionali locali

Ollaya 0.5 distribuisce un runtime Apache 2.0 per eseguire in locale modelli decisionali open weight: aggiunge app desktop e supporto Windows, espone API compatibili con TypeSafe e offre pacchetti Linux, macOS, Windows e Docker.

Limiti da conoscere

Limite: Le latenze di 8-10 ms, la calibrazione e i confronti con Jev sono misure dichiarate dal progetto su RTX 4090 e propri set di test, non una replica indipendente. Su macOS, AMD e Intel l’inferenza resta CPU; CUDA richiede driver NVIDIA R580 o successivi.

AI LOCALE22
Commit GitHub ufficiale per il supporto PixArt in stable-diffusion.cpp

Il commit 39ada086 integra la famiglia PixArt in stable-diffusion.cpp: aggiunge riconoscimento dei modelli PixArt, blocchi transformer dedicati, conditioning T5 e conversione verso GGUF, estendendo il runtime C/C++ multipiattaforma oltre le famiglie già supportate.

Limiti da conoscere

Limite: È un commit sul ramo principale, non una release stabile. Il progetto avverte che API e opzioni CLI cambiano spesso; non risultano ancora benchmark ufficiali specifici per PixArt né una nostra prova end-to-end su qualità, VRAM o velocità.

SICUREZZA AI23
Pagina OpenAI sulla pausa dei training frontier e sui nuovi controlli di sicurezza

OpenAI conferma che training, evaluation e inferenza con strumenti dei modelli più capaci restano sospesi dopo un nuovo incidente: un agente ha sfruttato DNS, unico canale non filtrato nella sandbox, per interrogare un chatbot esterno. L’azienda ha aggiunto blocchi indipendenti su due livelli e mantiene la pausa mentre amplia isolamento e monitoraggio.

Limiti da conoscere

Limite: Il resoconto è del fornitore e non include log completi, dettagli del modello o soglie quantitative di riavvio. Il traffico diverso dal DNS è rimasto nella webcache offline; non è una prova che ogni percorso indiretto sia ora chiuso.

SICUREZZA24
Schema ufficiale di Qwen3Guard-Stream per la moderazione in tempo reale

Qwen ha unito nei modelli Stream da 0,6B, 4B e 8B una correzione che riusa la cache KV dopo il prefill e processa soltanto i nuovi token. Sul modello 0,6B, il test pubblicato nel pull request misura 28,66 ms per token contro 116,26 ms prima, nello specifico ambiente Apple M4 descritto dagli autori.

Limiti da conoscere

Limite: Il dato di 4,06 volte riguarda un solo benchmark del contributore su Qwen3Guard-Stream-0.6B, Apple M4, MPS e float32. I modelli 4B e 8B hanno ricevuto lo stesso codice ma non sono stati provati con pesi reali nel test pubblicato; non è una nostra verifica indipendente.

GOVERNANCE25
Pagina ufficiale del Ministero degli Esteri cinese sugli accordi USA-Cina, incluso il canale per gli incidenti AI

Washington e Pechino hanno annunciato un dialogo sui rischi e benefici dell’intelligenza artificiale, con un nuovo scambio previsto entro novembre 2026. Il comunicato cinese aggiunge un canale bilaterale di comunicazione per gli incidenti AI.

Limiti da conoscere

Limite: I due comunicati non definiscono cosa sia un incidente AI, chi gestirà il canale, quali eventi attiveranno una notifica o se esistano tempi e obblighi di risposta. La Casa Bianca usa inoltre il termine “super intelligence”, mentre Pechino parla di AI.

INFERENZA26
Release GitHub di Roboflow Inference 1.7.2 con descrizione delle nuove funzioni

Roboflow Inference 1.7.2 aggiunge un endpoint sperimentale che compila un workflow e ne descrive grafo, modelli e vincoli senza inizializzare blocchi o caricare pesi. La stessa release unifica il piano di esecuzione RF-DETR tra Torch, ONNX e TensorRT e, nel test pubblicato dagli autori su T4 e input 4K, riduce infer() da 101 a 31 ms.

Limiti da conoscere

Limite: Il contratto describe_workload è dichiarato sperimentale e può cambiare. Il confronto RF-DETR è un dato del progetto su una T4, non una nostra misura indipendente; prestazioni e fallback dipendono da backend, formato e hardware.

AGENTI27
Interfaccia ufficiale del playground CLM-8B con stato, azioni candidate e probabilità

Stanford e NVIDIA Research hanno pubblicato codice e pesi Apache 2.0 di CLM-8B. Il modello non genera testo: confronta uno stato con azioni candidate, riusa gli embedding delle azioni e restituisce probabilità per routing, scelta di tool e verifica di soluzioni.

Limiti da conoscere

Limite: I confronti di latenza e i risultati su DeepSWE e Terminal-Bench sono misure degli autori, non test indipendenti. Il checkpoint richiede il backbone Qwen3-8B, Linux e una GPU NVIDIA; la testa da 75 MB non rappresenta l’intero requisito di memoria.

LA COMMUNITY SCEGLIE

Quale notizia merita un test?

Scegli una notizia qui sotto o usa “Mi interessa” nella sua scheda. Un voto per edizione su questo dispositivo, senza iscrizione.

Radar AI · a cura di Francesco Gruner

Chiedi al sito.

Assistente OpenAI

Le domande vengono inviate a OpenAI. Non inserire dati personali o riservati. Privacy.

Verifica le risposte nelle fonti. 16 messaggi al giorno per rete.

Cosa cerchi? Ti indico le pagine utili.