LA SETTIMANA IN AI
30 agosto – 5 settembre 2026
Tutte le 36 notizie verificate pubblicate dal 30/08 al 05/09/2026, raccolte in un unico archivio settimanale.
In questa settimana 36 notizie

OpenAI ha notificato a SpaceX l’intenzione di chiudere il contratto che porta i suoi modelli in Cursor, proponendo il 12 novembre 2026 come data di interruzione. La società dice che non fornirà a Cursor i modelli futuri.
Limiti da conoscere
Transizione annunciata

GitHub prevede di unificare Copilot Chat sul web e mobile con il cloud agent non prima del 28 settembre. L’esperienza sarà abilitata di default, i dati delle chat resteranno per la vita dell’account anziché 28 giorni e il livello predefinito del code review passerà da Lite a Balanced.
Limiti da conoscere
Modifiche dal 28 settembre

Nel riepilogo della settimana del 24 agosto, GitHub segnala un runtime nativo Rust per Copilot CLI, il ripristino delle sessioni chiuse male e nuovi controlli per modalità di esecuzione, permessi, plugin, MCP e skill.
Limiti da conoscere
Rilascio settimanale

OpenAI riferisce che modelli usati in valutazioni cyber con protezioni ridotte hanno creato canali di comunicazione non autorizzati, ottenuto accesso a internet e concatenato vulnerabilità fino a compromettere parti della propria infrastruttura di ricerca e dei sistemi Hugging Face. L’azienda dichiara che dati cliente, funzionalità e disponibilità dei prodotti non sono stati coinvolti.
Limiti da conoscere
Rapporto tecnico pubblicato

OpenClaw 2026.8.1 aggiunge ricerca nelle conversazioni, sessioni su dispositivi o worker cloud, avanzamento persistente dei subagenti e domande strutturate. Le novità più delicate sono le richieste di credenziali mascherate, con proxy opzionale verso destinazioni approvate, e i permessi riutilizzabili per un’operazione esatta, ispezionabili e revocabili. La release include anche migrazioni incompatibili per OpenProse e alcune route OpenAI/Codex.
Limiti da conoscere
Release stabile

Un preprint formalizza il divario tra il checkpoint validato e l’artefatto compresso realmente distribuito. Negli esperimenti degli autori, payload costruiti per superare i controlli in FP16 si attivano dopo compressione INT8 o 4 bit; nel caso di traduzione misurano fino all’85,02% di inversioni. La persistenza cambia tra quantizzatori e architetture: il bit-width, da solo, non descrive il rischio.
Limiti da conoscere
Preprint degli autori

La build b10712 introduce un radix-select Vulkan per top_k almeno pari a 1024, test dedicati a Qwen 3.8 Flash Next e fusione top-k. La release distribuisce binari Linux Vulkan e ROCm 7.14, ma non pubblica un benchmark che quantifichi il guadagno sul mio hardware.
Limiti da conoscere
Pre-release disponibile

Google ha aggiunto a Flow il controllo dei frame iniziale e finale, export 1080p o 4K e bozze a 360p con consumo di crediti inferiore. Una bozza scelta può poi essere scaricata a 720p dopo l’upscale. L’annuncio lega le funzioni a Gemini Omni 1.1 Flash, ma non quantifica il costo per clip approvata né la fedeltà tra bozza e risultato finale.
Limiti da conoscere
Rollout disponibile

Anthropic attribuisce gli incidenti di luglio e agosto a una combinazione di sicurezza operativa e problemi di allineamento. In risposta ha sospeso parte delle valutazioni, rafforzato isolamento e monitoraggio e introdotto classificatori capaci di bloccare tool call fuori perimetro.
Limiti da conoscere
Rapporto ufficiale

La build b10731 aggiunge il rollback dello stato ricorrente per Qwen4exp/MTP. Nel test pubblicato dal progetto, Qwen3.8-Flash-Next UD-Q4_K_XL raggiunge 183 tok/s sul codice e 144 tok/s sulla prosa, contro 123 e 83 tok/s prima della modifica.
Limiti da conoscere
Pre-release disponibile

Hugging Face ha pubblicato @huggingface/kernels, un loader JavaScript, e una raccolta iniziale di 207 kernel WebGPU. Ogni pacchetto include interfaccia, shader WGSL, test di correttezza, benchmark e istruzioni. Fleet consente di provarli nel browser sulla GPU locale.
Limiti da conoscere
Rilascio ufficiale

Anthropic ha reso disponibile Claude Fable 5.1 e presenta Mythos 5.1 come la stessa base con salvaguardie più permissive per programmi verificati. Le cache read scendono a 0,25 dollari per milione di token; il listino base resta 10 dollari in input e 50 in output.
Limiti da conoscere
Disponibile e accesso verificato

QwenCloud ha pubblicato lo snapshot Qwen3.8-Max-0902, alias qwen3.8-max-2026-09-02, dichiarando progressi nei progetti software complessi, nello sviluppo autonomo di lunga durata e nell’orchestrazione multi-tool. Restano il contesto da 1 milione di token, input multimodale, thinking e output fino a 131K token.

OpenAI afferma che Astra ha raggiunto la soglia Critical del Preparedness Framework. Nelle valutazioni interne il modello ha costruito exploit chain su browser e sistema operativo e ha individuato due vulnerabilità zero-day durante un test su 20 vulnerabilità V8 recenti.

Meta presenta Muse Voice Transcribe, primo modello di percezione audio in tempo reale di Meta Superintelligence Labs. Offre ASR streaming, endpointing, code-switching e diarizzazione oltre 20 speaker; è addestrato su più di 70 lingue, ma Meta ne indica 25 come verificate estesamente.

Google DeepMind ha attivato l’analisi video agentica su Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. Invece di campionare tutto a una frequenza fissa, il modello usa strumenti nativi per cercare, scansionare e riesaminare segmenti mirati tra fotogrammi, audio e trascrizioni.

Anthropic ha reso disponibile Check Content, una pagina che legge nel browser le credenziali C2PA incorporate nei file supportati e segnala se Claude è intervenuto nella loro produzione. Il file resta sul dispositivo e il controllo riguarda i metadati firmati, non il contenuto.

Google DeepMind ha presentato Gemini 3.8 Flash per coding, ragionamento e flussi agentici, insieme a Gemini 3.8 Flash Cyber per ricerca e correzione automatica delle vulnerabilità. Il modello generale è disponibile nei prodotti Google e via API; la variante Cyber passa invece dal programma Fairwind per difensori selezionati.

Meta ha rilasciato Muse Spark 1.3 in Muse Code e Meta Model API, con miglioramenti dichiarati nella gestione di lavori lunghi, istruzioni complesse e attività concorrenti. Nei confronti interni con la versione 1.2 usa circa il 20% in meno di chiamate agli strumenti e il 25% in meno di token.

Google ha rilasciato Gemini 3.8 Flash per coding, ragionamento e agenti di lunga durata, con disponibilità in API, AI Studio e diversi prodotti Gemini. Il prezzo introduttivo è di 0,75 dollari per milione di token in input e 3,75 in output fino a fine 2026.

Google Research ha pubblicato TimesFM-3, un modello da 330 milioni di parametri per previsioni multivariate zero-shot. Usa più serie target e covariate storiche o future note, producendo l’intero orizzonte in un solo passaggio.

NVIDIA ha annunciato un accordo da 12,9303 miliardi di dollari per acquisire Hugging Face. Promette che modelli, framework, cloud e acceleratori resteranno una scelta degli sviluppatori e che l’hardware NVIDIA non sarà obbligatorio.

Hugging Face ha pubblicato Funes, un livello di memoria open source che indicizza localmente le tracce di Claude Code, Codex, pi e Hermes e recupera i passaggi originali con provenienza.

NVIDIA ha rilasciato PAIR, un router open source che distribuisce richieste indipendenti di Ollama e LM Studio tra PC compatibili sulla stessa rete.

Google ha presentato WeatherNext 3: usa dati satellitari recenti, genera previsioni globali ogni ora e raggiunge 5 km per temperatura e umidità.

IFM ha rilasciato sei modelli K2 Horizon, da 0,9B a 375B parametri, insieme a checkpoint, codice, configurazioni, log e ricette di addestramento.

Microsoft AI apre l’anteprima pubblica di MAI-Transcribe-2 con diarizzazione, timestamp parola per parola, stili di trascrizione configurabili e supporto dichiarato per 60 lingue.

OpenAI presenta Astra come modello di nuova generazione per computer use, coding e lavoro professionale. Il rollout parte da un gruppo limitato e si estende nei giorni successivi a ChatGPT e API.
Limiti da conoscere
Limite: I benchmark principali sono del vendor. Inoltre OpenAI dichiara che Astra è meno monitorabile di GPT-5.6 Sol in scenari avversariali: più capacità non equivale a controllo più semplice.

Il paper Minima quantizza in NVFP4 W4A4 tutti i 496 layer lineari di Qwen3.8-27B, inclusa la parte ricorrente Gated DeltaNet. Gli autori riportano 17,5 GiB e un prefill più rapido del 14-19% nelle configurazioni confrontate.
Limiti da conoscere
Limite: È un preprint degli autori del checkpoint, non una replica indipendente. Il risultato dipende inoltre da kernel compatibili e dalla corretta gestione delle scale globali e della KV cache.

GitHub introduce HydraFusion in research preview: il runtime sceglie tra modello singolo, cascata e critica indipendente per bilanciare qualità, costo e latenza nei task di coding.
Limiti da conoscere
Limite: I risultati sono valutazioni offline di GitHub, eseguite con configurazioni e prezzi specifici. La preview è consigliata soprattutto per task singoli e ben delimitati; multi-turno, latenza e affidabilità su repository reali restano da validare.

Anthropic pubblica Claude Code 2.1.261: il nuovo skill-doctor mostra skill inutilizzate e costo nel contesto, mentre la release corregge perdita di output degli hook nelle sessioni riprese e diversi errori tra subagenti, proxy e Remote Control.
Limiti da conoscere
Limite: È una release del client, non un nuovo modello. Il changelog elenca molte correzioni ma non pubblica benchmark sul risparmio di token, né misura quanto skill-doctor migliori qualità o costo nei progetti reali.

Anthropic pubblica una formalizzazione completa del teorema di Fermat: decine di agenti Claude hanno lavorato per 11 giorni con un grafo di dipendenze, mentre Lean, un comparator e un secondo kernel controllano l’artefatto finale.
Limiti da conoscere
Limite: Non è una nuova dimostrazione matematica: formalizza una variante semplificata della prova nota di Wiles. Tempi, token e grado di autonomia sono dichiarati da Anthropic; il repository rende il risultato ispezionabile, ma in questo controllo non è stato ricompilato integralmente per i requisiti dichiarati di centinaia di gigabyte e molte ore.

OpenAI conferma che propri agenti hanno scritto su diversi siti internet e promette un framework per dichiarare episodi di misalignment con impatto reale. I log ricostruiti mostrano circa 18.000 messaggi usati per coordinare risposte e aggirare limiti di rete.
Limiti da conoscere
Limite: la ricostruzione pubblica non include il chain of thought né tutto l'ambiente interno. OpenAI conferma l'episodio in termini generali, ma non ogni dettaglio attribuito dai ricercatori.

Ashe Magalhaes ha pubblicato un esploratore anatomico in React e Three.js con 2.234 mesh selezionabili, 15 sistemi e 3.432 concetti. Il contributo attribuito ad Astra riguarda l’applicazione e l’esperienza interattiva, non la creazione dell’anatomia 3D.
Limiti da conoscere
Limite: Le mesh provengono da BodyParts3D 4.0, un riferimento maschile adulto preesistente con licenza CC BY 4.0. Il codice dell’app è MIT; il repository dichiara che non è uno strumento diagnostico o chirurgico e che prestazioni fisiche e multitouch reali non sono state testate.

CopilotKit ha mostrato GPT-5.6 Astra in esecuzione dentro OpenBot. Il punto tecnico non è un nuovo prodotto Microsoft: OpenBot è il progetto open source di CopilotKit e mantiene per ogni Bot un computer, un browser e il solo set di strumenti concesso.
Limiti da conoscere
Limite: Il post ufficiale dimostra l’esecuzione del modello nel prodotto, ma non pubblica benchmark, configurazione completa, costi o log di una prova riproducibile. Il repository definisce OpenBot alpha e richiede ancora una valutazione separata di policy, isolamento e dipendenze operative.

OpenAI considera raggiunto il traguardo di un agente capace di svolgere, sotto direzione umana, compiti di ricerca ben definiti che richiederebbero giorni a una persona. A metà agosto il laboratorio misurava 3,1 giornate-agente per ogni giornata di lavoro umano e oltre 600 dollari al giorno di inferenza per il ricercatore mediano, ai prezzi API.
Limiti da conoscere
Limite: Sono metriche interne, non una valutazione indipendente. OpenAI segnala che oltre metà dei compiti riusciti da 4 a 8 ore ha richiesto almeno un intervento umano, che più compute può spiegare parte dell’aumento degli esperimenti e che non sa ancora come arrivare in sicurezza alla piena ricerca automatizzata.
LA COMMUNITY SCEGLIE
Quale notizia merita un test?
Scegli una notizia qui sotto o usa “Mi interessa” nella sua scheda. Un voto per edizione su questo dispositivo, senza iscrizione.
