Il 23 luglio 2026 OpenAI ha portato ChatGPT Voice sull’app desktop per Mac e Windows. Non è la vecchia modalità vocale avanzata: questa versione è collegata agli agenti di ChatGPT Work e di Codex, e può lavorare sui file, sulle app e sui servizi che le rendi disponibili mentre tu continui a parlare d’altro. L’ho messa alla prova su tre lavori veri - non su demo preparate - e questo è quello che ho trovato.
Cos’è ChatGPT Voice su desktop (e cosa non è)
ChatGPT Voice si appoggia a GPT-Live, la stessa tecnologia full-duplex già presente su iPhone e iPad: ascolta e parla nello stesso momento, quindi puoi interromperlo e lui riprende il filo senza perdere il contesto.
Sotto il cofano però non lavora un modello solo. Nella documentazione sui prezzi OpenAI spiega che la versione desktop è duplex: GPT-Live gestisce la conversazione, un modello di ragionamento più pesante avvia e coordina il lavoro. È il motivo per cui la voce resta fluida anche mentre parte un task lungo.
La novità vera comunque non è la voce. È il collegamento agli agenti. Una conversazione vocale può avviare un task dentro ChatGPT Work o Codex, seguirne l’avanzamento e coordinare più agenti che lavorano in parallelo. Tu parli, e nel frattempo qualcosa succede davvero sul computer.
Vale la pena essere precisi su cosa non fa, perché il marketing intorno a questi strumenti tende a gonfiare. Quando gliel’ho chiesto direttamente, la risposta è stata chiara: può lavorare sui file e sulle cartelle che gli rendi accessibili, crearne di nuovi, usare skill, app e connettori disponibili, e usare il browser integrato quando serve - ma non accede a tutto il computer. È un agente con un perimetro, non un telecomando universale.
Requisiti, piani e costi
- App desktop ChatGPT per macOS o Windows - da browser non funziona
- La versione standalone in Work e Codex non esiste su web né su mobile: dal telefono ci arrivi solo in remoto
- Rollout globale a partire dal 23 luglio 2026
- Non c’è ancora un’API: per ora si usa solo dentro l’app
Sui costi conviene guardare due contatori separati, perché è il punto dove ci si sbaglia: i minuti di conversazione e il lavoro degli agenti si pagano a parte. Un task avviato a voce consuma il budget Codex che avevi già.
Ti sta piacendo?
Ricevi una guida pratica ogni settimana. AI, tool e automazioni.
Test 1: email, ricerca online e un documento Word, solo parlando
Il primo esperimento è volutamente banale e per questo utile: gli ho chiesto di controllare la posta, cercare le ultime notizie sull’intelligenza artificiale e scrivermi un documento Word dentro una cartella nuova sul desktop.
La parte interessante è come lo fa. Ha aperto una procedura di triage sulla casella Gmail collegata - dichiarando esplicitamente di operare in sola lettura e senza modificare nulla - e ha avviato la ricerca nel browser integrato nell’app, non in Chrome, non con un’estensione. Si vede la pagina scorrere mentre lui legge.

Nel frattempo aveva creato una chat separata per la rassegna, così il lavoro continuava anche quando la conversazione era già andata avanti su altro. Alla fine, sul desktop, c’era davvero una cartella nuova con dentro un file Word: cinque notizie selezionate, le fonti, e una possibile struttura per un video.
Test 2: un sito web creato parlando
Il secondo test è quello che mi interessava di più: creare un sito web con ChatGPT senza scrivere una riga di codice e senza toccare la tastiera. Gli ho chiesto a voce una landing page per accessori per cani, con prodotti, un blog finto e - soprattutto - immagini originali generate da lui, non stock.

Ha usato la skill ChatGPT Sites per costruzione e hosting insieme a ImageGen per le fotografie, definendo da solo una direzione visiva coerente. Mentre lavorava, io continuavo a parlare d’altro: è la differenza pratica fra un chatbot e un agente.

Non è un lavoro da studio di design, e non fingo il contrario. Ma è pubblicato, ha un URL funzionante, e l’ho ottenuto parlando. Quando invece il progetto deve reggere davvero il discorso cambia: quando ho costruito un gestionale per MSP con il vibe coding la parte lunga non è stata generare il codice, ma decidere cosa doveva fare.
Una precisazione utile prima di farci progetti sopra: nella documentazione OpenAI, ChatGPT Sites nasce per siti e app interne - un tracker di progetto, una dashboard, un calcolatore - e include hosting, controlli di accesso, storage e database. Quello che non fa è collegarsi a fonti dati live: se i contenuti cambiano spesso serve un’automazione separata che prepari gli aggiornamenti e poi rigeneri il sito. La mia landing page è un uso di confine, e il risultato lo rispecchia.
Dal pannello dedicato si può poi cambiare l’URL, agganciare un dominio proprio tramite DNS e impostare le variabili d’ambiente.

Test 3: gestire progetti Codex con la voce
Qui la domanda era secca: puoi vedere i progetti aperti in Codex, o crearne di nuovi? La risposta è sì - può vedere i progetti, creare nuove chat o task dentro un progetto esistente oppure fuori da qualsiasi progetto, e riportare il risultato quando ha finito.
Per chi lavora già con agenti di sviluppo è il pezzo che cambia il flusso: dettare un task mentre stai facendo altro e ritrovarlo eseguito, senza aprire un editor.
Due funzioni meno evidenti che vale la pena conoscere
Più agenti in parallelo, con il contesto che rimane
Non è semplice multitasking: puoi continuare a parlare mentre un task gira in Codex, e lui mantiene il contesto della conversazione trasformando richieste lunghe in lavoro autonomo. La seconda variante è ancora più utile: trasformare una richiesta in un controllo ricorrente - per esempio un riepilogo ogni mattina che unisce agenda e novità e ti riporta solo ciò che richiede attenzione, collegando fonti diverse in un briefing unico.

Riprendere il lavoro dallo smartphone
La funzione Remote permette di agganciare il telefono al computer e continuare da lì la sessione in corso, o crearne una nuova. Si attiva dalle impostazioni, sotto Programmazione → Connessioni, aggiungendo il dispositivo tramite QR code.

Il caso d’uso concreto: sei da un cliente, fotografi il negozio, mandi le immagini e chiedi a voce di modificare il sito in tempo reale usando quelle foto. Il sito è pubblicato, la modifica è immediata. È la stessa direzione che avevo visto quando Claude Cowork è arrivato su mobile: il lavoro continua anche quando il laptop è chiuso.
Una nota pratica emersa dalla prova: la conversazione vocale è unica. Se hai una sessione attiva su un dispositivo, non puoi usarne un’altra altrove nello stesso momento.
Privacy e accessi: cosa verificare prima di collegare tutto
Questa è la parte che di solito nei video non si racconta, e invece è quella che conta se lavori con dati di clienti.
Nel momento in cui concedi l’accesso completo, stai mettendo a disposizione di un servizio esterno il contenuto del tuo desktop, la tua posta e i tuoi progetti. Prima di collegare posta, file aziendali e desktop è necessario verificare piano, configurazione, residenza dei dati e condizioni contrattuali applicabili: destinazione, trattamento e localizzazione dipendono dal contratto che hai, non da un’impostazione generica.
C’è poi una funzione da guardare con attenzione se usi il Mac. Si chiama Screen Context, e permette a ChatGPT di catturare la finestra in primo piano - compreso il testo fuori dall’area visibile, quello che dovresti scorrere per leggere. Su Windows non c’è. Nelle organizzazioni Enterprise ed Edu l’amministratore del workspace può disattivarla, e nelle prime due settimane di rollout deve anzi abilitarla esplicitamente. Se gestisci un parco macchine, è l’interruttore da decidere prima, non dopo.
Vale anche il contesto normativo: chi pubblica contenuti generati con l’AI ha già obblighi in vigore, a prescindere da quali parti dell’AI Act siano state rinviate.
Il consiglio pratico è banale ma lo seguo io per primo: usa un profilo o una cartella dedicata per le prove, e non dare l’accesso completo alla macchina su cui tieni i progetti dei clienti.
Conclusione
ChatGPT Voice su desktop non è “un ChatGPT che parla”. È il passaggio dall’assistente che risponde all’agente che esegue, con la voce come interfaccia invece della tastiera. Chi già lavora con Codex o con altri strumenti agentici ci troverà il salto più evidente: dettare un task mentre fai altro e ritrovarlo fatto.
Non è magia e non fa tutto: lavora dentro il perimetro che gli dai, e quel perimetro va deciso con la testa. Ma è la prima volta che, per costruire e pubblicare un sito, non ho toccato né la tastiera né il mouse.
Che differenza c’è tra ChatGPT Voice su desktop e la modalità vocale del telefono?
Sul telefono la voce serve a conversare: chiedi, risponde. Su desktop è collegata a ChatGPT Work e Codex, quindi può avviare task, seguirli e coordinare più agenti mentre tu continui a parlare. Il modello è lo stesso, GPT-Live, ma il perimetro di azione è diverso.
Su quali piani è disponibile?
Plus, Pro, Business, Edu ed Enterprise. Su Free e Go non c’è. Serve l’app desktop per macOS o Windows: dal browser non funziona, e la versione standalone in Work e Codex non esiste su mobile. Nei workspace Enterprise ed Edu deve essere l’amministratore ad abilitarla.
Quanto costa usarla oltre la soglia inclusa?
Ci sono due contatori distinti: i minuti di conversazione e il lavoro degli agenti. Su Business ed Enterprise a crediti, Voice in Work e Codex costa circa 6 crediti al minuto, mentre i task avviati a voce consumano il budget Codex già esistente. Su Plus e Pro la quota è inclusa e misurata su finestre mobili di 5 ore.
ChatGPT Voice controlla davvero tutto il computer?
No, e conviene saperlo prima. Lavora sui file e sulle cartelle che gli rendi accessibili, usa skill, app, connettori e il browser integrato, ma non accede all’intera macchina. È un agente con un perimetro definito da te, non un controllo remoto del sistema.
C’è qualcosa che funziona solo su Mac?
Sì: Screen Context, la funzione che permette a ChatGPT di leggere la finestra in primo piano, incluso il testo fuori dall’area visibile. Su Windows non è presente. Negli account aziendali l’amministratore può disattivarla dalle impostazioni del workspace.
Si può usare via API per costruirci sopra qualcosa?
Non ancora. ChatGPT Voice su desktop non è esposto via API: al momento esiste solo dentro l’app. Chi vuole automatizzare flussi vocali agentici deve passare comunque dall’interfaccia, oppure lavorare sugli agenti Codex per la loro strada.
Requisiti, piani, costi e controlli amministrativi di questo articolo sono stati verificati sulla documentazione ufficiale OpenAI il 2 agosto 2026.
ChatGPT Voice
Pagina ufficiale della funzione: come lavora la modalità Live, gestione delle interruzioni e limiti orari per piano su finestre mobili.
Apri fonteChatGPT - Release Notes
Changelog ufficiale con l’annuncio di Voice in Work e Codex sull’app desktop: da qui vengono data di rilascio e ambito della funzione.
Apri fontePricing e consumo crediti
Documentazione sui costi: circa 6 crediti al minuto per Voice su desktop, contatore separato dai task Codex, architettura duplex e assenza di accesso via API.
Apri fonteChatGPT Sites
Guida ufficiale alla skill usata per il sito del secondo test: cosa include il deploy, gestione degli accessi e limite sul collegamento a dati live.
Apri fonteChatGPT Enterprise ed Edu - Release Notes
Riferimento per i controlli lato amministratore: abilitazione di Voice, disattivazione di Screen Context e gestione del pool di crediti condiviso.
Apri fonteSu ChatGPT Sites farò un test dedicato, con confronto rispetto a Lovable AI, Bolt e v0. Se vuoi riceverlo quando esce, insieme alle prove che faccio ogni settimana sugli strumenti AI, iscriviti alla newsletter - e sul canale YouTube trovi le versioni filmate di questi test.










