# Gemini 3.8 Live: cosa cambia davvero tra voce, visione e tool asincroni > Fonte: https://francescogruner.it/gemini-3-8-live-extended-thinking/ Nel video condiviso da Google Developers, una persona costruisce un cyberdeck senza conoscere bene l’hardware. Punta la videocamera sul banco, parla con Gemini, gli fornisce documentazione e librerie dei componenti e riceve istruzioni mentre collega display e Raspberry Pi. È una demo efficace, ma il punto tecnico non è che «l’AI sa montare un computer». La novità è il modo in cui il modello mantiene il dialogo mentre osserva immagini, consulta contesto e porta avanti lavoro asincrono. **Risposta breve**Gemini 3.8 Live è pensato per dialoghi vocali rapidi e compiti diretti. Gemini 3.8 Live Extended Thinking è pensato per workflow complessi: può ragionare e chiamare strumenti in background, parlare durante l’attesa e chiudere davvero l’interazione solo quando `interaction_status` passa a `IDLE`. La demo mostra la fattibilità dell’esperienza, non la sua affidabilità in produzione. Indice dei contenuti [Toggle](#) - [Cosa mostra davvero la demo del cyberdeck](#Cosa_mostra_davvero_la_demo_del_cyberdeck) - [Gemini 3.8 Live ed Extended Thinking non sono lo stesso modello](#Gemini_38_Live_ed_Extended_Thinking_non_sono_lo_stesso_modello) - [Gemini 3.8 Live](#Gemini_38_Live) - [Gemini 3.8 Live Extended Thinking](#Gemini_38_Live_Extended_Thinking) - [La differenza importante: turnComplete non significa più “finito”](#La_differenza_importante_turnComplete_non_significa_piu_%E2%80%9Cfinito%E2%80%9D) - [Cosa entra ed esce dalla Live API](#Cosa_entra_ed_esce_dalla_Live_API) - [Il prezzo nominale non è il costo dell’agente](#Il_prezzo_nominale_non_e_il_costo_dellagente) - [Benchmark: numeri interessanti, ma del produttore](#Benchmark_numeri_interessanti_ma_del_produttore) - [Privacy: gratuito e a pagamento non hanno lo stesso trattamento](#Privacy_gratuito_e_a_pagamento_non_hanno_lo_stesso_trattamento) - [Come lo testerei prima di usarlo davvero](#Come_lo_testerei_prima_di_usarlo_davvero) - [Il mio verdetto](#Il_mio_verdetto) - [Domande frequenti](#Domande_frequenti) - [Fonti e riferimenti](#Fonti_e_riferimenti) - [Gemini 3.8 Live e Live Extended Thinking](#Gemini_38_Live_e_Live_Extended_Thinking) - [Thinking nella Live API](#Thinking_nella_Live_API) - [New Gemini Audio models for developers](#New_Gemini_Audio_models_for_developers) ## Cosa mostra davvero la demo del cyberdeck Ho analizzato il video pubblico, i sottotitoli e le due versioni disponibili nel post. Il filmato dura 67,88 secondi. Nella sequenza vediamo il modello riconoscere il banco di lavoro, ricevere un piano di costruzione con documenti e dettagli di cablaggio, spiegare come aprire il fermo del connettore DSI e guidare l’accensione del prototipo. Quello che possiamo osservare è un’interazione vocale collegata al contesto visivo. Il filmato suggerisce anche l’uso della documentazione in background. Non vediamo però log, prompt completi, tempi grezzi, errori, ripetizioni o collegamenti sbagliati. I tagli di montaggio impediscono di misurare latenza, continuità reale e tasso di riuscita. Va quindi trattato come una dimostrazione scelta dal produttore, non come un benchmark indipendente. **Demo ufficiale:** [guarda il video originale nel post Google Developers su LinkedIn](https://www.linkedin.com/posts/googledevelopers_cyberdeck-builder-companion-with-gemini-38-activity-7505675439978504192-05-E). Il filmato non è stato ricaricato su questo sito. ## Gemini 3.8 Live ed Extended Thinking non sono lo stesso modello ### Gemini 3.8 Live **Model ID**`gemini-3.8-live`**Obiettivo**Dialogo rapido, turni immediati, tool veloci**Thinking**Interleaved, non configurabile**Tool**`BLOCKING` o `NON_BLOCKING`**Fine del turno**`turnComplete` riporta il client in idle ### Gemini 3.8 Live Extended Thinking **Model ID**`gemini-3.8-live-extended-thinking`**Obiettivo**Pianificazione e workflow multi-step**Thinking**`low`, `medium` o `high`**Tool**Solo `NON_BLOCKING`**Fine del lavoro**Solo `interaction_status = IDLE` ![Confronto tra Gemini 3.8 Live ed Extended Thinking per latenza, tool e gestione dello stato](https://francescogruner.it/wp-content/uploads/2026/09/gemini-3-8-live-choose-model.jpg) Il modello base privilegia il dialogo rapido; Extended Thinking richiede una gestione più complessa dello stato e degli strumenti asincroni. ## La differenza importante: turnComplete non significa più “finito” Con Extended Thinking il modello può emettere una frase intermedia, marcare quel segmento audio come completato e continuare a ragionare o aspettare il risultato di uno strumento. Se il client chiude la sessione al primo `turnComplete: true`, rischia di interrompere il lavoro prima della risposta finale. Il ciclo corretto segue `interaction_status`. Durante il ragionamento e le chiamate agli strumenti lo stato resta `IN_PROGRESS`. Il client torna in ascolto soltanto quando riceve `IDLE`. Inoltre, tutte le funzioni dichiarate per Extended Thinking devono avere comportamento `NON_BLOCKING`: una funzione bloccante produce un errore. ![Diagramma degli stati di Gemini 3.8 Live Extended Thinking da audio utente a interaction status IDLE](https://francescogruner.it/wp-content/uploads/2026/09/gemini-3-8-live-state-machine.jpg) Schema semplificato del ciclo applicativo: la fine di un segmento audio non coincide necessariamente con la conclusione dell’interazione. ## Cosa entra ed esce dalla Live API La Live API usa una connessione WebSocket stateful. Accetta testo, audio, immagini e video. L’audio in ingresso è PCM 16 bit a 16 kHz, quello in uscita PCM 16 bit a 24 kHz. I due modelli dichiarano 131.072 token di input e 65.536 di output. Il supporto alle immagini significa comprensione visuale, non generazione. Per il flusso visuale, la Live API riceve il video come sequenza di immagini, per esempio JPEG o PNG, fino a un frame al secondo. Non sono indicati come disponibili caching, code execution, file search, structured output, URL context o Batch API. Le sessioni native audio hanno inoltre limiti operativi: fino a 15 minuti per solo audio e fino a 2 minuti quando entra anche il video, salvo [gestione e ripresa della sessione](https://ai.google.dev/gemini-api/docs/live-api/session-management). ## Il prezzo nominale non è il costo dell’agente [Google pubblica per Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking](https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/) un prezzo di 0,005 dollari al minuto per l’audio in ingresso e 0,018 dollari al minuto per l’audio in uscita. La [pagina generale dei prezzi](https://ai.google.dev/gemini-api/docs/pricing) raggruppa invece le tariffe sotto la voce generica dei modelli native audio della Live API; prima di costruire un conto economico verificherei comunque lo SKU e la tariffa effettivamente applicati nella console del progetto. Dati verificati il 15 settembre 2026. Anche quando il prezzo del modello è confermato, mancano trasporto realtime, WebRTC o media server, telefonia, tool esterni, storage, osservabilità, retry e supervisione. Un confronto “costa X all’ora” è poco utile se non dichiara quanta parte della sessione contiene audio in ingresso, audio generato, silenzio e attese degli strumenti. ## Benchmark: numeri interessanti, ma del produttore Google riporta per Extended Thinking il primo posto nello Speech-to-Speech Quality Index di Artificial Analysis con 82,6, il 68,6% su τ-Voice, il 35,1% su τ-Voice-banking e il 97,7% su Big Bench Audio. Questi numeri descrivono test diversi: preferenza o qualità conversazionale, completamento di compiti agentici e ragionamento audio non sono la stessa cosa. La pagina di lancio non fornisce log grezzi, varianza o una prova italiana controllata. La model card, invece, dichiara anche i limiti: possibili allucinazioni, rallentamenti o timeout e knowledge cutoff gennaio 2025. Il verdetto corretto è quindi “promettente da testare”, non “migliore in assoluto”. ## Privacy: gratuito e a pagamento non hanno lo stesso trattamento Nei servizi gratuiti del Gemini Developer API Google può usare prompt, file e risposte per migliorare i prodotti, anche tramite revisori umani, e invita a non inviare informazioni sensibili o riservate. Nei servizi a pagamento dichiara di non utilizzare prompt e risposte per il miglioramento dei prodotti, pur potendo conservarli temporaneamente per sicurezza e obblighi normativi. La [zero data retention](https://ai.google.dev/gemini-api/docs/zdr) non è automatica: richiede approvazione per il progetto. Nella Live API bisogna inoltre evitare la session resumption se si vuole restare nel perimetro ZDR; un session handle può comportare conservazione per 24 ore. Il Search grounding conserva prompt, contesto e output per 30 giorni. Per un agente che vede un banco di lavoro, uno schermo o documenti aziendali, questi dettagli contano più dell’effetto wow della demo. ## Come lo testerei prima di usarlo davvero 1. Stesso script in italiano per almeno tre run, con rete e regione annotate. 2. Misura del time-to-first-audio e della latenza dopo un’interruzione. 3. Tool artificialmente lenti da 2, 5 e 10 secondi, inclusi timeout ed errori. 4. Codici alfanumerici, accenti, rumore e cambio lingua italiano/inglese. 5. Azioni irreversibili protette da conferma esplicita e chiave di idempotenza. 6. Log separati per audio, tool call, stato dell’interazione e costo. È lo stesso principio che ho usato quando ho creato un [prototipo Android con Google AI Studio](https://francescogruner.it/google-ai-studio-app-android-gemini-35-flash/): una demo ha valore quando rende visibili anche condizioni, limiti e passaggi riproducibili. Per l’architettura generale rimando anche alla mia [guida ai documenti ufficiali sugli agenti Google](https://francescogruner.it/google-ai-agents-la-guida-completa-ai-5-documenti-ufficiali-250-pagine/). Il confronto più vicino sul versante concorrente è la pagina Radar dedicata a [GPT-Live-1 nelle API](https://francescogruner.it/radar-ai/10-settembre-2026/gpt-live-1-api-agenti-vocali-full-duplex/). ## Il mio verdetto La demo del cyberdeck funziona perché trasforma il modello in un compagno di banco: vede, ascolta e mantiene il filo mentre l’utente usa entrambe le mani. La parte davvero nuova, però, è meno cinematografica: Extended Thinking cambia il contratto del client, obbliga a gestire strumenti non bloccanti e separa la fine di un segmento audio dalla fine dell’interazione. Sceglierei Gemini 3.8 Live per assistenza vocale rapida, triage e comandi diretti. Proverei Extended Thinking per diagnostica, tutoring e workflow con più strumenti, ma solo con timeout, conferme e osservabilità. Terrei ancora una pipeline a cascata quando servono componenti sostituibili, trascrizioni auditabili o controllo separato su riconoscimento, ragionamento e sintesi vocale. **Prima di scegliere un modello Live**, confronta sul tuo caso d’uso latenza, completamento del compito e costo totale. Per il confronto architetturale puoi leggere anche l’analisi di GPT-Live-1 e la guida agli agenti Google collegate sopra. ## Domande frequenti Gemini 3.8 Live Extended Thinking ragiona davvero mentre parla? Può emettere aggiornamenti vocali mentre ragionamento e tool asincroni restano attivi. Non significa che esponga una catena di pensiero interna completa: il client riceve audio, eventi, tool call e stato dell’interazione. Posso usare function calling bloccante? Sul modello base sì, anche se NON_BLOCKING è il comportamento predefinito. Su Extended Thinking le funzioni devono essere NON_BLOCKING; quelle bloccanti producono errore. Il video del cyberdeck è un test indipendente? No. È una demo ufficiale montata da Google Developers. Mostra un caso d’uso plausibile, ma non documenta failure rate, latenza grezza o accuratezza su più prove. Si può usare con dati aziendali riservati? Va progettato sul tier e sul contratto corretti. I servizi gratuiti hanno condizioni di data use diverse dai servizi a pagamento; ZDR richiede approvazione e configurazioni compatibili. Quanto costa Gemini 3.8 Live? Google indicava al lancio 0,005 dollari al minuto per l’audio in ingresso e 0,018 dollari al minuto per l’audio in uscita. La tariffa effettiva va verificata nella console e nella pagina ufficiale dei prezzi. Non coincide con il costo completo dell’agente, che può includere telefonia, trasporto realtime, strumenti esterni, storage, osservabilità e retry. Quanto può durare una sessione Live? La documentazione indica fino a 15 minuti per sessioni solo audio e fino a 2 minuti per sessioni con video. Le conversazioni più lunghe richiedono una gestione esplicita della sessione e della ripresa, da valutare anche rispetto ai requisiti di conservazione dei dati. ## Fonti e riferimenti Fonti primarie Google verificate il 15 settembre 2026. Il video è conservato localmente per analisi; la sua accessibilità pubblica non implica diritti di ripubblicazione. [Annuncio ufficiale ### Gemini 3.8 Live e Live Extended Thinking Disponibilità, capacità dichiarate e benchmark riportati da Google. Apri fonte](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/) [Documentazione ### Thinking nella Live API Stati IN_PROGRESS/IDLE, tool NON_BLOCKING e configurazione del thinking. Apri fonte](https://ai.google.dev/gemini-api/docs/live-api/thinking) [Prezzi e sviluppo ### New Gemini Audio models for developers Tariffe di lancio, capacità per sviluppatori e integrazioni della Live API. Apri fonte](https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/)