# Gemma 4 12B in locale: guida a Ollama e hardware > Fonte: https://francescogruner.it/gemma-4-12b-ai-locale/ **Gemma 4 12B è il modello “di mezzo” della famiglia Gemma 4 per chi vuole lavorare in locale su un laptop:** accetta testo, immagini e audio, genera testo, usa un’architettura unificata senza encoder multimodali separati e offre una finestra di contesto da 256K token. Google lo distribuisce con licenza Apache 2.0 e lo indica per laptop, desktop e piccoli server. **Risposta breve:** se vuoi provare Gemma 4 12B in locale con il percorso più semplice, installa Ollama e avvia `ollama run gemma4:12b`. Il tag è pubblicato nella libreria ufficiale Ollama. Prima del download controlla però lo spazio del file e la memoria disponibile: il fabbisogno reale cambia con runtime, precisione, contesto e altri processi. Questa guida non presenta benchmark o test hardware proprietari. Indice dei contenuti [Toggle](#) - [Cos’è Gemma 4 12B e perché è diverso](#Cose_Gemma_4_12B_e_perche_e_diverso) - [Gemma 4: quale variante scegliere](#Gemma_4_quale_variante_scegliere) - [Ti sta piacendo?](#Ti_sta_piacendo) - [Come eseguire Gemma 4 12B con Ollama](#Come_eseguire_Gemma_4_12B_con_Ollama) - [RAM, VRAM e quantizzazione: cosa è verificato](#RAM_VRAM_e_quantizzazione_cosa_e_verificato) - [Cosa testare prima di usarlo davvero](#Cosa_testare_prima_di_usarlo_davvero) - [Domande frequenti e fonti](#Domande_frequenti_e_fonti) - [Fonti ufficiali verificate](#Fonti_ufficiali_verificate) ## Cos’è Gemma 4 12B e perché è diverso Gemma 4 12B Unified è stato aggiunto alla famiglia il 3 giugno 2026. È un modello denso da circa 12 miliardi di parametri e usa un singolo transformer decoder-only: immagini e audio vengono proiettati direttamente nello spazio del modello invece di passare da encoder multimodali separati. Il risultato pratico non è “un modello che fa tutto”, ma un’unica base per tre tipi di input. Puoi usarlo per chat e riassunti, analisi di immagini, OCR, trascrizione e traduzione del parlato. L’output resta testuale. Google documenta inoltre function calling, system prompt e modalità di reasoning configurabile. ## Gemma 4: quale variante scegliere **Variante**E2B**Input documentati**Testo, immagini, audio**Contesto**128K**Target indicato da Google**Mobile ed edge**Quando considerarla**Quando la priorità è il deployment su dispositivo**Variante**E4B**Input documentati**Testo, immagini, audio**Contesto**128K**Target indicato da Google**Mobile e laptop**Quando considerarla**Per un modello edge più capace**Variante**12B Unified**Input documentati**Testo, immagini, audio**Contesto**256K**Target indicato da Google**Laptop, desktop e piccoli server**Quando considerarla**Per audio nativo e architettura unificata su hardware locale**Variante**26B A4B**Input documentati**Testo e immagini**Contesto**256K**Target indicato da Google**Desktop e piccoli server**Quando considerarla**Per il modello MoE; tutti i pesi devono comunque essere caricati**Variante**31B Dense**Input documentati**Testo e immagini**Contesto**256K**Target indicato da Google**Server o cluster**Quando considerarla**Per la variante densa più grande della famiglia Questa tabella usa solo proprietà dichiarate nella model card Google. Non trasforma i parametri in una promessa di velocità o qualità sul tuo computer. Per i dispositivi più piccoli, leggi anche la mia guida a [Gemma 3n in locale](https://francescogruner.it/come-usare-gemma-3n-in-locale-lai-multimodale-di-google-per-testo-audio-e-immagini/): è una generazione diversa e non va confusa con Gemma 4. ## Ti sta piacendo? Ricevi una guida pratica ogni settimana. AI, tool e automazioni. Iscriviti gratis Perfetto, sei dentro. ## Come eseguire Gemma 4 12B con Ollama Ollama è il percorso più diretto perché gestisce download, formato e chat template. Installa il runtime dalla pagina ufficiale, poi verifica che il comando sia disponibile. ``` ollama --version ollama pull gemma4:12b ollama run gemma4:12b ``` Il comando esplicito `ollama run gemma4:12b` è pubblicato nella pagina ufficiale Ollama dedicata al tag 12B. Per controllare cosa hai installato usa `ollama list`. Se vuoi inviare testo via API locale, Ollama espone il servizio sulla macchina; parti dalla documentazione ufficiale prima di collegarlo a un’app. Se stai valutando anche un servizio remoto, la mia [guida a Ollama Cloud](https://francescogruner.it/guida-ollama-cloud-ai-senza-gpu/) copre un intento diverso: lì l’inferenza non resta sul tuo hardware. ## RAM, VRAM e quantizzazione: cosa è verificato La documentazione tecnica Google stima, per il solo caricamento dei pesi con il 20% di overhead, 26,7 GB in BF16, 13,4 GB in SFP8 e 6,7 GB in Q4_0. Non sono numeri intercambiabili. La tabella tecnica esclude memoria aggiuntiva per software e context window; il KV cache cresce con prompt e risposta. Per questo non prometto che una configurazione specifica “entra” né suggerisco una quantizzazione come scelta universale. Controlla il formato distribuito dal runtime, riduci il contesto se necessario e misura sulla macchina reale. ## Cosa testare prima di usarlo davvero - **Italiano:** prepara prompt rappresentativi del tuo lavoro e valuta accuratezza, tono e formati. - **Multimodalità:** separa test di testo, immagine e audio; non dedurre il supporto del client dal supporto del modello. - **Contesto:** aumenta la lunghezza gradualmente e osserva memoria e stabilità. - **Tool calling:** valida schema e gestione degli errori prima di affidargli azioni. - **Privacy:** conferma che modello, interfaccia e integrazioni usate restino locali; “modello locale” non rende automaticamente locale l’intera pipeline. Per la panoramica generale della generazione, mantengo separato l’articolo [Gemma 4: famiglia, architetture e scenari locali](https://francescogruner.it/gemma-4-ai-open-source-locale/). Questa pagina resta invece il riferimento operativo sul 12B, così le due URL non devono competere sullo stesso intento. ## Domande frequenti e fonti Gemma 4 12B è open source? È più preciso definirlo un modello open-weight. La model card ufficiale indica licenza Apache 2.0 e disponibilità dei pesi in varianti pre-trained e instruction-tuned. Qual è il comando Ollama per Gemma 4 12B? Il tag esplicito pubblicato da Ollama è `ollama run gemma4:12b`. Gemma 4 12B accetta audio? Sì. Google documenta input di testo, immagini e audio per E2B, E4B e 12B; l’output è testuale. Il supporto concreto dipende anche dal runtime o client usato. Quale variante Gemma 4 scegliere per uso locale? E2B ed E4B sono orientati a mobile ed edge; 12B a laptop e piccoli server; 26B A4B e 31B a sistemi più grandi. La scelta finale richiede un test sul proprio task e hardware. ### Fonti ufficiali verificate [Google AI - panoramica Gemma 4, varianti, memoria e QAT](https://ai.google.dev/gemma/docs/core)[Google DeepMind - model card Gemma 4](https://ai.google.dev/gemma/docs/core/model_card_4)[Google AI - cronologia release Gemma](https://ai.google.dev/gemma/docs/releases)[Google AI - integrazione ufficiale con Ollama](https://ai.google.dev/gemma/docs/integrations/ollama)[Ollama - comando e tag Gemma 4 12B](https://ollama.com/library/gemma4:12b)