# Ollama Cloud: guida, prezzi, privacy e limiti > Fonte: https://francescogruner.it/guida-ollama-cloud-ai-senza-gpu/ **Ollama Cloud è il servizio cloud ufficiale di Ollama**: permette di usare modelli grandi senza eseguirli sulla GPU del proprio computer. Con un modello che termina in `:cloud`, il client locale inoltra la richiesta al servizio di Ollama; in alternativa puoi chiamare direttamente `https://ollama.com/api` con una API key. **Risposta breve:** scegli Ollama Cloud se vuoi mantenere CLI e API di Ollama ma non hai hardware sufficiente. Scegli Ollama locale se prompt, risposte e pesi devono restare sulla tua macchina. Installare Ollama su una VM cloud è una terza opzione: la VM, la GPU, la sicurezza e i costi sono gestiti da te, non dal servizio Ollama Cloud. Indice dei contenuti [Toggle](#) - [Ollama Cloud, Ollama locale e Ollama su VM: le differenze](#Ollama_Cloud_Ollama_locale_e_Ollama_su_VM_le_differenze) - [Come usare i modelli con tag :cloud](#Come_usare_i_modelli_con_tag_cloud) - [Ti sta piacendo?](#Ti_sta_piacendo) - [Accesso diretto via API](#Accesso_diretto_via_API) - [Piani, prezzi e limiti](#Piani_prezzi_e_limiti) - [Privacy e traffico di rete](#Privacy_e_traffico_di_rete) - [Troubleshooting: gli errori più comuni](#Troubleshooting_gli_errori_piu_comuni) - [Quando scegliere Cloud o locale](#Quando_scegliere_Cloud_o_locale) - [Domande frequenti e fonti](#Domande_frequenti_e_fonti) - [Fonti ufficiali verificate il 28 agosto 2026](#Fonti_ufficiali_verificate_il_28_agosto_2026) ## Ollama Cloud, Ollama locale e Ollama su VM: le differenze **Voce**Dove gira il modello**Ollama Cloud ufficiale**Infrastruttura gestita da Ollama e partner**Ollama locale**Sul tuo computer o server**Ollama su VM cloud**Sulla VM che configuri**Voce**GPU personale**Ollama Cloud ufficiale**Non necessaria**Ollama locale**Utile o necessaria per modelli grandi**Ollama su VM cloud**Fornita dal provider della VM**Voce**Accesso**Ollama Cloud ufficiale**Account e tag `:cloud`, oppure API key**Ollama locale**API locale su `127.0.0.1:11434`**Ollama su VM cloud**Endpoint e autenticazione decisi da te**Voce**Limiti**Ollama Cloud ufficiale**Dipendono dal piano e dal modello**Ollama locale**Inferenza locale illimitata; limite pratico dell’hardware**Ollama su VM cloud**Risorse e budget della VM**Voce**Rete durante l’inferenza**Ollama Cloud ufficiale**Sì**Ollama locale**No, se disattivi le funzioni cloud e non usi servizi esterni**Ollama su VM cloud**Sì tra client e VM**Voce**Gestione e sicurezza**Ollama Cloud ufficiale**Ollama gestisce il servizio**Ollama locale**Le gestisci tu**Ollama su VM cloud**Le gestisci tu, inclusa l’esposizione di porta 11434 Questa distinzione evita l’equivoco più comune: “Ollama nel cloud” può indicare il prodotto ufficiale oppure una normale installazione self-hosted su AWS, Azure, Google Cloud, RunPod o altri provider. Non sono la stessa cosa. ## Come usare i modelli con tag :cloud Alla verifica del **28 agosto 2026**, la documentazione ufficiale richiede un account Ollama. Accedi dal terminale e avvia un modello presente nella libreria Cloud: ``` ollama signin ollama run gpt-oss:120b-cloud ``` Il suffisso `:cloud` segnala che l’inferenza viene trasferita al servizio Cloud. Il client e l’endpoint locale restano familiari, ma il calcolo non avviene sulla tua GPU. La lista cambia nel tempo: controlla sempre la [libreria ufficiale dei modelli Cloud](https://ollama.com/search?c=cloud), anche perché Ollama può ritirare modelli cloud senza toccare le corrispondenti versioni locali. ## Ti sta piacendo? Ricevi una guida pratica ogni settimana. AI, tool e automazioni. Iscriviti gratis Perfetto, sei dentro. ## Accesso diretto via API Puoi evitare il passaggio dal daemon locale e usare Ollama come host remoto. Crea una API key nelle impostazioni e non inserirla mai nel codice o in un repository. ``` export OLLAMA_API_KEY=your_api_key curl https://ollama.com/api/chat \ -H "Authorization: Bearer $OLLAMA_API_KEY" \ -d '{"model":"gpt-oss:120b","messages":[{"role":"user","content":"Ciao"}],"stream":false}' ``` Nota la differenza indicata dalla documentazione: nel flusso tramite client locale si usa il tag `:cloud`; nell’accesso diretto all’host `ollama.com` l’esempio ufficiale usa il nome senza suffisso. Per vedere ciò che l’API rende disponibile, interroga `https://ollama.com/api/tags`. ## Piani, prezzi e limiti **Dati verificati il 28 agosto 2026:** Free include accesso cloud leggero e una sola esecuzione concorrente. Pro costa **20 dollari al mese** o **200 dollari l’anno**, include 50 volte l’uso cloud di Free e fino a tre modelli concorrenti. Max costa **100 dollari al mese**, offre cinque volte l’uso di Pro e dieci modelli concorrenti, ma le nuove iscrizioni risultano sospese. Team è annunciato a **25 dollari per postazione al mese**, minimo cinque postazioni, ed è in waitlist. Ollama non pubblica un tetto unico in token per i piani individuali: il consumo dipende dal modello e dai token di input, cache e output. Esistono limiti di sessione che si azzerano ogni cinque ore e limiti settimanali che si azzerano ogni sette giorni. Le richieste oltre la concorrenza inclusa vengono messe in coda finché c’è spazio; una coda piena può rifiutarle. Per questo non trasformerei “50x” in un numero di prompt o token senza leggere il contatore del tuo account. ## Privacy e traffico di rete Con Ollama Cloud, prompt e risposte attraversano la rete e vengono elaborati su infrastruttura remota. Ollama dichiara che prompt e risposte non vengono registrati né usati per addestramento; dichiara inoltre di imporre ai partner no logging, no training e zero data retention. I modelli sono ospitati principalmente negli Stati Uniti, con possibile instradamento in Europa e Singapore. Se hai vincoli aziendali, verifica piano, area, DPA e requisiti interni prima di inviare dati riservati. Per un ambiente esclusivamente locale, imposta `disable_ollama_cloud` a `true` in `~/.ollama/server.json` oppure usa `OLLAMA_NO_CLOUD=1`, poi riavvia Ollama. Nei log deve comparire `Ollama cloud disabled: true`. Questa scelta disattiva anche i modelli Cloud e la ricerca web. Se vuoi confrontare il flusso con un test davvero locale, leggi la mia [prova di OpenUI con Ollama](https://francescogruner.it/openui-ollama-generare-interfacce-ui-localmente/). Per collegare strumenti di coding trovi anche la guida a [Claude Code con Ollama e API locali](https://francescogruner.it/claude-code-ollama/) e la panoramica dell’[app desktop di Ollama](https://francescogruner.it/ollama-con-ui-la-nuova-app-desktop-per-gestire-llm-in-locale/). ## Troubleshooting: gli errori più comuni - **401 o richiesta non autorizzata:** nel flusso CLI esegui di nuovo `ollama signin`; nell’API diretta controlla che l’header sia `Authorization: Bearer $OLLAMA_API_KEY`. - **Modello non trovato:** verifica nome e disponibilità nella libreria Cloud o con `curl https://ollama.com/api/tags`. Un modello ritirato può richiedere un’alternativa. - **Il modello gira in locale:** controlla che il nome includa davvero `:cloud` quando usi il daemon locale. - **Il Cloud non parte:** verifica che `OLLAMA_NO_CLOUD` non sia impostata e che `disable_ollama_cloud` non sia attivo; poi riavvia Ollama. - **Richiesta in coda o rifiutata:** potresti aver raggiunto la concorrenza del piano o una coda piena. Controlla la pagina Usage dell’account. - **Proxy o rete aziendale:** Ollama usa `HTTPS_PROXY` per il traffico in uscita; installa il certificato del proxy nel sistema se necessario. ## Quando scegliere Cloud o locale Sceglierei Ollama Cloud per provare modelli che non entrano nella RAM o VRAM disponibile, per usare la stessa API da più macchine o per evitare la gestione di una GPU. Resterei in locale per dati che non devono uscire dall’ambiente, funzionamento offline, costi hardware già ammortizzati o controllo completo della versione del modello. Non pubblico stime di latenza, token al secondo o costo per task: senza un test ripetibile sulla tua rete, sul modello e sul piano attuale sarebbero numeri fuorvianti. ## Domande frequenti e fonti Ollama Cloud è ufficiale?Sì. È il servizio gestito da Ollama. Non va confuso con Ollama installato autonomamente su una VM di un altro provider.Il tag :cloud scarica il modello sul computer?No: indica al client che l’inferenza viene trasferita al servizio Ollama Cloud, mantenendo il flusso CLI/API locale.Ollama Cloud è gratis?Esiste un piano Free per uso leggero. Al 28 agosto 2026 Pro costa 20 dollari al mese; disponibilità, prezzi e limiti possono cambiare.I prompt vengono usati per addestrare i modelli?Ollama dichiara che prompt e risposte non vengono registrati né usati per addestramento e che i partner applicano zero data retention. Per dati aziendali resta necessario verificare i requisiti contrattuali e territoriali.Come forzo Ollama a funzionare solo in locale?Imposta `disable_ollama_cloud: true` nel file server.json oppure `OLLAMA_NO_CLOUD=1`, riavvia e controlla il messaggio nei log. ### Fonti ufficiali verificate il 28 agosto 2026 [Documentazione Ollama Cloud - tag, autenticazione, API e modelli ritirati](https://docs.ollama.com/cloud)[Pricing ufficiale - piani, limiti, privacy e hosting](https://ollama.com/pricing)[Libreria ufficiale - modelli Cloud disponibili](https://ollama.com/search?c=cloud)[FAQ ufficiale - modalità solo locale e rete](https://docs.ollama.com/faq#how-do-i-disable-ollama-cloud-features)[API ufficiale - endpoint locale e remoto](https://docs.ollama.com/api)