Ollama Cloud è il servizio cloud ufficiale di Ollama: permette di usare modelli grandi senza eseguirli sulla GPU del proprio computer. Con un modello che termina in :cloud, il client locale inoltra la richiesta al servizio di Ollama; in alternativa puoi chiamare direttamente https://ollama.com/api con una API key.
Ollama Cloud, Ollama locale e Ollama su VM: le differenze
:cloud, oppure API key127.0.0.1:11434Questa distinzione evita l’equivoco più comune: “Ollama nel cloud” può indicare il prodotto ufficiale oppure una normale installazione self-hosted su AWS, Azure, Google Cloud, RunPod o altri provider. Non sono la stessa cosa.
Come usare i modelli con tag :cloud
Alla verifica del 28 agosto 2026, la documentazione ufficiale richiede un account Ollama. Accedi dal terminale e avvia un modello presente nella libreria Cloud:
ollama signin
ollama run gpt-oss:120b-cloud
Il suffisso :cloud segnala che l’inferenza viene trasferita al servizio Cloud. Il client e l’endpoint locale restano familiari, ma il calcolo non avviene sulla tua GPU. La lista cambia nel tempo: controlla sempre la libreria ufficiale dei modelli Cloud, anche perché Ollama può ritirare modelli cloud senza toccare le corrispondenti versioni locali.
Ti sta piacendo?
Ricevi una guida pratica ogni settimana. AI, tool e automazioni.
Accesso diretto via API
Puoi evitare il passaggio dal daemon locale e usare Ollama come host remoto. Crea una API key nelle impostazioni e non inserirla mai nel codice o in un repository.
export OLLAMA_API_KEY=your_api_key
curl https://ollama.com/api/chat \
-H "Authorization: Bearer $OLLAMA_API_KEY" \
-d '{"model":"gpt-oss:120b","messages":[{"role":"user","content":"Ciao"}],"stream":false}'
Nota la differenza indicata dalla documentazione: nel flusso tramite client locale si usa il tag :cloud; nell’accesso diretto all’host ollama.com l’esempio ufficiale usa il nome senza suffisso. Per vedere ciò che l’API rende disponibile, interroga https://ollama.com/api/tags.
Piani, prezzi e limiti
Dati verificati il 28 agosto 2026: Free include accesso cloud leggero e una sola esecuzione concorrente. Pro costa 20 dollari al mese o 200 dollari l’anno, include 50 volte l’uso cloud di Free e fino a tre modelli concorrenti. Max costa 100 dollari al mese, offre cinque volte l’uso di Pro e dieci modelli concorrenti, ma le nuove iscrizioni risultano sospese. Team è annunciato a 25 dollari per postazione al mese, minimo cinque postazioni, ed è in waitlist.
Ollama non pubblica un tetto unico in token per i piani individuali: il consumo dipende dal modello e dai token di input, cache e output. Esistono limiti di sessione che si azzerano ogni cinque ore e limiti settimanali che si azzerano ogni sette giorni. Le richieste oltre la concorrenza inclusa vengono messe in coda finché c’è spazio; una coda piena può rifiutarle. Per questo non trasformerei “50x” in un numero di prompt o token senza leggere il contatore del tuo account.
Privacy e traffico di rete
Con Ollama Cloud, prompt e risposte attraversano la rete e vengono elaborati su infrastruttura remota. Ollama dichiara che prompt e risposte non vengono registrati né usati per addestramento; dichiara inoltre di imporre ai partner no logging, no training e zero data retention. I modelli sono ospitati principalmente negli Stati Uniti, con possibile instradamento in Europa e Singapore. Se hai vincoli aziendali, verifica piano, area, DPA e requisiti interni prima di inviare dati riservati.
Per un ambiente esclusivamente locale, imposta disable_ollama_cloud a true in ~/.ollama/server.json oppure usa OLLAMA_NO_CLOUD=1, poi riavvia Ollama. Nei log deve comparire Ollama cloud disabled: true. Questa scelta disattiva anche i modelli Cloud e la ricerca web.
Se vuoi confrontare il flusso con un test davvero locale, leggi la mia prova di OpenUI con Ollama. Per collegare strumenti di coding trovi anche la guida a Claude Code con Ollama e API locali e la panoramica dell’app desktop di Ollama.
Troubleshooting: gli errori più comuni
- 401 o richiesta non autorizzata: nel flusso CLI esegui di nuovo
ollama signin; nell’API diretta controlla che l’header siaAuthorization: Bearer $OLLAMA_API_KEY. - Modello non trovato: verifica nome e disponibilità nella libreria Cloud o con
curl https://ollama.com/api/tags. Un modello ritirato può richiedere un’alternativa. - Il modello gira in locale: controlla che il nome includa davvero
:cloudquando usi il daemon locale. - Il Cloud non parte: verifica che
OLLAMA_NO_CLOUDnon sia impostata e chedisable_ollama_cloudnon sia attivo; poi riavvia Ollama. - Richiesta in coda o rifiutata: potresti aver raggiunto la concorrenza del piano o una coda piena. Controlla la pagina Usage dell’account.
- Proxy o rete aziendale: Ollama usa
HTTPS_PROXYper il traffico in uscita; installa il certificato del proxy nel sistema se necessario.
Quando scegliere Cloud o locale
Sceglierei Ollama Cloud per provare modelli che non entrano nella RAM o VRAM disponibile, per usare la stessa API da più macchine o per evitare la gestione di una GPU. Resterei in locale per dati che non devono uscire dall’ambiente, funzionamento offline, costi hardware già ammortizzati o controllo completo della versione del modello. Non pubblico stime di latenza, token al secondo o costo per task: senza un test ripetibile sulla tua rete, sul modello e sul piano attuale sarebbero numeri fuorvianti.
Domande frequenti e fonti
Ollama Cloud è ufficiale?
Il tag :cloud scarica il modello sul computer?
Ollama Cloud è gratis?
I prompt vengono usati per addestrare i modelli?
Come forzo Ollama a funzionare solo in locale?
disable_ollama_cloud: true nel file server.json oppure OLLAMA_NO_CLOUD=1, riavvia e controlla il messaggio nei log.









