Vai al contenuto

Ollama Cloud: guida, prezzi, privacy e limiti

Come funziona Ollama Cloud, differenze con Ollama locale e su VM, tag :cloud, piani, privacy, rete, API ed errori comuni.

Ollama Cloud è il servizio cloud ufficiale di Ollama: permette di usare modelli grandi senza eseguirli sulla GPU del proprio computer. Con un modello che termina in :cloud, il client locale inoltra la richiesta al servizio di Ollama; in alternativa puoi chiamare direttamente https://ollama.com/api con una API key.

Risposta breve: scegli Ollama Cloud se vuoi mantenere CLI e API di Ollama ma non hai hardware sufficiente. Scegli Ollama locale se prompt, risposte e pesi devono restare sulla tua macchina. Installare Ollama su una VM cloud è una terza opzione: la VM, la GPU, la sicurezza e i costi sono gestiti da te, non dal servizio Ollama Cloud.

Ollama Cloud, Ollama locale e Ollama su VM: le differenze

Voce
Dove gira il modello
Ollama Cloud ufficiale
Infrastruttura gestita da Ollama e partner
Ollama locale
Sul tuo computer o server
Ollama su VM cloud
Sulla VM che configuri
Voce
GPU personale
Ollama Cloud ufficiale
Non necessaria
Ollama locale
Utile o necessaria per modelli grandi
Ollama su VM cloud
Fornita dal provider della VM
Voce
Accesso
Ollama Cloud ufficiale
Account e tag :cloud, oppure API key
Ollama locale
API locale su 127.0.0.1:11434
Ollama su VM cloud
Endpoint e autenticazione decisi da te
Voce
Limiti
Ollama Cloud ufficiale
Dipendono dal piano e dal modello
Ollama locale
Inferenza locale illimitata; limite pratico dell’hardware
Ollama su VM cloud
Risorse e budget della VM
Voce
Rete durante l’inferenza
Ollama Cloud ufficiale
Sì
Ollama locale
No, se disattivi le funzioni cloud e non usi servizi esterni
Ollama su VM cloud
Sì tra client e VM
Voce
Gestione e sicurezza
Ollama Cloud ufficiale
Ollama gestisce il servizio
Ollama locale
Le gestisci tu
Ollama su VM cloud
Le gestisci tu, inclusa l’esposizione di porta 11434

Questa distinzione evita l’equivoco più comune: “Ollama nel cloud” può indicare il prodotto ufficiale oppure una normale installazione self-hosted su AWS, Azure, Google Cloud, RunPod o altri provider. Non sono la stessa cosa.

Come usare i modelli con tag :cloud

Alla verifica del 28 agosto 2026, la documentazione ufficiale richiede un account Ollama. Accedi dal terminale e avvia un modello presente nella libreria Cloud:

ollama signin
ollama run gpt-oss:120b-cloud

Il suffisso :cloud segnala che l’inferenza viene trasferita al servizio Cloud. Il client e l’endpoint locale restano familiari, ma il calcolo non avviene sulla tua GPU. La lista cambia nel tempo: controlla sempre la libreria ufficiale dei modelli Cloud, anche perché Ollama può ritirare modelli cloud senza toccare le corrispondenti versioni locali.

Ti sta piacendo?

Ricevi una guida pratica ogni settimana. AI, tool e automazioni.

Accesso diretto via API

Puoi evitare il passaggio dal daemon locale e usare Ollama come host remoto. Crea una API key nelle impostazioni e non inserirla mai nel codice o in un repository.

export OLLAMA_API_KEY=your_api_key
curl https://ollama.com/api/chat \
  -H "Authorization: Bearer $OLLAMA_API_KEY" \
  -d '{"model":"gpt-oss:120b","messages":[{"role":"user","content":"Ciao"}],"stream":false}'

Nota la differenza indicata dalla documentazione: nel flusso tramite client locale si usa il tag :cloud; nell’accesso diretto all’host ollama.com l’esempio ufficiale usa il nome senza suffisso. Per vedere ciò che l’API rende disponibile, interroga https://ollama.com/api/tags.

Piani, prezzi e limiti

Dati verificati il 28 agosto 2026: Free include accesso cloud leggero e una sola esecuzione concorrente. Pro costa 20 dollari al mese o 200 dollari l’anno, include 50 volte l’uso cloud di Free e fino a tre modelli concorrenti. Max costa 100 dollari al mese, offre cinque volte l’uso di Pro e dieci modelli concorrenti, ma le nuove iscrizioni risultano sospese. Team è annunciato a 25 dollari per postazione al mese, minimo cinque postazioni, ed è in waitlist.

Ollama non pubblica un tetto unico in token per i piani individuali: il consumo dipende dal modello e dai token di input, cache e output. Esistono limiti di sessione che si azzerano ogni cinque ore e limiti settimanali che si azzerano ogni sette giorni. Le richieste oltre la concorrenza inclusa vengono messe in coda finché c’è spazio; una coda piena può rifiutarle. Per questo non trasformerei “50x” in un numero di prompt o token senza leggere il contatore del tuo account.

Privacy e traffico di rete

Con Ollama Cloud, prompt e risposte attraversano la rete e vengono elaborati su infrastruttura remota. Ollama dichiara che prompt e risposte non vengono registrati né usati per addestramento; dichiara inoltre di imporre ai partner no logging, no training e zero data retention. I modelli sono ospitati principalmente negli Stati Uniti, con possibile instradamento in Europa e Singapore. Se hai vincoli aziendali, verifica piano, area, DPA e requisiti interni prima di inviare dati riservati.

Per un ambiente esclusivamente locale, imposta disable_ollama_cloud a true in ~/.ollama/server.json oppure usa OLLAMA_NO_CLOUD=1, poi riavvia Ollama. Nei log deve comparire Ollama cloud disabled: true. Questa scelta disattiva anche i modelli Cloud e la ricerca web.

Se vuoi confrontare il flusso con un test davvero locale, leggi la mia prova di OpenUI con Ollama. Per collegare strumenti di coding trovi anche la guida a Claude Code con Ollama e API locali e la panoramica dell’app desktop di Ollama.

Troubleshooting: gli errori più comuni

  • 401 o richiesta non autorizzata: nel flusso CLI esegui di nuovo ollama signin; nell’API diretta controlla che l’header sia Authorization: Bearer $OLLAMA_API_KEY.
  • Modello non trovato: verifica nome e disponibilità nella libreria Cloud o con curl https://ollama.com/api/tags. Un modello ritirato può richiedere un’alternativa.
  • Il modello gira in locale: controlla che il nome includa davvero :cloud quando usi il daemon locale.
  • Il Cloud non parte: verifica che OLLAMA_NO_CLOUD non sia impostata e che disable_ollama_cloud non sia attivo; poi riavvia Ollama.
  • Richiesta in coda o rifiutata: potresti aver raggiunto la concorrenza del piano o una coda piena. Controlla la pagina Usage dell’account.
  • Proxy o rete aziendale: Ollama usa HTTPS_PROXY per il traffico in uscita; installa il certificato del proxy nel sistema se necessario.

Quando scegliere Cloud o locale

Sceglierei Ollama Cloud per provare modelli che non entrano nella RAM o VRAM disponibile, per usare la stessa API da più macchine o per evitare la gestione di una GPU. Resterei in locale per dati che non devono uscire dall’ambiente, funzionamento offline, costi hardware già ammortizzati o controllo completo della versione del modello. Non pubblico stime di latenza, token al secondo o costo per task: senza un test ripetibile sulla tua rete, sul modello e sul piano attuale sarebbero numeri fuorvianti.

Domande frequenti e fonti

Ollama Cloud è ufficiale?
Sì. È il servizio gestito da Ollama. Non va confuso con Ollama installato autonomamente su una VM di un altro provider.
Il tag :cloud scarica il modello sul computer?
No: indica al client che l’inferenza viene trasferita al servizio Ollama Cloud, mantenendo il flusso CLI/API locale.
Ollama Cloud è gratis?
Esiste un piano Free per uso leggero. Al 28 agosto 2026 Pro costa 20 dollari al mese; disponibilità, prezzi e limiti possono cambiare.
I prompt vengono usati per addestrare i modelli?
Ollama dichiara che prompt e risposte non vengono registrati né usati per addestramento e che i partner applicano zero data retention. Per dati aziendali resta necessario verificare i requisiti contrattuali e territoriali.
Come forzo Ollama a funzionare solo in locale?
Imposta disable_ollama_cloud: true nel file server.json oppure OLLAMA_NO_CLOUD=1, riavvia e controlla il messaggio nei log.

Fonti ufficiali verificate il 28 agosto 2026

Nuovo su Google

Aggiungi francescogruner.it come fonte preferita

Se leggi spesso i miei articoli su AI, automazione e tecnologia, ora puoi dire a Google che vuoi vedere più spesso i contenuti di francescogruner.it tra le notizie.

Francesco Gruner
Francesco Gruner

Sono un consulente IT, divulgatore e imprenditore tech. Mi occupo di automazione, AI e gestione di sistemi e infrastrutture IT, cercando soluzioni semplici a problemi complessi. Qui condivido strumenti, esperimenti e idee utili.

Chiedi al sito.

Assistente OpenAI

Le domande vengono inviate a OpenAI. Non inserire dati personali o riservati. Privacy.

Verifica le risposte nelle fonti. 16 messaggi al giorno per rete.

Cosa cerchi? Ti indico le pagine utili.