Guadagniamo delle commissioni quando acquisti tramite i link qui sotto, senza alcun costo aggiuntivo per te.
Questa guida fa parte dei nostri contenuti sul self hosting: se l’argomento ti interessa, guarda anche come installare n8n self hosted per le automazioni AI e, per il tempo libero, come creare un server Minecraft su VPS.
Ollama è il modo più semplice per far girare modelli di intelligenza artificiale (come Llama, DeepSeek, Qwen o Mistral) sul tuo computer o su un server, senza dipendere da servizi esterni. Installarlo su una VPS ti permette di avere il tuo ChatGPT privato, accessibile 24 ore su 24 da qualsiasi dispositivo, senza limiti di messaggi e con i dati che restano tuoi. In questa guida vedrai cos’è Ollama, quanta RAM serve per ogni modello, quali sono le migliori VPS per farlo girare e come installarlo passo passo, con tanto di interfaccia web.

Cos’è Ollama
Ollama è uno strumento gratuito e open source che permette di scaricare ed eseguire modelli linguistici di grandi dimensioni (LLM) con un solo comando. Funziona un po’ come “Docker per l’AI”: gestisce il download del modello, la configurazione e l’esecuzione, così puoi chattare con un’AI direttamente dal terminale o tramite un’interfaccia web. Supporta i modelli open più diffusi, tra cui Llama di Meta, DeepSeek, Qwen, Mistral, Gemma e Phi.
Il vantaggio principale è che tutto gira sul tuo hardware: nessun dato viene inviato a servizi esterni. Ollama funziona su Windows, macOS e Linux, ma è proprio su una VPS Linux che dà il meglio quando vuoi un servizio sempre attivo.
Perché installare Ollama su una VPS
Installare Ollama in locale va bene per fare qualche prova, ma una VPS offre vantaggi concreti:
- Privacy totale: i tuoi prompt e i tuoi dati restano sul tuo server.
- Nessun limite: niente tetti di messaggi o abbonamenti mensili per l’uso.
- Sempre acceso: il servizio resta attivo 24/7, utile se vuoi usarlo come API per app o automazioni.
- Accesso da ovunque: usi la tua AI da PC, tablet o smartphone, senza occupare le risorse del tuo computer.
- Costi prevedibili: paghi una cifra fissa per la VPS, invece di consumi variabili.
Quanta RAM serve per Ollama? Requisiti per modello
Il requisito più importante per Ollama è la memoria. Ollama può girare anche solo su CPU (senza scheda video), ma serve RAM sufficiente a caricare il modello; con una GPU le risposte sono molto più veloci. Come regola generale, con la quantizzazione standard (Q4) valgono questi valori:
In pratica: per iniziare bene con modelli da 7-8B, punta ad almeno 8 GB di RAM; se vuoi modelli più grandi o risposte più veloci, ti serve più memoria o una GPU.
Le migliori VPS per far girare Ollama
La scelta della VPS dipende dal modello che vuoi usare e dal budget. Ecco le opzioni più adatte, dalla più economica su CPU alla GPU a consumo. I prezzi sono indicativi: verifica sempre l’offerta aggiornata sul sito ufficiale.

In sintesi: se vuoi spendere poco e usare modelli da 7-14B su CPU, Contabo offre tanta RAM al prezzo più basso; se cerchi la migliore CPU e affidabilità, scegli Hetzner; se ti servono modelli grandi o la massima velocità, la GPU a consumo di Runpod è la soluzione più flessibile.
Come installare Ollama su una VPS: guida passo passo

Una volta attivata la VPS (con Ubuntu, ad esempio), l’installazione richiede pochi minuti. Ecco i passaggi principali.
1. Connettiti alla VPS via SSH
ssh root@IP_DEL_TUO_SERVER
2. Installa Ollama con un comando
curl -fsSL https://ollama.com/install.sh | sh
3. Scarica ed esegui un modello (ad esempio Llama 3.1 8B)
ollama run llama3.1
Al primo avvio Ollama scarica il modello, poi ti mostra un prompt in cui puoi iniziare a chattare direttamente dal terminale. Con ollama list vedi i modelli installati e con ollama pull nome-modello ne scarichi altri.
4. (Opzionale) Rendi Ollama raggiungibile dall’esterno. Per usarlo come API o da altre app, imposta la variabile OLLAMA_HOST e apri la porta 11434 nel firewall, facendo attenzione a proteggerla (ad esempio dietro una VPN o con autenticazione).
Aggiungere un’interfaccia web: il tuo ChatGPT privato
Chattare dal terminale è comodo per le prove, ma per un uso quotidiano conviene un’interfaccia grafica. La più usata è Open WebUI, che ti dà un’esperienza simile a ChatGPT nel browser. Il modo più semplice per installarla è con Docker:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data --name open-webui \
ghcr.io/open-webui/open-webui:main
Dopo qualche istante potrai aprire l’interfaccia dal browser all’indirizzo del tuo server sulla porta 3000, creare un account e chattare con i tuoi modelli come faresti con ChatGPT, ma in totale privacy.
Quali modelli usare con Ollama
La scelta del modello dipende da RAM e obiettivo. Alcuni consigli pratici:
- Uso generale leggero: Llama 3.2 3B o Phi-3 mini (girano anche con 8 GB).
- Assistente completo: Llama 3.1 8B o Qwen 2.5 7B, ottimo equilibrio qualità/risorse.
- Programmazione: Qwen 2.5 Coder o modelli specializzati nel codice.
- Ragionamento avanzato: le versioni distillate di DeepSeek, se hai abbastanza memoria.
Puoi installarne più di uno e passare dall’uno all’altro a seconda del compito.
Quanto costa far girare un LLM su VPS
Ollama è gratuito: l’unico costo è la VPS. Per i modelli da 7-8B su CPU bastano piani da circa 5 € al mese; per modelli più grandi o per la velocità di una GPU si sale, con la GPU a consumo che si paga a ore. Rispetto agli abbonamenti dei servizi AI, se usi molto l’AI o ti serve un’API sempre attiva, il self-hosting può costare meno e ti dà il pieno controllo dei dati.
Alternative: quando conviene il cloud
Il self-hosting con Ollama non è sempre la scelta migliore. Se ti servono i modelli più potenti in assoluto senza pensare all’hardware, i servizi cloud con API (come quelli di OpenAI o Anthropic) restano più semplici e potenti. Se invece vuoi solo generare contenuti, potrebbero interessarti strumenti dedicati come Suno per la musica o PixVerse per i video. Per una panoramica più ampia trovi i migliori strumenti per l’imprenditore online.
Ollama su Windows, Mac o PC locale: quando ha senso
Sì, Ollama si installa anche in locale: su Windows e Mac scarichi l’installer dal sito ufficiale, lo avvii e da terminale lanci ollama run col modello che preferisci. Su Mac funziona anche brew install ollama, mentre su Linux locale il comando è lo stesso curl visto sopra per la VPS.
La scelta tra locale e VPS dipende da come lo usi. In locale conviene se il tuo computer ha almeno 16 GB di RAM e ti serve il modello ogni tanto: zero costi, massima privacy, ma il PC deve restare acceso e occupato mentre genera. La VPS conviene quando vuoi un assistente sempre attivo, raggiungibile da più dispositivi o condiviso col team, con la RAM dimensionata sul modello e non sul portatile che hai in borsa.
Se il terminale proprio non ti piace, l’alternativa con interfaccia grafica è LM Studio, che gestisce il download dei modelli da una schermata unica. Ollama resta però più leggero e più facile da automatizzare, ed è il motivo per cui lo preferiamo sia in locale sia su server.
Cosa dice la community su Ollama
Ollama non è un servizio commerciale in abbonamento, quindi non troverai recensioni su Trustpilot: il termometro più affidabile è la community. Il subreddit r/ollama è tra i più attivi del mondo AI self-hosted e racconta bene cosa si può fare davvero: utenti che fanno girare modelli da 27B in locale a velocità sorprendenti, esperimenti con hardware datato (c’è chi ha fatto girare un modello 8B su un laptop del 2010) e thread ricorrenti di chi sostituisce gli abbonamenti AI cloud con modelli locali per il lavoro quotidiano.

Il sentiment è nettamente positivo: le critiche che circolano non riguardano quasi mai Ollama in sé, ma i limiti dell’hardware (poca RAM, modelli quantizzati in modo troppo aggressivo, tempi di risposta su CPU) e la configurazione iniziale. È la conferma di quanto visto in questa guida: la scelta della VPS giusta conta più del software, che su GitHub resta uno dei progetti open source più popolari in assoluto.
Pro e contro di Ollama su VPS
La mia esperienza con Ollama su VPS
Ho messo Ollama su una VPS economica con 8 GB di RAM e la prima cosa che sorprende è quanto sia semplice: dal comando di installazione al primo modello che risponde passano pochi minuti. Con un modello da 7-8B su sola CPU l’assistente è perfettamente usabile per scrivere, riassumere e rispondere a domande; la velocità non è quella di ChatGPT, ma per un uso personale e privato va benissimo.
Il salto di qualità arriva con Open WebUI: avere un’interfaccia da browser cambia tutto e rende l’esperienza davvero simile a un ChatGPT privato. Il limite reale è la memoria: appena provi modelli più grandi capisci perché conviene partire da una VPS con tanta RAM, oppure passare a una GPU a consumo quando serve potenza. Il consiglio pratico è di iniziare con un piano con almeno 8 GB e un modello 7-8B, e salire solo quando senti il bisogno di più.
Nota dalla prova diretta: su una VPS senza GPU la differenza la fa il numero di parametri del modello più che il prezzo del server. Un 7B gira liscio con 8 GB, ma passando a un 14B lo stesso server inizia ad arrancare: conviene scegliere prima il modello che vuoi usare e poi dimensionare RAM (e GPU) di conseguenza, non il contrario.
Conclusione
In breve, installare Ollama su una VPS è il modo migliore per avere un’AI privata, senza limiti e sempre disponibile. Il vantaggio principale è il controllo totale su dati e costi; il limite da considerare è che i modelli più grandi richiedono hardware adeguato. Se vuoi iniziare, ti basta una VPS con 8 GB di RAM e pochi minuti di configurazione.
🖥️ SCEGLI LA TUA VPS PER OLLAMA
Domande frequenti su Ollama e VPS
Ollama è gratis?
Sì, Ollama è gratuito e open source. L’unico costo è quello della VPS o dell’hardware su cui lo fai girare. I modelli open che scarichi sono anch’essi gratuiti.
Quanta RAM serve per Ollama?
Il minimo consigliato è 8 GB di RAM, sufficienti per i modelli da 7-8B. Per i modelli da 13-14B servono circa 16 GB, per i 32B almeno 24-32 GB, e per i 70B conviene una GPU con molta VRAM.
Serve una GPU per usare Ollama?
No, Ollama funziona anche solo su CPU. La GPU non è obbligatoria, ma velocizza molto le risposte, soprattutto con i modelli grandi.
Qual è la migliore VPS per Ollama?
Per il budget e la RAM Contabo è tra le più convenienti; per CPU e affidabilità Hetzner è un’ottima scelta; per i modelli grandi o la massima velocità conviene una GPU a consumo come quella di Runpod.
Come si accede a Ollama da browser come ChatGPT?
Installando un’interfaccia web come Open WebUI (ad esempio con Docker): ti dà una chat simile a ChatGPT, ma collegata ai modelli che giri con Ollama sul tuo server.
Posso usare DeepSeek o Llama con Ollama?
Sì. Ollama supporta i principali modelli open, tra cui Llama, le versioni distillate di DeepSeek, Qwen, Mistral e Gemma. Basta scaricarli con il comando pull.
Disclaimer
Disclaimer: Non rappresenta consulenza professionale. Le caratteristiche, i prezzi e le condizioni dei servizi VPS e dei software citati possono cambiare: prima di acquistare un piano o installare software, verifica sempre requisiti, costi e condizioni aggiornati sui rispettivi siti ufficiali.

Alessandro Sabbatini è un imprenditore digitale dal 2013 e il fondatore di ProMarketer.it. Vive di business online da oltre 13 anni — SEO, affiliate marketing e investimenti testati in prima persona, lavorando da più di 30 paesi — e su ProMarketer condivide quello che fa, come lo fa e i risultati che ottiene: guide gratuite di web marketing, strategie per generare reddito online e informazioni a scopo educativo sugli investimenti. Leggi la sua storia completa →
🔍 Trasparenza: alcuni link in questa pagina sono affiliati. Se apri un conto o acquisti tramite questi link, ProMarketer.it può ricevere una commissione senza costi aggiuntivi per te. Le recensioni e le opinioni restano indipendenti.