Tecnologie

Claude Code Gratis con Ollama: Guida Completa ai Modelli Locali

Ollama v0.14 introduce la compatibilità Anthropic API: ora puoi usare Claude Code gratis con modelli locali come Qwen3-Coder e Llama. Guida completa.

Cosmin-Anton Mihoc
8 min di lettura
Claude Code Gratis con Ollama: Guida Completa ai Modelli Locali

Indice dei contenuti

Ollama ha appena rilasciato una delle novità più attese dalla community degli sviluppatori: la versione 0.14.0 introduce la piena compatibilità con l'Anthropic Messages API. Questo significa che ora puoi utilizzare Claude Code, il potentissimo strumento di coding agentivo di Anthropic, completamente gratis con modelli open-source locali come Qwen3-Coder, Llama e molti altri.

 

Se hai sempre desiderato provare Claude Code ma non volevi sostenere i costi dell'API Anthropic, oppure hai esigenze di privacy che ti impediscono di inviare codice al cloud, questa guida fa al caso tuo. Vedremo nel dettaglio come configurare tutto, quali modelli scegliere e quali sono i requisiti hardware necessari.

Cos'è Claude Code e Perché è Così Potente

Claude Code è lo strumento di coding agentivo sviluppato da Anthropic che vive direttamente nel tuo terminale. A differenza dei semplici assistenti di chat, Claude Code può analizzare interi repository, creare e modificare file, eseguire comandi e ragionare su problemi complessi di programmazione. È diventato rapidamente il benchmark per quello che un agente di coding può fare oltre il semplice autocomplete.

Il problema storico era la dipendenza dall'infrastruttura cloud di Anthropic: ogni richiesta passava attraverso i loro server, con costi per token e potenziali preoccupazioni sulla privacy del codice. Con l'aggiornamento di Ollama, questa limitazione è stata eliminata.

Come Funziona la Compatibilità Anthropic API di Ollama

Il meccanismo è elegante nella sua semplicità: Ollama agisce come un proxy che espone un endpoint compatibile con l'API Anthropic Messages. Claude Code continua a funzionare esattamente come prima, gestendo pianificazione, navigazione del codice e modifiche, ma le richieste vengono indirizzate a un modello locale invece che ai server Anthropic.

Questo approccio ti offre diversi vantaggi significativi. Privacy totale: il tuo codice non lascia mai la tua macchina. Zero costi operativi: niente più tariffe per token dopo l'investimento hardware iniziale. Velocità: nessun round-trip verso il cloud significa latenza ridotta. Flessibilità: puoi passare da un modello all'altro in base alle esigenze del progetto.

Requisiti Hardware: Cosa Ti Serve per Iniziare

Prima di procedere con l'installazione, è fondamentale capire quali risorse hardware sono necessarie. I modelli AI per coding richiedono memoria significativa, e la scelta del modello giusto dipende dalla tua configurazione.

Per modelli piccoli (7B-14B) come Qwen2.5-Coder:7b, servono almeno 8-16 GB di RAM e preferibilmente una GPU con 8 GB di VRAM. Questi modelli sono ideali per laptop e PC di fascia media, e offrono prestazioni sorprendentemente buone per task di coding quotidiani.

Per modelli medi (30B) come Qwen3-Coder:30b, il requisito sale a 20+ GB di VRAM o 32 GB di RAM per l'esecuzione su CPU con quantizzazione. Questi modelli offrono capacità agentiche molto più avanzate ma richiedono hardware dedicato.

Per modelli grandi (480B) come Qwen3-Coder-480B, parliamo di 250+ GB di memoria unificata. Questi sono pensati per data center o per l'utilizzo tramite Ollama Cloud, non per hardware consumer.

La quantizzazione gioca un ruolo cruciale: un modello 7B in formato Q4_K_M occupa circa 4-5 GB invece dei 26 GB della versione FP16, con una perdita di qualità minima (stimata intorno al 5%). Se il tuo hardware è limitato, preferisci sempre versioni quantizzate.

Installazione: Guida Passo Passo

Partiamo dall'installazione di Ollama. Se non l'hai già fatto, scarica l'ultima versione (0.14.0 o superiore) dal sito ufficiale. L'installazione è disponibile per Windows, macOS e Linux.

Una volta installato Ollama, scarica un modello adatto al coding. Per iniziare, ti consiglio Qwen3-Coder che è specificamente ottimizzato per task agentici. Apri il terminale ed esegui:

ollama pull qwen3-coder:30b

Se hai hardware più limitato, opta per la versione più leggera:

ollama pull qwen2.5-coder:7b

Verifica che Ollama sia in esecuzione con:

ollama serve

Il server si avvierà sulla porta 11434 per default.

Configurazione di Claude Code con Ollama

Ora viene la parte interessante: collegare Claude Code a Ollama. Hai due opzioni per la configurazione.

Opzione 1: Variabili d'ambiente temporanee

Imposta le variabili d'ambiente prima di lanciare Claude Code:

export ANTHROPIC_BASE_URL=http://localhost:11434
export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=ollama

Poi lancia Claude Code specificando il modello:

claude --model qwen3-coder

Opzione 2: Configurazione permanente

Per rendere la configurazione permanente, aggiungi le variabili al tuo file di profilo shell (~/.bashrc, ~/.zshrc o equivalente):

echo 'export ANTHROPIC_BASE_URL=http://localhost:11434' >> ~/.bashrc
echo 'export ANTHROPIC_AUTH_TOKEN=ollama' >> ~/.bashrc
echo 'export ANTHROPIC_API_KEY=ollama' >> ~/.bashrc
source ~/.bashrc

Nota importante: i valori di AUTH_TOKEN e API_KEY sono placeholder necessari ma non vengono effettivamente validati da Ollama. Puoi usare qualsiasi stringa.

Modelli Consigliati per Claude Code

Non tutti i modelli sono uguali quando si tratta di coding agentivo. Ecco i migliori secondo i test della community e i benchmark ufficiali.

Qwen3-Coder è attualmente il re indiscusso dei modelli open-source per coding. Disponibile in versioni da 30B a 480B parametri, offre supporto nativo per 256K token di contesto (estendibile a 1M con YaRN), capacità agentiche avanzate e prestazioni paragonabili a Claude Sonnet nei benchmark Aider Polyglot. La versione 30B è il sweet spot per la maggior parte degli sviluppatori.

Qwen2.5-Coder è l'alternativa più leggera, disponibile da 0.5B a 32B parametri. La versione 7B offre un ottimo rapporto qualità/risorse ed è perfetta per chi ha hardware consumer.

DeepSeek-Coder-V2 introduce un'architettura MoE (Mixture of Experts) con la versione Lite che offre 128K di contesto con soli 2.4B parametri attivi su 16B totali.

CodeLlama di Meta rimane una scelta solida, specialmente la versione Instruct per chat e la versione Python per progetti specifici.

Utilizzo con Ollama Cloud

Se non hai hardware sufficiente per far girare modelli localmente, Ollama offre anche modelli cloud accessibili con la stessa configurazione. I modelli cloud mantengono sempre la loro context length completa e non richiedono risorse locali.

Per usare un modello cloud:

claude --model glm-4.7:cloud
claude --model minimax-m2.1:cloud

Questa opzione è particolarmente utile per task che richiedono context length estese o modelli più potenti di quelli che puoi eseguire localmente.

Trucchi per Mappare i Nomi dei Modelli

Claude Code si aspetta nomi di modelli nel formato Anthropic (come claude-3-5-sonnet). Se un tool o script richiede specificamente questi nomi, puoi usare il comando ollama cp per creare un alias:

ollama cp qwen3-coder claude-3-5-sonnet

Ora quando Claude Code richiede claude-3-5-sonnet, Ollama userà automaticamente qwen3-coder.

Integrazione con SDK Esistenti

Se hai già applicazioni che usano l'Anthropic SDK, la migrazione è semplicissima: basta cambiare il base URL.

Esempio in Python:

import anthropic

client = anthropic.Anthropic(
    base_url='http://localhost:11434',
    api_key='ollama',  # richiesto ma ignorato
)

message = client.messages.create(
    model='qwen3-coder',
    max_tokens=1024,
    messages=[
        {'role': 'user', 'content': 'Scrivi una funzione Python per controllare se un numero è primo'}
    ]
)

print(message.content[0].text)

Esempio in JavaScript/TypeScript:

import Anthropic from '@anthropic-ai/sdk';

const anthropic = new Anthropic({
  baseURL: 'http://localhost:11434',
  apiKey: 'ollama',
});

const message = await anthropic.messages.create({
  model: 'qwen3-coder',
  max_tokens: 1024,
  messages: [
    { role: 'user', content: 'Implementa un binary search tree in TypeScript' }
  ],
});

console.log(message.content[0].text);

Troubleshooting: Problemi Comuni e Soluzioni

Durante la configurazione potresti incontrare alcuni problemi. Ecco le soluzioni ai più comuni.

Errore "does not support thinking": alcuni modelli più piccoli non supportano la modalità "thinking" di Claude Code. In questo caso, prova con un modello più capace come qwen3-coder:30b.

Risposte lente o timeout: verifica che il modello sia effettivamente caricato in memoria con ollama list. Se il modello è troppo grande per la tua RAM/VRAM, considera una versione più piccola o quantizzata.

Context length insufficiente: per progetti grandi, Claude Code può facilmente superare i limiti di contesto. Ollama raccomanda modelli con almeno 32K token di contesto, idealmente 64K o più per workflow complessi.

Errori 500 con richieste grandi: richieste molto grandi (18KB+ di system prompt, 20+ tool) possono causare errori con alcuni modelli cloud. In questi casi, prova con modelli locali o riduci la complessità della richiesta.

Alternative: Olla e Altri Proxy

Oltre alla compatibilità nativa di Ollama, esistono progetti come Olla che fungono da traduttori API più avanzati. Olla supporta load balancing tra più backend (Ollama, LM Studio, vLLM), failover automatico e unificazione dei modelli. È particolarmente utile in setup enterprise dove hai più server GPU.

Un'altra opzione è ollama-anthropic-shim, un progetto GitHub che offre un layer di compatibilità più leggero con mapping configurabile dei modelli.

Leggi anche

Conclusioni

L'integrazione tra Claude Code e Ollama rappresenta una svolta significativa per gli sviluppatori che vogliono sfruttare il coding agentivo senza dipendere da servizi cloud. Con Qwen3-Coder e altri modelli open-source, puoi ottenere prestazioni paragonabili a Claude Sonnet mantenendo il controllo completo sui tuoi dati e azzerando i costi operativi.

Se stai cercando supporto per implementare workflow di sviluppo con AI nel tuo team o vuoi esplorare soluzioni di sviluppo web app che integrano intelligenza artificiale, contattami per una consulenza personalizzata.

Condividi questo articolo
Hai domande? Contattami

Pronto a dare vita al tuo progetto?

Contattami per discutere della tua idea e ricevere una consulenza gratuita.

Iniziamo insieme