Risposta breve: la RAM che serve per far girare un LLM in locale si calcola come miliardi di parametri × byte per parametro della quantizzazione, più circa il 20% di margine per contesto e sistema operativo. Un modello da 8 miliardi di parametri in Q4 occupa circa 4,7 GB e gira con 8 GB di RAM. Un 70B in Q4 ne occupa circa 40 GB e ne chiede almeno 48.
In italiano questa domanda ha una risposta buona per Windows 11, per il gaming, per AutoCAD e persino per Minecraft. Per gli LLM no. Trovi thread di forum, opinioni contrastanti e cifre buttate lì senza il conto che c'è dietro.
Qui trovi il conto, la tabella modello per modello e la distinzione che quasi nessuno fa: la RAM dice se il modello ci sta, la banda di memoria dice quanto va veloce. Sono due cose diverse. Confonderle è il motivo per cui tanta gente compra la macchina sbagliata.
La formula: parametri per byte, più margine
Un modello di linguaggio è un file di pesi. Per rispondere deve stare in memoria, tutto intero.
Quanto pesa dipende da due cose: quanti parametri ha e quanti byte usi per rappresentare ciascun parametro. La seconda è quella che chiamiamo quantizzazione.
| Formato | Byte per parametro | Modello 7B | Qualità |
|---|---|---|---|
| FP16 (non quantizzato) | 2,0 | ~14 GB | Riferimento |
| Q8 | ~1,0 | ~7 GB | Perdita non percepibile |
| Q5_K_M | ~0,7 | ~5 GB | Ottimo compromesso |
| Q4_K_M | ~0,55 | ~4 GB | Standard di fatto |
| Q3 e inferiori | ~0,4 | ~3 GB | Degrado visibile |
La formula completa, quella da tenere a mente:
RAM minima = (parametri in miliardi × byte per parametro) + contesto + 2-3 GB per il sistema operativo
Il punto dolce oggi è Q4_K_M. Dimezza il peso rispetto a Q8 e su compiti normali la differenza di qualità è difficile da notare.
Sotto Q4 invece si scende in fretta: un 8B in Q3 sbaglia cose che in Q4 azzeccava.
Quanta RAM serve per un LLM in locale: la tabella
Le cifre valgono sia per la RAM di sistema (se giri su CPU) sia per la VRAM (se giri su GPU). La colonna RAM minima include già il margine per contesto e sistema operativo.
La RAM consigliata è quella con cui non litighi ogni volta che apri un documento lungo.
| Modello | Parametri | Quantizzazione | Peso dei pesi | RAM minima | RAM consigliata |
|---|---|---|---|---|---|
| Llama 3.2 3B | 3B denso | Q4_K_M | ~2 GB | 8 GB | 16 GB |
| Llama 3.1 8B | 8B denso | Q4_K_M | ~4,7 GB | 8 GB | 16 GB |
| Llama 3.1 8B | 8B denso | Q8 | ~8,5 GB | 16 GB | 16 GB |
| Gemma 3 12B | 12B denso | Q4_K_M | ~7 GB | 16 GB | 16 GB |
| Qwen3 14B | 14B denso | Q4_K_M | ~8,5 GB | 16 GB | 24 GB |
| GPT-OSS 20B | 21B MoE (3,6B attivi) | MXFP4 | ~12 GB | 16 GB | 24 GB |
| Gemma 3 27B | 27B denso | Q4_K_M | ~16 GB | 24 GB | 32 GB |
| Qwen3 32B | 32B denso | Q4_K_M | ~19 GB | 24 GB | 32 GB |
| Qwen3 32B | 32B denso | Q8 | ~35 GB | 48 GB | 64 GB |
| Llama 3.3 70B | 70B denso | Q4_K_M | ~40 GB | 48 GB | 64 GB |
| Llama 3.3 70B | 70B denso | Q5_K_M | ~50 GB | 64 GB | 64 GB |
| GPT-OSS 120B | 117B MoE (5,1B attivi) | MXFP4 | ~63 GB | 72 GB | 96-128 GB |
| Qwen3 235B-A22B | 235B MoE (22B attivi) | Q4 | ~130 GB | 128 GB (in Q3) | 192 GB |
I pesi quantizzati li trovi già pronti su Ollama o su Hugging Face, dove per ogni modello sono indicate le dimensioni esatte di ciascuna variante.
Tre letture pratiche di questa tabella:
- Con 8 GB di RAM si parte davvero, ma solo con modelli fino a 8B in Q4. Bastano per riassunti, riscritture e classificazione di testi. Non bastano per ragionare su codice complesso.
- 16 GB è il minimo sensato se l'AI locale ti serve per lavorare. A 32 GB smetti di sentirti limitato: ci entrano i 27-32B, quelli che iniziano a somigliare a un assistente serio.
- 64 GB e oltre servono solo per i modelli grandi. E lì la domanda cambia: non è più "ci sta?", è "quanto ci mette?".
La RAM dice SE, la banda dice QUANTO VELOCE
Questa è la parte che manca in quasi tutte le guide italiane. Ed è quella che ti fa risparmiare soldi.
La capacità di memoria è un vincolo binario: o il modello ci sta, o non parte. Nel caso peggiore parte e va in swap sul disco, che è un modo elegante per dire che non parte.
Ma una volta che il modello ci sta, la capacità non aggiunge un solo token al secondo.
La velocità la decide la banda di memoria. Per generare ogni token il sistema deve far passare tutti i pesi attivi attraverso il bus. Ogni token, ogni volta. Da qui la regola:
token al secondo ≈ banda di memoria ÷ dimensione del modello
Un esempio concreto è quello che ho analizzato nel dettaglio parlando del mini PC Ryzen AI Max+ 395 con 128 GB. Con circa 215 GB/s di banda reale e un 70B in Q4 da 40 GB, il conto dà circa 5 token al secondo. Ed è esattamente quello che misurano i possessori.
Cinque token al secondo significa quasi un minuto di attesa per una risposta media. Il modello ci sta perfettamente. È semplicemente inutilizzabile per una chat.
Ecco perché gli ordini di grandezza contano:
- DDR5 dual channel su un desktop: 60-90 GB/s. Va bene fino a 8-14B.
- Memoria unificata di un SoC AI (Apple Silicon, Strix Halo): 200-800 GB/s. Capienza enorme, velocità media.
- VRAM di una GPU dedicata: 800-1.800 GB/s. Poca capacità, velocità altissima.
La conseguenza pratica: se il modello entra nella VRAM, la GPU vince sempre. Le macchine a memoria unificata hanno senso solo per i modelli che in una GPU consumer non ci starebbero proprio.
Il caso peggiore: il modello che "quasi" ci sta
Se il modello sfora di poco la VRAM, i runtime spostano i layer in eccesso nella RAM di sistema. Quei layer devono poi attraversare il bus PCIe a ogni token.
È il collo di bottiglia peggiore possibile: la scheda legge i pesi da una cannuccia e le prestazioni crollano di un ordine di grandezza.
Meglio un modello più piccolo che entra tutto, che un modello più grande diviso a metà. Sempre.
Il contesto: la voce che tutti dimenticano
I pesi sono una quota fissa. La finestra di contesto no: la KV cache cresce con la lunghezza della conversazione e con la dimensione del modello.
Regola spannometrica: conta 1-2 GB ogni 8.000 token di contesto su un modello di taglia media, di più sui modelli grandi.
È il motivo per cui un modello che risponde benissimo alle domande brevi esplode quando gli dai in pasto un PDF di cinquanta pagine.
Se ti capita, hai tre leve in quest'ordine: riduci la finestra di contesto nelle impostazioni, attiva la quantizzazione della KV cache (a Q8 è quasi gratis in qualità), oppure scendi di taglia sul modello.
MoE: i modelli che rompono la regola
I modelli Mixture-of-Experts cambiano il conto della velocità, ma non quello della capacità. Devi tenere in memoria tutti i parametri, però per ogni token se ne attiva solo una frazione.
GPT-OSS 120B ha 117 miliardi di parametri ma ne attiva 5,1. Occupa la memoria di un modello enorme e va alla velocità di uno piccolo.
Sulla stessa macchina dove un 70B denso fa 5 token al secondo, un MoE da 120B ne fa circa 30.
Il caso estremo l'ho raccontato nella guida su GLM-5.2 da 744B in locale con 25 GB di RAM. Tenendo la parte densa in memoria e caricando gli esperti dal disco in streaming, un modello di classe frontier gira su un PC normale. Al prezzo di frazioni di token al secondo, ma funziona.
La regola aggiornata: per la capacità conta il totale dei parametri, per la velocità contano solo quelli attivi.
Cosa ci fai davvero, taglio per taglio
- 8 GB — Modelli 3B-8B in Q4, contesto corto. Riassunti, traduzioni, classificazione, bozze. Il livello "provo se mi serve".
- 16 GB — Fino a 14B in Q4 o 8B in Q8. Scrittura, domande sui documenti, codice semplice. Il minimo per l'uso quotidiano.
- 32 GB — Fino ai 27-32B in Q4, con contesto lungo. Qui la qualità fa un salto vero. È il taglio che consiglio a chi lavora con dati riservati.
- 64 GB — 70B in Q4 o Q5. Ci stanno, ma su CPU vanno lenti: ha senso con banda alta o per elaborazioni notturne.
- 128 GB — MoE da 120B e oltre, la fascia dei mini PC a memoria unificata. Capienza da server, velocità da laptop.
Prima di comprare qualsiasi cosa, però, un avvertimento. Con i rincari della memoria del 2026 la RAM è diventata la voce più cara dell'aggiornamento.
Ho fatto i conti completi su quanto costa davvero l'AI in locale e quando conviene. La sintesi: se il tuo criterio è il risparmio, il conto quasi mai torna. Torna quando in gioco ci sono privacy, volumi prevedibili o vincoli normativi.
Domande frequenti
Bastano 8 GB di RAM per un LLM in locale?
Sì, per modelli fino a 8 miliardi di parametri in Q4, che occupano circa 4,7 GB. Devi però tenere il contesto corto e chiudere le altre applicazioni pesanti. Per un uso quotidiano serio 16 GB sono il minimo sensato.
Serve una GPU o basta la CPU?
La CPU basta per modelli fino a 8-14B, perché il limite è la banda della RAM: 60-90 GB/s su un desktop DDR5. Una GPU con abbastanza VRAM è 10-20 volte più veloce, ma solo se il modello ci entra tutto.
Meglio un modello grande quantizzato o uno piccolo a precisione piena?
Quasi sempre il modello grande in Q4. Un 14B in Q4_K_M batte un 7B in FP16 sia in qualità sia in occupazione di memoria. Il ragionamento cambia solo sotto Q4, dove il degrado inizia a essere evidente.
Perché il modello è lentissimo anche se ho RAM a sufficienza?
Perché capacità e velocità sono due cose diverse. Se la banda è bassa, o se una parte del modello è finita fuori dalla VRAM e passa dal bus PCIe, le prestazioni crollano. Controlla quanti layer sono davvero caricati sulla GPU.
Quanta RAM serve in più per il contesto?
Circa 1-2 GB ogni 8.000 token su un modello di taglia media, di più sui modelli grandi. Se vai in errore di memoria sui documenti lunghi, riduci la finestra di contesto o quantizza la KV cache prima di cambiare modello.
Leggi anche
- Mini PC Ryzen AI Max+ 395: 128 GB per l'AI in locale
- Mini PC AI NVIDIA vs AMD: quale scegliere per gli LLM?
- Claude offline: funziona in locale? Alternative 2026
- Colibrì: GLM-5.2 da 744B in locale con 25 GB di RAM
- AI in locale: quanto costa davvero e quando conviene (2026)
In sintesi
Due numeri, due domande diverse. La capacità di memoria decide quali modelli puoi caricare, la banda decide se avrai voglia di usarli.
Parti dal modello che ti serve davvero. Calcola parametri per byte della quantizzazione, aggiungi il margine per contesto e sistema: la configurazione giusta esce da sola.
E resisti alla tentazione di comprare la macchina più capiente. Nella maggior parte dei casi un 14B che risponde in tempo reale è più utile di un 70B che ti fa aspettare un minuto.
Se stai valutando di portare un modello in azienda per privacy o per costi, scrivimi e ne parliamo: in mezz'ora si capisce se conviene il locale o il cloud. Se invece ti serve una mano a integrare l'AI nei tuoi processi, dai un'occhiata ai servizi di automazione AI che seguo per le PMI.



