Raspuns scurt: cata RAM pentru LLM local iti trebuie se calculeaza asa: miliarde de parametri x bytes per parametru (in functie de cuantizare), plus aproximativ 20% marja pentru context si sistemul de operare. Un model de 8 miliarde de parametri in Q4 ocupa circa 4,7 GB si merge cu 8 GB RAM. Un model de 70B in Q4 ocupa circa 40 GB si cere cel putin 48 GB.
Daca cauti in romana, gasesti usor raspunsuri la "cat RAM imi trebuie pentru gaming" sau "cat RAM suporta laptopul meu". Pentru LLM-uri locale, aproape nimic concret: cateva articole generale despre AI local, threaduri pe Reddit in engleza si cifre aruncate fara calculul din spate.
Aici gasesti calculul, tabelul model cu model si diferenta pe care aproape nimeni nu o explica: RAM-ul iti spune daca modelul incape, latimea de banda a memoriei iti spune cat de repede merge. Sunt doua lucruri diferite. Confuzia dintre ele e motivul pentru care multa lume cumpara calculatorul gresit.
Formula: parametri x bytes, plus marja
Un model de limbaj este, practic, un fisier de ponderi (weights). Ca sa raspunda, trebuie sa stea in memorie in intregime.
Cat cantareste depinde de doua lucruri: cati parametri are si cati bytes folosesti pentru fiecare parametru. A doua parte se numeste cuantizare (quantization).
| Format | Bytes per parametru | Model 7B | Calitate |
|---|---|---|---|
| FP16 (necuantizat) | 2,0 | ~14 GB | Referinta |
| Q8 | ~1,0 | ~7 GB | Pierdere imperceptibila |
| Q5_K_M | ~0,7 | ~5 GB | Compromis foarte bun |
| Q4_K_M | ~0,55 | ~4 GB | Standardul de facto |
| Q3 si mai jos | ~0,4 | ~3 GB | Degradare vizibila |
Formula completa pentru cata RAM pentru LLM local iti trebuie, cea pe care merita sa o tii minte:
RAM minim = (parametri in miliarde x bytes per parametru) + context + 2-3 GB pentru sistemul de operare
Exemplu rapid: un model de 14B in Q4_K_M inseamna 14 x 0,55, adica aproximativ 8 GB doar pentru ponderi. Adaugi contextul si sistemul si ajungi la 16 GB ca minim realist.
Punctul optim astazi este Q4_K_M. Injumatateste greutatea fata de Q8, iar pe sarcini obisnuite diferenta de calitate e greu de observat. Sub Q4 insa lucrurile se strica repede: un 8B in Q3 greseste lucruri pe care in Q4 le nimerea.
Cata RAM pentru LLM local: tabelul complet
Cifrele sunt valabile atat pentru RAM-ul sistemului (daca rulezi pe CPU), cat si pentru VRAM (daca rulezi pe placa video). Coloana RAM minim include deja marja pentru context si sistemul de operare.
RAM recomandat este cantitatea cu care nu te certi cu calculatorul de fiecare data cand deschizi un document lung.
| Model | Parametri | Cuantizare | Greutate ponderi | RAM minim | RAM recomandat |
|---|---|---|---|---|---|
| Llama 3.2 3B | 3B dens | Q4_K_M | ~2 GB | 8 GB | 16 GB |
| Llama 3.1 8B | 8B dens | Q4_K_M | ~4,7 GB | 8 GB | 16 GB |
| Llama 3.1 8B | 8B dens | Q8 | ~8,5 GB | 16 GB | 16 GB |
| Gemma 3 12B | 12B dens | Q4_K_M | ~7 GB | 16 GB | 16 GB |
| Qwen3 14B | 14B dens | Q4_K_M | ~8,5 GB | 16 GB | 24 GB |
| GPT-OSS 20B | 21B MoE (3,6B activi) | MXFP4 | ~12 GB | 16 GB | 24 GB |
| Gemma 3 27B | 27B dens | Q4_K_M | ~16 GB | 24 GB | 32 GB |
| Qwen3 32B | 32B dens | Q4_K_M | ~19 GB | 24 GB | 32 GB |
| Qwen3 32B | 32B dens | Q8 | ~35 GB | 48 GB | 64 GB |
| Llama 3.3 70B | 70B dens | Q4_K_M | ~40 GB | 48 GB | 64 GB |
| Llama 3.3 70B | 70B dens | Q5_K_M | ~50 GB | 64 GB | 64 GB |
| GPT-OSS 120B | 117B MoE (5,1B activi) | MXFP4 | ~63 GB | 72 GB | 96-128 GB |
| Qwen3 235B-A22B | 235B MoE (22B activi) | Q4 | ~130 GB | 128 GB (in Q3) | 192 GB |
Ponderile deja cuantizate le gasesti gata facute in biblioteca Ollama sau pe Hugging Face, unde pentru fiecare model este trecuta dimensiunea exacta a fiecarei variante. Daca nu stii inca ce model sa alegi, am facut o lista separata cu cele mai bune LLM-uri locale din 2026 si ce model alegi.
Trei concluzii practice din tabel, daca te intrebi cata RAM pentru LLM local sa ai in calculator:
- Cu 8 GB RAM chiar poti incepe, dar doar cu modele de pana la 8B in Q4. Ajung pentru rezumate, rescrieri si clasificare de texte. Nu ajung pentru rationament pe cod complex.
- 16 GB este minimul rezonabil daca vrei AI local pentru munca. La 32 GB nu te mai simti limitat: incap modelele de 27-32B, cele care incep sa semene cu un asistent serios.
- 64 GB si peste au sens doar pentru modelele mari. Acolo intrebarea se schimba: nu mai este "incape?", ci "cat dureaza?".
Cum verifici cat RAM si VRAM ai
Ca sa stii cata RAM pentru LLM local iti ramane de fapt disponibila, uita-te intai ce ai deja. Pe Windows deschizi Task Manager (Ctrl+Shift+Esc), tabul Performance: la Memory vezi RAM-ul total, la GPU vezi "Dedicated GPU memory", adica VRAM-ul.
Pe Mac, meniul Apple, apoi About This Mac: acolo memoria este unificata, deci aceeasi cifra serveste si pentru model.
Pe laptopuri verifica si daca RAM-ul este lipit pe placa de baza. La multe ultrabookuri nu il mai poti extinde, asa ca decizia se ia la cumparare, nu dupa.
RAM vs VRAM: RAM-ul spune DACA, banda spune CAT DE REPEDE
Aceasta este partea care lipseste din aproape toate ghidurile. Si este partea care te scapa de cheltuieli inutile.
Capacitatea memoriei este o conditie binara: modelul fie incape, fie nu porneste. In cel mai rau caz porneste si intra in swap pe disc, ceea ce este un mod elegant de a spune ca nu porneste.
Dar odata ce modelul incape, capacitatea in plus nu adauga niciun token pe secunda. Intrebarea cata RAM pentru LLM local are deci doar jumatate din raspuns.
Viteza o decide latimea de banda a memoriei (memory bandwidth). Ca sa genereze fiecare token, sistemul trebuie sa treaca toate ponderile active prin magistrala. La fiecare token, de fiecare data. De aici regula:
tokeni pe secunda ~ latimea de banda a memoriei / dimensiunea modelului
Un exemplu concret este cel pe care l-am analizat in detaliu cand am scris despre mini PC-ul Ryzen AI Max+ 395 cu 128 GB. Cu aproximativ 215 GB/s banda reala si un 70B in Q4 de 40 GB, calculul da circa 5 tokeni pe secunda. Exact ce masoara si cei care il au.
Cinci tokeni pe secunda inseamna aproape un minut de asteptare pentru un raspuns mediu. Modelul incape perfect. Este pur si simplu inutilizabil pentru chat.
De aceea conteaza ordinele de marime:
- DDR5 dual channel pe un desktop: 60-90 GB/s. Merge bine pana la 8-14B.
- Memorie unificata pe un SoC AI (Apple Silicon, Strix Halo): 200-800 GB/s. Capacitate uriasa, viteza medie.
- VRAM pe o placa video dedicata: 800-1.800 GB/s. Capacitate mica, viteza foarte mare.
Consecinta practica: daca modelul incape in VRAM, placa video castiga intotdeauna. Masinile cu memorie unificata au sens doar pentru modelele care pe o placa video de consum nu ar incapea deloc. Comparatia intre cele doua abordari am facut-o in articolul NVIDIA DGX Spark vs AMD pentru LLM local.
Cel mai rau caz: modelul care "aproape" incape
Daca modelul depaseste putin VRAM-ul, programele de rulare muta straturile (layers) in plus in RAM-ul sistemului. Acele straturi trebuie apoi sa treaca prin magistrala PCIe la fiecare token.
Este cel mai prost bottleneck posibil: placa citeste ponderile printr-un pai, iar performanta scade cu un ordin de marime.
Mai bine un model mai mic care incape complet decat un model mai mare impartit in doua. Intotdeauna.
Contextul: costul pe care toata lumea il uita
Cand calculezi cata RAM pentru LLM local iti trebuie, ponderile sunt o cota fixa. Fereastra de context nu: KV cache-ul creste odata cu lungimea conversatiei si cu dimensiunea modelului.
Regula aproximativa: socoteste 1-2 GB la fiecare 8.000 de tokeni de context pe un model de marime medie, mai mult pe modelele mari.
Asta explica de ce un model care raspunde perfect la intrebari scurte se blocheaza cand ii dai un PDF de cincizeci de pagini.
Daca ti se intampla, ai trei parghii, in ordinea asta: reduci fereastra de context din setari, activezi cuantizarea KV cache-ului (la Q8 aproape nu pierzi nimic din calitate) sau cobori la un model mai mic.
MoE: modelele care rup regula
Modelele Mixture-of-Experts schimba calculul vitezei, dar nu si pe cel al capacitatii. Trebuie sa tii in memorie toti parametrii, insa pentru fiecare token se activeaza doar o parte din ei.
GPT-OSS 120B are 117 miliarde de parametri, dar activeaza doar 5,1 miliarde. Ocupa memoria unui model urias si merge cu viteza unuia mic.
Pe aceeasi masina pe care un 70B dens face 5 tokeni pe secunda, un MoE de 120B face in jur de 30.
Cazul extrem l-am descris cand am scris despre GLM-5.2, un model de 744B: tinand partea densa in memorie si incarcand expertii de pe disc in streaming, un model de clasa frontier ruleaza pe un PC obisnuit cu 25 GB RAM. Cu pretul unor fractiuni de token pe secunda, dar functioneaza.
Un exemplu mai practic de MoE pentru acasa este Qwen 3.8 Flash Next, un MoE de 125B pentru AI local.
Regula actualizata: pentru capacitate conteaza totalul parametrilor, pentru viteza conteaza doar cei activi.
Ce poti face concret cu 8, 16, 32, 64 si 128 GB
- 8 GB: modele 3B-8B in Q4, context scurt. Rezumate, traduceri, clasificare, ciorne. Nivelul "vad daca imi foloseste".
- 16 GB: pana la 14B in Q4 sau 8B in Q8. Scriere, intrebari pe documente, cod simplu. Minimul pentru folosire zilnica.
- 32 GB: pana la 27-32B in Q4, cu context lung. Aici calitatea face un salt real. Este configuratia pe care o recomand celor care lucreaza cu date confidentiale.
- 64 GB: 70B in Q4 sau Q5. Incap, dar pe CPU merg incet: are sens cu banda mare sau pentru procesari peste noapte.
- 128 GB: MoE de 120B si peste, zona mini PC-urilor cu memorie unificata. Capacitate de server, viteza de laptop.
Asta este, in practica, raspunsul la intrebarea cata RAM pentru LLM local merita sa cumperi. Daca pleci de la zero si vrei o configuratie completa pe buget, am pus variantele concrete in ghidul despre cel mai bun computer pentru AI in 2026 in functie de buget.
Inainte sa cumperi ceva, un avertisment. Cu scumpirile memoriei din 2026, RAM-ul a devenit cea mai scumpa parte a unui upgrade, asa ca verifica preturile actuale pe eMAG sau la magazinele de componente inainte sa decizi.
Am facut calculul complet in articolul AI local: cat costa si cand merita in 2026.
Pe scurt: daca singurul criteriu este economia, socoteala aproape niciodata nu iese. Iese cand sunt in joc confidentialitatea datelor, volume previzibile sau constrangeri legale (GDPR, clauze de confidentialitate cu clientii).
Intrebari frecvente
Cata RAM pentru LLM local ajunge ca sa incepi: sunt suficienti 8 GB?
Da, pentru modele de pana la 8 miliarde de parametri in Q4, care ocupa circa 4,7 GB. Trebuie insa sa tii contextul scurt si sa inchizi celelalte aplicatii grele. Pentru folosire zilnica serioasa, 16 GB este minimul rezonabil.
Imi trebuie placa video sau ajunge procesorul?
Procesorul ajunge pentru modele de pana la 8-14B, pentru ca limita este banda RAM-ului: 60-90 GB/s pe un desktop DDR5. O placa video cu suficient VRAM este de 10-20 de ori mai rapida, dar doar daca modelul incape in ea complet.
Mai bine un model mare cuantizat sau unul mic la precizie completa?
Aproape intotdeauna modelul mare in Q4. Un 14B in Q4_K_M bate un 7B in FP16 si la calitate, si la memoria ocupata. Rationamentul se schimba doar sub Q4, unde degradarea devine evidenta.
De ce modelul merge foarte greu desi am RAM suficient?
Pentru ca, asa cum am explicat, capacitatea si viteza sunt lucruri diferite. Daca banda este mica sau o parte din model a iesit din VRAM si trece prin PCIe, performanta se prabuseste. Verifica cate straturi sunt incarcate efectiv pe placa video.
Cat RAM in plus imi trebuie pentru context?
Circa 1-2 GB la fiecare 8.000 de tokeni pe un model de marime medie, mai mult pe modelele mari. Daca primesti erori de memorie pe documente lungi, reduci fereastra de context sau cuantizezi KV cache-ul inainte sa schimbi modelul.
Pe scurt
Doua cifre, doua intrebari diferite. Capacitatea memoriei decide ce modele poti incarca, banda decide daca vei avea chef sa le folosesti.
Porneste de la modelul de care ai nevoie cu adevarat. Inmultesti parametrii cu bytes-ii cuantizarii, adaugi marja pentru context si sistem, si stii cata RAM pentru LLM local iti trebuie: configuratia potrivita reiese singura.
Si rezista tentatiei de a cumpara masina cu cea mai multa memorie. In majoritatea cazurilor, un 14B care raspunde in timp real iti este mai util decat un 70B care te tine un minut la fiecare raspuns. Daca te intereseaza si varianta fara cloud pentru asistentii mari, am scris separat despre Claude offline si alternativele locale.
Daca te gandesti sa aduci un model AI in firma ta pentru confidentialitate sau costuri, scrie-mi si vorbim: in jumatate de ora iti dai seama daca merita localul sau cloud-ul.
Iar daca vrei sa integrezi AI-ul in procesele de zi cu zi, uita-te la serviciile de automatizari AI pe care le fac eu pentru IMM-uri.



