Tehnologie

Mini PC Ryzen AI Max+ 395: 128 GB pentru AI local

Ryzen AI Max+ 395 cu 128 GB ruleaza local modele de 120B. Cate token-uri pe secunda face cu adevarat, cat costa in Europa si cui ii convine.

Cosmin-Anton Mihoc
8 min de lectură
Mini PC Ryzen AI Max+ 395: 128 GB pentru AI local

Cuprins

Indice dei contenuti (16 sezioni)

Un mini PC cu Ryzen AI Max+ 395 si 128 GB de memorie unificata ruleaza local modele pe care nicio placa video de consum nu reuseste nici macar sa le incarce: vorbim de 70B, 120B, pana la Qwen3-235B. Le ruleaza incet, intre 11 si 30 de token-uri pe secunda in functie de model, si costa intre 3.000 si 4.800 de euro. Capacitate uriasa, viteza modesta: aici sta toata alegerea.

Cipul AMD "Strix Halo" a devenit cea mai discutata bucata de hardware printre cei care vor sa tina inteligenta artificiala in casa. Motivul e o singura specificatie: acei 128 GB nu sunt RAM de sistem, sunt un pool unificat pe care placa video integrata il poate folosi aproape in intregime. O RTX 5090 se opreste la 32 GB de VRAM. Aici ai pana la 110.

Problema e ca aproape toate articolele pe care le gasesti povestesc jumatate din poveste. Sa vedem cealalta jumatate, cea care decide daca merita sa dai banii.

Ce se afla de fapt in Ryzen AI Max+ 395

SoC-ul combina 16 nuclee Zen 5 cu 32 de thread-uri, o placa grafica integrata Radeon 8060S cu 40 de compute unit pe arhitectura RDNA 3.5, si un NPU XDNA 2 declarat in jurul a 50 TOPS. AMD comunica 126 TOPS ca cifra de platforma, adunand NPU, GPU si CPU: e un numar de marketing, nu puterea NPU-ului singur.

Dar pentru a rula un LLM niciuna dintre aceste specificatii nu conteaza cat magistrala de memorie. E pe 256 de biti pe LPDDR5X-8000, pentru o latime de banda teoretica de 256 GB/s. In testele reale se masoara in jur de 212-215 GB/s.

Numarul acela e practic totul. Revenim imediat asupra lui pentru ca e inima articolului.

Cata memorie poate folosi de fapt placa video?

Depinde de sistemul de operare, si e o diferenta care conteaza:

  • Windows — placa integrata poate ajunge la circa 96 GB din cei 128 totali
  • Linux — se ajunge la circa 110 GB, gratie unei gestiuni mai libere a memoriei partajate

Acei 14 GB diferenta nu sunt un detaliu: sunt exact ce separa "pot incarca modelul asta" de "nu incape". Daca iei o astfel de masina pentru AI si nu pentru jocuri, Linux e platforma de referinta, nu o optiune pentru pasionati.

Cate token-uri pe secunda face cu adevarat?

Aici cade cortina peste majoritatea recenziilor. Viteza de generare a unui LLM este, in prima aproximatie, latimea de banda a memoriei impartita la dimensiunea modelului. Pentru a produce fiecare token sistemul trebuie sa treaca toate greutatile modelului prin magistrala. Fiecare token, de fiecare data.

Cu circa 215 GB/s latime de banda reala, un model dens de 70 de miliarde de parametri cuantizat pe 4 biti cantareste in jur de 40 GB. Fa impartirea: circa 5 token-uri pe secunda. Si exact asta masoara posesorii.

Modelele Mixture-of-Experts schimba calculul, pentru ca la fiecare token se activeaza doar o fractiune din parametri. De aceea cifrele par incoerente pana nu te uiti la arhitectura:

Model Tip Viteza observata
Model dens ~9B Dens + drafter circa 40 token/s
Qwen3.6 35B (3B activi) MoE + drafter peste 50 token/s
GPT-OSS 120B MoE circa 30 token/s
Model dens 70B Q4 Dens circa 5 token/s
Qwen3-235B-A22B MoE circa 11 token/s (data GMKtec)

Datele de pe primele trei randuri provin din teste cu LM Studio si runtime ROCm pe o masina cu 128 GB, cu 75% din memorie alocata placii video. Cifra pentru 235B e cea publicata de GMKtec pentru propriul EVO-X2.

Citirea practica: un MoE de 120B iti da o viteza de conversatie acceptabila, un model dens de 70B nu. Cinci token-uri pe secunda inseamna sa astepti aproape un minut pentru un raspuns de lungime medie. Pentru un chat e frustrant. Pentru o procesare de noapte pe documente confidentiale, e perfect.

Benchmark-ul "de 3 ori mai rapid decat o RTX 5080" trebuie citit bine

E cifra care a facut inconjurul retelelor. AMD o prezinta ca "pana la 3,05x" pe DeepSeek R1, si e o data reala. Doar ca nu masoara viteza: masoara capacitatea.

Avantajul acela apare doar cand modelul depaseste cei 16 GB de VRAM ai placii 5080. In acel moment straturile in exces ajung in RAM-ul de sistem si trebuie sa traverseze magistrala PCIe, mult mai lenta decat memoria placii. 5080 nu pierde pentru ca e lenta: pierde pentru ca citeste greutatile printr-un pai. Mini PC-ul AMD castiga pentru ca totul sta intr-un singur pool si nimic nu trebuie sa se reverse.

Ia un model care incape comod in VRAM-ul lui 5080 si comparatia se rastoarna fara apel.

Cat costa in Europa

Preturi relevate pe comparatoarele europene in august 2026, configuratii de 128 GB:

Model Configuratie Pret orientativ
BOSGAME M5 128 GB / 2 TB de la circa 3.099 €
GMKtec EVO-X2 128 GB / 2 TB circa 3.800 €
GEEKOM A9 Mega 128 GB / 2 TB circa 3.999 €
Beelink GTR9 Pro 128 GB / 2 TB circa 4.799 €
HP Z2 Mini G1a 128 GB / 2 TB peste 6.500 €

Pentru comparatie, versiunea de 64 GB a lui EVO-X2 se gaseste in jur de 2.250 €. Si aici e cea mai frecventa capcana comerciala: pretul de vitrina pe care il vezi promovat e aproape mereu cel al configuratiei de 64 GB, in timp ce modelele mari despre care vorbesc recenziile ruleaza doar pe versiunea de 128. Memoria e lipita pe placa: nu o adaugi ulterior. Alegi gresit si nu mai ai remediu.

Ia in calcul si ca multi dintre acesti producatori expediaza din China. Verifica intotdeauna cine e vanzatorul, de unde pleaca marfa si cum functioneaza garantia europeana inainte sa comanzi.

Cui ii convine cu adevarat

Daca criteriul tau e costul, nu cumperi masina asta. Cu 3.500 de euro iti platesti aproape cincisprezece ani de abonament Pro, cu modele mai rapide si mai capabile.

Calculul se schimba doar cand intra in joc ceva ce banii nu cumpara.

Are sens daca

  • Lucrezi cu date care nu pot iesi din firma — dosare medicale, acte juridice, proiecte sub NDA. Aici constrangerea e normativa, nu economica
  • Ai volume mari si previzibile — sa clasifici zeci de mii de documente pe consum API costa mult mai mult decat o masina care lucreaza noaptea
  • Dezvolti produse care trebuie sa functioneze offline — testarea pe hardware real e singura metoda serioasa
  • Ai nevoie de un mediu stabil — niciun model care se schimba sub picioare, nicio depreciere, niciun rate limit

Nu are sens daca

  • Vrei sa inlocuiesti Claude sau ChatGPT in munca zilnica — la 5-30 de token-uri pe secunda pe modele oricum inferioare, comparatia nu sta in picioare
  • Cauti un agent de coding rapid — latenta ucide fluxul de lucru, si asta e cazul in care dezamagirea e cel mai sigura
  • Vrei doar sa incerci AI-ul local — porneste de la ce ai deja in casa. Cu cuantizarile agresive de azi se fac lucruri serioase si pe hardware obisnuit

Strix Halo sau astepti generatia urmatoare?

Intrebarea e legitima, pentru ca domeniul se misca repede. Xiaomi a aratat AI Cube, care declara 1,22 TB/s latime de banda: ar fi de circa sase ori Strix Halo, adica exact specificatia care rezolva problema despre care am vorbit tot articolul.

Doar ca AI Cube nu are inca nici pret, nici data, nici disponibilitate in Europa. Ryzen AI Max+ 395 il poti comanda azi.

Regula pe care mi-am dat-o: daca proiectul are un termen, cumperi ce exista. Daca doar explorezi, astepti.

Intrebari frecvente

Ryzen AI Max+ 395 ajunge pentru a rula un model de 70B?

Da, cu 128 GB de memorie unificata un model de 70B cuantizat pe 4 biti incape fara probleme. Dar ruleaza in jur de 5 token-uri pe secunda, o viteza potrivita pentru procesari in lot, nu pentru o conversatie.

Am nevoie de versiunea de 128 GB sau ajunge cea de 64?

Cu 64 GB gestionezi comod modele pana la 30-40B. Daca obiectivul tau sunt modelele de 70B sau MoE de 120B si peste, versiunea de 128 GB e singura optiune: memoria e lipita si nu se extinde.

Windows sau Linux?

Linux, daca folosinta principala e inferenta. Permite alocarea catre placa integrata a circa 110 GB fata de 96 pe Windows, iar suportul ROCm pentru runtime-urile de inferenta e mai matur.

Merita fata de o RTX 5090?

Sunt unelte diferite. 5090 e net mai rapida pe orice model care incape in cei 32 GB de VRAM. Strix Halo castiga doar pe modelele care in 32 GB pur si simplu nu incap.

Consuma mult?

TDP-ul e configurabil pana la 120 W, mult mai putin decat o statie de lucru cu placa video dedicata. Sub sarcina continua ramane totusi o cheltuiala de pus in calculul costului total.

In concluzie

Ryzen AI Max+ 395 cu 128 GB e o masina onesta care e povestita in mod neonest. Nu e un inlocuitor pentru un abonament frontier si nu e un accelerator rapid: e un recipient incapator, si in schimbul vitezei iti da ceva ce niciun serviciu cloud nu poate, adica controlul total asupra datelor tale.

Daca evaluezi sa aduci AI-ul in firma ta si nu stii daca are sens sa il rulezi local sau in cloud, scrie-mi si discutam: in jumatate de ora se intelege care dintre cele doua cai chiar economiseste bani. Daca te intereseaza tabloul mai larg, arunca o privire la serviciile de automatizari AI si de agenti AI pe care le urmez pentru firme mici si mijlocii. Alte materiale gasesti pe blogul in romana.

Distribuie acest articol
Ai întrebări? Contactează-mă

Ești gata să-ți dai viață proiectului?

Contactează-mă ca să discutăm ideea ta și să primești o ofertă gratuită.

Să începem împreună