Un mini PC con Ryzen AI Max+ 395 e 128 GB di memoria unificata fa girare in locale modelli che nessuna GPU consumer riesce nemmeno a caricare: si parla di 70B, 120B, fino a Qwen3-235B. Li fa girare lentamente, tra gli 11 e i 30 token al secondo a seconda del modello, e in Italia costa tra i 3.000 e i 4.800 euro. Capacita enorme, velocita modesta: e tutta qui la scelta.
Il chip AMD "Strix Halo" e diventato il pezzo di hardware piu discusso tra chi vuole tenersi l'AI in casa. La ragione e una sola specifica: quei 128 GB non sono RAM di sistema, sono un pool unificato che la GPU integrata puo usare quasi per intero. Una RTX 5090 si ferma a 32 GB di VRAM. Qui ne hai fino a 110.
Il problema e che quasi tutti gli articoli che trovi in giro raccontano meta della storia. Vediamo l'altra meta, quella che decide se ti conviene spendere quei soldi.
Cosa c'e davvero dentro il Ryzen AI Max+ 395
Il SoC mette insieme 16 core Zen 5 con 32 thread, una GPU integrata Radeon 8060S da 40 compute unit in architettura RDNA 3.5, e una NPU XDNA 2 dichiarata intorno ai 50 TOPS. AMD comunica 126 TOPS come cifra di piattaforma, sommando NPU, GPU e CPU: e un numero di marketing, non la potenza della sola NPU.
Ma per far girare un LLM nessuna di queste specifiche conta quanto il bus di memoria. E a 256 bit su LPDDR5X-8000, per una banda teorica di 256 GB/s. Nei test reali si misurano circa 212-215 GB/s.
Quel numero e praticamente tutto. Torniamo subito su questo punto perche e il cuore dell'articolo.
Quanta memoria puo usare davvero la GPU?
Dipende dal sistema operativo, ed e una differenza che pesa:
- Windows — la GPU integrata puo arrivare a circa 96 GB dei 128 totali
- Linux — si arriva a circa 110 GB, grazie a una gestione piu libera della memoria condivisa
Quei 14 GB di differenza non sono un dettaglio: sono esattamente cio che separa il "posso caricare questo modello" dal "non ci sta". Se compri una di queste macchine per l'AI e non per giocarci, Linux e la piattaforma di riferimento, non un'opzione da smanettoni.
Quanti token al secondo fa davvero?
Qui casca il palco della maggior parte delle recensioni. La velocita di generazione di un LLM e, in prima approssimazione, banda di memoria diviso dimensione del modello. Per produrre ogni singolo token il sistema deve far passare tutti i pesi del modello attraverso il bus. Ogni token, ogni volta.
Con circa 215 GB/s di banda reale, un modello denso da 70 miliardi di parametri quantizzato a 4 bit pesa sui 40 GB. Fai la divisione: circa 5 token al secondo. Ed e esattamente quello che misurano i possessori.
I modelli Mixture-of-Experts cambiano il conto, perche a ogni token si attiva solo una frazione dei parametri. Ecco perche i numeri sembrano incoerenti finche non guardi l'architettura:
| Modello | Tipo | Velocita osservata |
|---|---|---|
| Modello denso ~9B | Denso + drafter | circa 40 token/s |
| Qwen3.6 35B (3B attivi) | MoE + drafter | oltre 50 token/s |
| GPT-OSS 120B | MoE | circa 30 token/s |
| Modello denso 70B Q4 | Denso | circa 5 token/s |
| Qwen3-235B-A22B | MoE | circa 11 token/s (dato GMKtec) |
I dati sulle prime tre righe vengono da test con LM Studio e runtime ROCm su una macchina a 128 GB, con il 75% della memoria assegnata alla GPU. Il dato sui 235B e quello pubblicato da GMKtec per il proprio EVO-X2.
La lettura pratica: un MoE da 120B ti da una velocita di conversazione accettabile, un denso da 70B no. Cinque token al secondo significa aspettare quasi un minuto per una risposta di media lunghezza. Per una chat e frustrante. Per un batch notturno su documenti riservati, va benissimo.
Il benchmark "3 volte piu veloce di una RTX 5080" va letto bene
E il numero che ha fatto il giro dei social. AMD lo presenta come "fino a 3,05x" su DeepSeek R1, ed e un dato reale. Solo che non misura la velocita: misura la capienza.
Quel vantaggio compare solo quando il modello supera i 16 GB di VRAM della 5080. A quel punto i layer in eccesso finiscono nella RAM di sistema e devono attraversare il bus PCIe, molto piu lento della memoria della scheda. La 5080 non perde perche e lenta: perde perche sta leggendo i pesi attraverso una cannuccia. Il mini PC AMD vince perche tutto sta in un unico pool e niente deve traboccare.
Prendi un modello che entra comodamente nella VRAM della 5080 e il confronto si ribalta senza appello.
Quanto costa in Italia (e perche piu che negli Stati Uniti)
Questa e la parte che sui blog americani non trovi. I listini in dollari che leggi in giro non sono quello che paghi tu.
Prezzi rilevati sui comparatori italiani ad agosto 2026, configurazioni 128 GB:
| Modello | Configurazione | Prezzo indicativo |
|---|---|---|
| BOSGAME M5 | 128 GB / 2 TB | da circa 3.099 € |
| GMKtec EVO-X2 | 128 GB / 2 TB | circa 3.800 € |
| GEEKOM A9 Mega | 128 GB / 2 TB | circa 3.999 € |
| Beelink GTR9 Pro | 128 GB / 2 TB | circa 4.799 € |
| HP Z2 Mini G1a | 128 GB / 2 TB | oltre 6.500 € |
Per confronto, la versione 64 GB dell'EVO-X2 si trova intorno ai 2.250 €. E qui c'e la trappola commerciale piu comune: il prezzo civetta che vedi pubblicizzato e quasi sempre quello della configurazione da 64 GB, mentre i modelli grossi di cui parlano le recensioni girano solo sulla versione da 128. La memoria e saldata: non la aggiungi dopo. Scegli male e non c'e rimedio.
Considera anche che diversi di questi produttori spediscono dalla Cina. Verifica sempre chi e il venditore, dove parte la merce e come funziona la garanzia europea prima di ordinare.
A chi conviene davvero
Ho gia fatto i conti sul break-even tra AI in locale e abbonamento cloud, e la conclusione vale anche qui: se il tuo criterio e il costo, non compri questa macchina. A 3.500 euro ti paghi quasi quindici anni di abbonamento Pro, con modelli piu veloci e piu capaci.
Il calcolo cambia solo quando entra in gioco qualcosa che i soldi non comprano.
Ha senso se
- Tratti dati che non possono uscire dall'azienda — cartelle cliniche, atti legali, progetti coperti da NDA. Qui il vincolo e normativo, non economico
- Fai volumi grossi e prevedibili — classificare decine di migliaia di documenti a consumo API costa molto piu di una macchina che gira di notte
- Sviluppi prodotti che devono funzionare offline — testarli su hardware reale e l'unico modo serio
- Ti serve un ambiente stabile — nessun modello che cambia sotto i piedi, nessuna deprecazione, nessun rate limit
Non ha senso se
- Vuoi sostituire Claude o ChatGPT nel lavoro quotidiano — a 5-30 token al secondo su modelli comunque inferiori, il confronto non regge
- Cerchi un agente di coding veloce — la latenza uccide il flusso di lavoro, e questo e il caso d'uso in cui la delusione e piu garantita
- Vuoi solo provare l'AI locale — parti da quello che hai gia in casa. Come mostro nella guida su GLM-5.2 in locale con 25 GB di RAM, con le quantizzazioni aggressive di oggi si fanno cose serie anche su hardware normale
Strix Halo o aspettare la prossima generazione?
La domanda e legittima, perche il settore si muove in fretta. Xiaomi ha mostrato AI Cube, che dichiara 1,22 TB/s di banda: sarebbe circa sei volte lo Strix Halo, cioe esattamente la specifica che risolve il problema di cui abbiamo parlato per tutto l'articolo.
Solo che AI Cube non ha ancora un prezzo, ne una data, ne disponibilita in Europa. Il Ryzen AI Max+ 395 lo puoi ordinare oggi.
La regola che mi sono dato: se il progetto ha una scadenza, compri quello che esiste. Se stai solo esplorando, aspetti. Su questo tema ho scritto anche perche rincorrere ogni novita dell'AI e il modo piu veloce per non concludere niente.
Domande frequenti
Il Ryzen AI Max+ 395 basta per far girare un modello da 70B?
Si, con 128 GB di memoria unificata un 70B quantizzato a 4 bit ci sta senza problemi. Ma gira intorno ai 5 token al secondo, una velocita adatta a elaborazioni in batch, non a una conversazione.
Serve la versione da 128 GB o basta quella da 64?
Con 64 GB gestisci comodamente modelli fino a 30-40B. Se il tuo obiettivo sono i 70B o i MoE da 120B e oltre, la 128 GB e l'unica opzione: la memoria e saldata e non si espande.
Windows o Linux?
Linux, se l'uso principale e l'inferenza. Permette di assegnare alla GPU integrata circa 110 GB contro i 96 di Windows, e il supporto ROCm per i runtime di inferenza e piu maturo.
Conviene rispetto a una RTX 5090?
Sono strumenti diversi. La 5090 e nettamente piu veloce su qualsiasi modello che entri nei suoi 32 GB di VRAM. Lo Strix Halo vince solo sui modelli che in 32 GB non ci stanno proprio.
Consuma molto?
Il TDP e configurabile fino a 120 W, molto meno di una workstation con GPU dedicata. Sotto carico continuo resta comunque una spesa da mettere in conto nel calcolo del costo totale.
Leggi anche
- Xiaomi AI Cube: 120B parametri in locale, cosa c'e dentro
- AI in locale: quanto costa davvero e quando conviene (2026)
- Colibri: GLM-5.2 da 744B in locale con 25 GB di RAM
- Top 20 repository GitHub per LLM: guida completa 2026
In sintesi
Il Ryzen AI Max+ 395 con 128 GB e una macchina onesta che viene raccontata in modo disonesto. Non e un sostituto di un abbonamento frontier e non e un acceleratore veloce: e un contenitore capiente, e in cambio della velocita ti da qualcosa che nessun servizio cloud puo darti, cioe il controllo totale sui tuoi dati.
Se stai valutando di portare l'AI dentro la tua azienda e non sai se ha senso farla girare in locale o in cloud, scrivimi e ne parliamo: in mezz'ora si capisce quale delle due strade fa risparmiare davvero. Se invece ti interessa il quadro piu ampio, dai un'occhiata ai servizi di automazione AI che seguo per le PMI.



