Tecnologie

AI cinese e open source: i modelli che consiglio nel 2026

DeepSeek, Qwen, GLM, Kimi e i modelli open di Mistral e Google: quale scegliere per dati aziendali, automazioni, chatbot e codice, con prezzi e licenze reali.

Cosmin-Anton Mihoc
14 min di lettura
AI cinese e open source: i modelli che consiglio nel 2026
Indice dei contenuti (12 sezioni)

Chi mi chiede quale AI cinese usare di solito vuole sapere due cose diverse. Il programmatore vuole il modello che scrive buon codice spendendo poco. L'azienda vuole sapere se può metterci dentro i dati dei clienti senza finire nei guai.

Le classifiche che trovi in giro rispondono alla prima domanda e ignorano la seconda. Questa guida risponde a entrambe.

Metto in fila i migliori modelli di AI cinese e open source a settembre 2026: DeepSeek, Qwen, GLM, Kimi, MiniMax, ma anche i modelli aperti di Mistral, Google e OpenAI che quasi nessuno cita. Per ognuno trovi licenza, prezzo, dove gira e soprattutto per cosa lo consiglio, separando le scelte per le aziende da quelle per chi programma.

Prezzi e licenze vengono dai listini e dalle schede ufficiali dei produttori. Dove una fonte dice una cosa e un'altra il contrario, lo segnalo.

La risposta breve: quale AI cinese o open source per quale uso

Se hai due minuti, questa è la sintesi. Il resto dell'articolo spiega il perché.

  • Automazioni di volume a costo minimo (estrazione dati, classificazione, riassunti): DeepSeek V4.1 Flash, 0,15 $ per milione di token in ingresso.
  • Agente di coding che lavora su un repository intero: GLM-5.3, anche in abbonamento dentro gli strumenti di coding.
  • Interfacce e frontend: Qwen3.8-Max-0902 via API, allo stesso livello dei migliori modelli chiusi nella Code Arena WebDev.
  • Massima qualità a pesi aperti: Kimi K3, ma costa quanto un modello occidentale di fascia media.
  • AI in locale su una sola GPU o un Mac: Qwen3.8-27B (Apache 2.0) o Gemma 4.
  • Dati personali di clienti europei: niente API di un'AI cinese in diretta. Un modello open weight su infrastruttura tua o europea, oppure Mistral Large 3.

Open source, open weight e API: tre cose diverse

Prima di confrontare i modelli serve una distinzione, perché è quella che decide cosa puoi fare davvero.

  • Open source in senso pieno: pesi scaricabili con licenza permissiva, come MIT o Apache 2.0. Puoi usarli in un prodotto commerciale, modificarli e ospitarli dove vuoi.
  • Open weight con licenza propria: i pesi si scaricano, ma la licenza aggiunge condizioni, di solito per chi fattura molto o rivende il modello come servizio.
  • Solo API: il modello non si scarica. Mandi i dati al fornitore e paghi a token.

Lo stesso nome può stare in due categorie. Qwen3.8-Max multimodale si usa solo via API, mentre il checkpoint aperto Qwen3.8-2.4T-A95B è solo testo, senza il milione di token di contesto, e ha una licenza personalizzata.

Il fratello piccolo Qwen3.8-27B è invece Apache 2.0. Chi scrive "Qwen è Apache 2.0" senza specificare quale Qwen ti sta dando mezza informazione. La regola pratica: leggi la licenza del checkpoint esatto che scarichi, non la pagina marketing della famiglia.

I migliori modelli di AI cinese a settembre 2026

DeepSeek V4.1 Flash: il costo più basso per lavoro di volume

Uscito il 10 settembre 2026, è oggi il modello DeepSeek da considerare, perché V4-Pro è stato ritirato e le sue richieste vengono instradate sul Flash. Licenza MIT, pesi su Hugging Face, contesto fino a 1 milione di token, immagini native.

Il listino API ufficiale è 0,15 $ per milione di token in ingresso e 0,60 $ in uscita, con tariffe dimezzate nelle ore di minor traffico. Sui benchmark agentici pubblicati da DeepSeek è al livello di Claude Opus 5, mentre sul ragionamento puro senza strumenti resta chiaramente sotto. Ho analizzato numeri e limiti in DeepSeek V4.1 Flash: benchmark, prezzi e cosa cambia.

Lo consiglio per: estrazione dati da documenti, classificazione, agenti che girano di notte, coding economico con OpenCode.

Non lo consiglio per: dati personali tramite l'API ufficiale, che è servita da un'azienda cinese. In locale non è realistico: i pesi occupano centinaia di gigabyte anche quantizzati.

Qwen 3.8: la famiglia più ampia, dal cloud al portatile

Alibaba ha la gamma più completa di tutta l'AI cinese. Tre modelli contano davvero:

  • Qwen3.8-Max-0902: solo API, 2 $ in ingresso e 6 $ in uscita per milione di token. Ha debuttato al primo posto nella Code Arena WebDev, di fatto alla pari con Claude Opus 5. Ne ho parlato in Qwen3.8-Max-0902 nel WebDev: vale la pena?
  • Qwen3.8-27B: pesi aperti con licenza Apache 2.0, contesto di 262.000 token. Quantizzato gira in circa 17-18 GB di memoria, quindi su una sola GPU o su un Mac con abbastanza RAM.
  • Qwen3.8-Flash-Next: il MoE aperto rilasciato a fine agosto con licenza Apache 2.0, pensato per girare veloce in locale. Trovi i dettagli in Qwen 3.8 Flash-Next in locale.

Lo consiglio per: frontend e prototipi di interfacce (Max via API), prodotti commerciali basati su un modello da ospitare in proprio (27B, grazie alla licenza Apache).

Attenzione al checkpoint aperto da 2,4 trilioni: la licenza prevede accordi di revenue sharing per i provider sopra i 50 milioni di dollari annui, e non è la versione multimodale.

GLM-5.3 di Z.ai: il più solido per gli agenti

Z.ai (ex Zhipu) ha rilasciato GLM-5.3 a metà agosto 2026, sulla stessa base di GLM-5.2 con un post-training migliorato. Secondo Artificial Analysis è alla pari con Kimi K3 in cima ai modelli a pesi aperti, con un prezzo molto più basso: 1,40 $ in ingresso e 4,40 $ in uscita per milione di token, input in cache a 0,26 $.

Primo dettaglio: GLM-5.2 resta con licenza MIT e contesto da 1 milione di token, mentre per il flagship 5.3 Z.ai ha abbandonato la MIT per una licenza propria. Verifica i termini prima di un deployment.

Secondo dettaglio: esiste GLM-5.3-Flash, MIT, 320 miliardi di parametri con 18 attivi, a 0,15/0,50 $ via API, che quantizzato a 4 bit chiede circa 180 GB di memoria. Per provare la famiglia GLM su hardware più piccolo c'è la guida GLM 5.2 in locale con 25 GB di RAM.

Lo consiglio per: agenti che lavorano a lungo su un repository, terminale e chiamate a strumenti. Per chi programma c'è anche il GLM Coding Plan da 18 $ al mese, utilizzabile negli strumenti di coding supportati.

Kimi K3 di Moonshot: il più forte, non il più economico

Kimi K3 è uscito il 16 luglio 2026: 2,8 trilioni di parametri, contesto da 1 milione di token, visione nativa. È il riferimento per la qualità tra i modelli a pesi aperti.

I pesi sono stati pubblicati il 27 luglio con la licenza Kimi K3, che chiede un accordo separato a chi rivende il modello come servizio sopra i 20 milioni di dollari e impone l'attribuzione ai prodotti molto grandi.

La sorpresa è il prezzo del listino Kimi: 3 $ in ingresso e 15 $ in uscita per milione di token, 0,30 $ con la cache. È un'AI cinese che costa come un modello occidentale di fascia media. Il ragionamento è sempre attivo e i suoi token si pagano come uscita.

Lo consiglio per: i compiti difficili dove serve il massimo tra i modelli aperti. Se ti serve un modello Kimi specializzato sul codice a prezzo basso, c'è Kimi K2.7 Code a 0,95/4 $, con contesto da 256.000 token e licenza Modified MIT.

MiniMax M3 e MiMo-V2.5-Pro: da tenere d'occhio

MiniMax M3, annunciato il 1° giugno 2026, è un modello a pesi aperti multimodale nativo: testo, immagini e video, con contesto da 1 milione di token e circa 23 miliardi di parametri attivi su 428. Ha senso quando nel flusso ci sono documenti scansionati, screenshot o video.

MiMo-V2.5-Pro di Xiaomi è la sorpresa dell'anno nell'AI cinese: licenza MIT, 1 trilione di parametri con 42 attivi, orientato al software engineering e agli agenti di lunga durata. Non lo metto nelle raccomandazioni principali solo perché l'ecosistema di provider è ancora più piccolo degli altri.

I modelli open source non cinesi che contano

Parlare di open source solo in chiave di AI cinese è un errore, soprattutto per un'azienda italiana. Ci sono tre alternative serie.

  • Mistral Large 3 (Francia): 675 miliardi di parametri con 41 attivi, pesi Apache 2.0, API a 2/6 $ per milione di token. È l'unico laboratorio europeo di questa fascia e offre residenza dei dati in UE. Mistral lo dichiara tra i migliori sulle conversazioni multilingue non inglesi. La famiglia comprende anche Mistral Small 4, Apache 2.0, per chi vuole un modello più leggero.
  • Gemma 4 (Google): quattro modelli, dai piccoli E2B ed E4B fino al 26B MoE e al 31B denso, tutti Apache 2.0 dall'aprile 2026. Sono tra i migliori da far girare su una sola macchina.
  • gpt-oss (OpenAI): 20B e 120B, Apache 2.0. Ancora validi per il ragionamento in locale, ma OpenAI non li ha aggiornati e oggi i Qwen e i Gemma di pari taglia li superano.

Confronto rapido: licenze, prezzi e dove girano

Modello Licenza pesi API $/M (in / out) Contesto In locale
DeepSeek V4.1 Flash MIT 0,15 / 0,60 1M No (server)
Qwen3.8-Max-0902 Solo API 2 / 6 1M No
Qwen3.8-27B Apache 2.0 via provider 262K Sì, ~18 GB
GLM-5.3 Licenza Z.ai 1,40 / 4,40 1M No (server)
GLM-5.3-Flash MIT 0,15 / 0,50 1M Server, ~180 GB
Kimi K3 Kimi K3 License 3 / 15 1M No (cluster)
Kimi K2.7 Code Modified MIT 0,95 / 4 256K No (server)
Mistral Large 3 Apache 2.0 2 / 6 256K No (server)
Gemma 4 (26B / 31B) Apache 2.0 via provider n.d.

"In locale" significa su un PC, un Mac o una workstation con una GPU. "Server" significa hardware da data center o cloud GPU. Per capire quanta memoria ti serve modello per modello c'è la tabella della RAM per gli LLM in locale.

Per le aziende: quale AI cinese usare e quando evitarla

Prima domanda: dove finiscono i dati

È la prima domanda che mi fa un cliente italiano, e ha ragione. Le API ufficiali di DeepSeek, Kimi e Qwen sono servite da aziende cinesi.

Mandarci anagrafiche, ordini o dati sanitari significa un trasferimento extra-UE da valutare con chi si occupa di privacy in azienda. Il problema non è l'AI cinese in sé, ma dove gira.

Il vantaggio dei pesi aperti è proprio questo: lo stesso modello può girare su un server tuo, su un cloud europeo o presso un provider che hai scelto e di cui hai letto le condizioni. Il modello è cinese, l'infrastruttura no. Per i dati sensibili ho tre strade, in ordine di semplicità:

  • Mistral via API europea, se vuoi un fornitore UE senza gestire server.
  • Un modello aperto su un provider di inferenza di cui conosci la localizzazione dei dati.
  • Self-hosting di Qwen3.8-27B o Gemma 4 su una macchina tua, quando i dati non devono uscire dall'azienda.

Automazioni e documenti

Per estrarre dati da fatture e bolle, classificare email o riassumere capitolati, il modello più economico che regge il compito è quello giusto. Qui DeepSeek V4.1 Flash e GLM-5.3-Flash cambiano i conti: su volumi di migliaia di documenti al mese la spesa scende a pochi euro.

Vale per dati non personali o anonimizzati prima dell'invio. Se il flusso passa da n8n o da un'app su misura, l'integrazione è identica a quella con OpenAI: quasi tutti espongono API compatibili. È il tipo di lavoro che faccio nei progetti di automazione AI per le PMI.

Chatbot per i clienti in italiano

Qui il criterio non è il benchmark di coding, ma la qualità dell'italiano e l'affidabilità. Ogni AI cinese di fascia alta scrive bene in italiano, ma nessuno pubblica misure serie sulla nostra lingua.

Il mio consiglio: prova lo stesso set di 20 domande reali dei tuoi clienti su Mistral Large 3, Qwen3.8 e un modello Gemma 4, e scegli leggendo le risposte. Metti sempre la conoscenza aziendale in un sistema di recupero, come spiego nella guida ai database vettoriali e RAG.

Compliance: il modello non ti esonera

Usare un modello aperto non cambia gli obblighi di chi lo mette in produzione: informare l'utente che parla con un'AI, conservare i log, tenere un umano nel giro sulle decisioni che contano.

Dal 30 settembre 2026 in Italia anche il D.Lgs. 160/2026 rende i log decisivi in caso di contestazioni, come spiego in decreto intelligenza artificiale: cosa cambia per le imprese.

Per i programmatori: l'AI cinese per il coding

Alternative cinesi a Claude per il coding

È una delle ricerche più frequenti, e la risposta dipende dal lavoro:

  • Refactoring e agenti su repository grandi: GLM-5.3. Il Coding Plan da 18 $ al mese è il modo più semplice di usarlo negli strumenti di coding che già conosci.
  • Coding a volume con budget minimo: DeepSeek V4.1 Flash dentro OpenCode, partner ufficiale del lancio. Il confronto tra i due strumenti è in Claude Code vs OpenCode, e per l'harness di DeepSeek c'è DeepSeek Harness.
  • Frontend, landing e componenti React: Qwen3.8-Max-0902 o Kimi K3, entrambi in cima alle arene di voto sul web design.
  • Codice riservato che non può uscire dal tuo computer: Qwen3.8-27B o Gemma 4 in locale, con aspettative realistiche. Il quadro completo è in quale LLM scegliere in locale.

Il costo vero è per compito, non per token

Un modello da 0,15 $ che ci prova quattro volte può costare più di uno da 3 $ che chiude al primo colpo.

Attenzione anche al ragionamento: su Kimi K3 è sempre attivo e su Qwen3.8-Max è acceso di default al livello massimo, con i token pagati come uscita. Disattivarlo o abbassarlo per i compiti semplici è la prima ottimizzazione da fare. Ne parlo anche in perché non rincorro ogni nuovo modello.

La mia regola: un router, non un modello

Il mercato dell'AI cinese cambia ogni mese: in pochi mesi DeepSeek ha ritirato V4-Pro, Z.ai ha cambiato licenza al flagship e Kimi con K3 ha più che triplicato il prezzo rispetto a K2.6. Legare un progetto a un solo modello è il rischio più grande.

Per questo nei progetti metto sempre uno strato di astrazione tra l'applicazione e il modello: un gateway compatibile OpenAI, il nome del modello in configurazione e un modello di riserva pronto.

Il modello economico gestisce il grosso delle chiamate, quello forte interviene sui casi difficili, e se un fornitore cambia prezzo o sparisce si cambia una riga. È lo stesso approccio che descrivo in agenti AI per aziende, senza hype.

Come provare un'AI cinese in 30 minuti

  1. Scegli tre compiti veri: tre email da classificare, un documento da riassumere, un bug che ti ha fatto perdere un pomeriggio.
  2. Apri un account su un aggregatore come OpenRouter, che serve DeepSeek, Qwen, GLM, Kimi e Mistral con una sola chiave e API compatibile OpenAI.
  3. Esegui gli stessi compiti su due o tre modelli, con lo stesso prompt e il ragionamento al livello più basso che regge.
  4. Misura tre numeri: risposte corrette, tempo e costo per compito completato.
  5. Decidi dove girerà in produzione: API del produttore, provider europeo o self-hosting, in base ai dati che il flusso tratta.

Mezz'ora di test sui tuoi casi vale più di qualsiasi classifica, compresa quella di questo articolo.

Gli errori che vedo più spesso

  • Confondere pesi aperti e gratuito. I pesi si scaricano gratis, ma GPU, energia e manutenzione si pagano. Prima di comprare hardware leggi quanto costa davvero l'AI in locale.
  • Usare la chat gratuita di un'AI cinese con dati aziendali. Le chat di DeepSeek, Kimi e Qwen sono comode per provare, non per incollarci contratti e anagrafiche.
  • Scegliere dalla classifica. I punteggi aggregati misurano una media. Il tuo linguaggio, il tuo dominio e il tuo italiano possono ribaltare l'ordine.
  • Dimenticare la licenza. MIT e Apache 2.0 sono semplici. Kimi K3, Qwen3.8-2.4T e GLM-5.3 hanno condizioni proprie da leggere.

Leggi anche

In sintesi: la migliore AI cinese è quella giusta per il compito

La migliore AI cinese non esiste in assoluto: esiste quella giusta per il tuo compito e per i tuoi dati. Nel 2026 i modelli cinesi e open source sono alla pari con quelli chiusi su molti lavori reali e costano una frazione.

DeepSeek per il volume, GLM per gli agenti, Qwen per il frontend e il locale, Kimi per il massimo, Mistral e Gemma quando conta restare in Europa o sulla tua macchina.

Se vuoi capire quale modello mettere nei tuoi flussi, e soprattutto quale non usare con i tuoi dati, scrivimi: parto sempre da un test sui tuoi casi reali. Se il progetto è un'applicazione su misura con l'AI dentro, trovi il mio lavoro nella pagina di sviluppo web app.

Condividi questo articolo
Hai domande? Contattami

Pronto a dare vita al tuo progetto?

Contattami per discutere della tua idea e ricevere una consulenza gratuita.

Iniziamo insieme