Tehnologie

Qwen 3.8 Flash-Next: 125B care ruleaza ca un 6B

Qwen3.8-Flash-Next are 125 de miliarde de parametri dar activeaza doar 6. Ce e in arhitectura Qwen4, ce spun de fapt benchmark-urile si de ce conteaza pentru cine lucreaza local.

Cosmin-Anton Mihoc
8 min de lectură
Qwen 3.8 Flash-Next: 125B care ruleaza ca un 6B

Cuprins

Indice dei contenuti (16 sezioni)

Qwen3.8-Flash-Next este un model open-weight cu 125 de miliarde de parametri care activeaza doar 6 pentru fiecare token. Alibaba l-a lansat pe 26 august 2026 ca previzualizare a arhitecturii Qwen4, este multimodal, costa 0,16 dolari la milionul de token-uri de intrare si pe benchmark-urile de coding bate Claude Opus 4.6. Detaliul care conteaza cu adevarat pentru cine lucreaza local este altul: raportul dintre parametrii totali si cei activi.

Am citit fisa tehnica oficiala in loc de comunicate. Sunt trei lucruri pe care nimeni nu le povesteste in romana, si unul dintre ele priveste direct pe cine tocmai a dat doua mii de euro pe hardware pentru AI acasa.

Ce a lansat Alibaba, concret

Nu este modelul de varf. Echipa Qwen il defineste deschis ca o previzualizare experimentala a arhitecturii care va sustine Qwen4, nu ca un produs finit. E o alegere neobisnuita si trebuie citita ca atare: publica arhitectura in avans pentru ca dezvoltatorii sa se pregateasca pentru familia completa.

Cifrele din fisa oficiala:

Caracteristica Valoare
Parametri totali 125 de miliarde
Parametri activi per token 6 miliarde
N-gram embedding 51 de miliarde
MTP (multi-token prediction) 4 miliarde
Experti 512, dintre care 10 rutati + 1 partajat
Layere 48
Context nativ 262.144 token-uri
Context extensibil 1.000.000 token-uri cu YaRN
Licenta qwen-community-1.0

Este multimodal: accepta text, imagini si video. Si gandeste implicit, cu modul thinking activ si trei niveluri de efort (low, medium, xhigh).

Cele trei noutati arhitecturale care conteaza

Qwen Sparse Attention

Perechea Gated DeltaNet plus Gated Attention a fost refacuta prin introducerea QSA. Diferenta practica: in loc sa selecteze token-urile individuale de procesat, QSA lucreaza la nivel de micro-bloc, cu un buget de 512 blocuri sau 2.048 de token-uri. Rezultatul declarat este o reducere neta a latentei pe contextele lungi.

Nu e un detaliu academic. Sarcinile agentice — un agent care citeste un repository, ruleaza douazeci de minute, acumuleaza context — sunt exact cazul in care latenta pe contexte lungi te omoara. Qwen a optimizat pentru asta.

N-gram Embedding

Asta e partea cea mai interesanta, si revin imediat asupra ei. Modelul indexeaza 20 de milioane de bigrame si trigrame la al doilea layer. Sunt 51 de miliarde de parametri in plus, dar de un tip aparte.

Fisa oficiala e explicita in privinta motivului: embedding-urile permit cresterea numarului de parametri cerand mai putin calcul, si sunt mai potrivite pentru offloading decat Mixture-of-Experts. Modelul a fost proiectat gandindu-se la acceleratoare cu memorie putina.

Gated Residual

Moduleaza informatia care curge prin residual stream-urile largite printr-un gate de citire element cu element si un gate de scriere scalar pe ramura. In practica: mai multa expresivitate intre layere fara a pierde stabilitatea la antrenare, si cu overhead neglijabil la inferenta.

Benchmark-urile, citite cinstit

Publicatiile anglo-saxone au titrat "bate Opus 4.6". E adevarat pe mai multe randuri, si e adevarat ca aceste cifre vin de la un model care activeaza 6 miliarde de parametri, fata de modele enorm mai mari.

Benchmark Qwen3.8-Flash-Next Claude Opus 4.6
SWE-bench Pro 62,5 53,4
SWE-bench Multilingual 81,0 77,5
LiveCodeBench v6 91,9 88,8
GPQA Diamond 91,7 91,3
IFBench 81,3 62,5
HLE 35,9 40,0

Acum partea pe care titlurile o sar.

Sunt benchmark-uri auto-raportate. Qwen le-a rulat, pe Qwen. Nu e o vina, o fac toti, dar trebuie spus.

Doua benchmark-uri sunt interne. CoWorkBench si RecreationBench sunt definite chiar de fisa tehnica drept benchmark-uri "in-house". Un test construit in casa de cel care prezinta modelul nu poate fi verificat de nimeni.

La HLE pierde. Rationamentul multidisciplinar ramane terenul lui Opus, cu 40,0 fata de 35,9. Iar la NL2Repo-Bench modelul ia 48,1, in urma lui DeepSeek-V4-Flash care face 54,2.

O nota curioasa care spune multe despre starea domeniului: scorul HLE a fost judecat de GPT-4o. Un model care evalueaza alt model.

Punctul care priveste pe cine lucreaza local

Aici ajungem la motivul pentru care aceasta lansare conteaza mai mult decat altele.

In articolul despre mini PC-ul Ryzen AI Max+ 395 am explicat regula care guverneaza viteza unui LLM local: latimea de banda a memoriei impartita la dimensiunea modelului. Un model dens de 70B cuantizat cantareste 40 GB, iar pe 215 GB/s latime de banda reala iti da circa 5 token-uri pe secunda. Lent.

Cu un MoE calculul se schimba radical, pentru ca la fiecare token se activeaza doar parametrii expertilor selectati. Aici vorbim de 6 miliarde active din 125. Modelul trebuie sa stea integral in memorie, dar latimea de banda pe care o consuma pentru a genera fiecare token este cea a unui model mic.

Adauga faptul ca cele 51 de miliarde de n-gram embedding sunt proiectate sa fie descarcate in afara memoriei acceleratorului, si obtii un model cu cunostintele unui 125B si costul de banda al unui 6B.

Pe hartie este combinatia ideala pentru hardware-ul cu memorie unificata. Pe o masina cu 128 GB, o cuantizare agresiva ar trebui sa il faca sa incapa, iar viteza ar trebui sa fie mult superioara celei a unui model dens de 70B.

Ar trebui. Nu l-am incercat inca si nu exista benchmark-uri independente pe aceasta clasa de hardware. Sunt calcule facute pe arhitectura, nu masuratori. Cand voi avea cifre reale le public aici.

Vestea buna e ca ecosistemul s-a miscat deja: in momentul in care scriu exista deja zeci de cuantizari facute de comunitate, utilizabile cu llama.cpp, Ollama, LM Studio si Jan. Cine vrea sa incerce nu trebuie sa astepte.

Cat costa prin API

Alibaba a stabilit pretul pentru Flash-Next la 0,16 dolari la milionul de token-uri de intrare si 0,47 la milionul de iesire. Este un pret agresiv, facut posibil chiar de eficienta la inferenta: multi parametri, putini activi, cost mic.

Modelul este open-weight, deci il poti si self-hosta. Si aici trebuie facuta o consideratie care valoreaza mai mult decat lista de preturi.

Intrebarea pe care si-o pune o firma din Europa

Arun Chandrasekaran, analist Gartner, a comentat lansarea spunand ca firmele ar trebui sa evalueze daca are sens sa self-hosteze modelul in loc sa il consume prin API, si ca trebuie luate in calcul rezidenta datelor si implicatiile de securitate legate de furnizorii chinezi. Concluzia lui: pretul mic singur nu poate fi criteriul de alegere.

Tradus pentru o firma mica sau mijlocie:

  • Daca folosesti API-ul, prompturile tale calatoresc catre infrastructura Alibaba. Pentru date de firma sensibile asta e o chestiune de GDPR, nu de preferinta tehnica
  • Daca descarci greutatile si il rulezi tu, problema dispare complet. Datele nu ies, iar modelul ramane identic si daca maine se schimba termenii serviciului

Faptul ca un model de acest nivel este open-weight schimba calculul. Pana ieri, cine voia sa ramana in casa trebuia sa accepte modele sensibil mai slabe. Azi mai putin.

Intrebari frecvente

Ce este Qwen3.8-Flash-Next?

Este un model lingvistic multimodal open-weight lansat de Alibaba pe 26 august 2026. Are 125 de miliarde de parametri totali, dar activeaza doar 6 pentru fiecare token gratie arhitecturii Mixture-of-Experts. Este previzualizarea arhitecturii care va fi folosita in Qwen4.

Qwen3.8-Flash-Next se poate folosi gratis?

Greutatile pot fi descarcate liber de pe Hugging Face si ModelScope cu licenta qwen-community-1.0, deci il poti rula pe hardware-ul tau fara sa platesti nimic. Accesul prin API-ul Qwen Cloud este in schimb pe consum.

Ce diferenta este intre Qwen3.8-Flash-Next si Qwen3.8-Flash?

Flash-Next este versiunea open-weight experimentala. Qwen3.8-Flash este versiunea oficiala de productie, cu un context de un milion de token-uri activ implicit si unelte integrate.

E nevoie de o placa video puternica pentru Qwen3.8-Flash-Next?

E nevoie mai ales de multa memorie, pentru ca cele 125 de miliarde de parametri trebuie incarcate. Dar fiindca activeaza doar 6 per token, latimea de banda ceruta in timpul generarii este mica. Asta il face potrivit pentru sisteme cu memorie unificata incapatoare, mai degraba decat pentru placi video cu VRAM putin.

Qwen3.8-Flash-Next e mai bun decat Claude Opus 4.6?

Pe benchmark-urile de coding publicate de Qwen da, cu 62,5 fata de 53,4 la SWE-bench Pro. La HLE, care masoara rationamentul multidisciplinar, pierde cu 35,9 fata de 40,0. Scorurile sunt auto-raportate si inca neverificate de terti.

In concluzie

Qwen3.8-Flash-Next nu este cel mai inteligent model existent, iar Alibaba nici nu sustine asta. Este ceva mai util: dovada ca poti avea calitatea unui model mare la costul computational al unuia mic, cu greutatile descarcabile.

Pentru cine dezvolta software asta inseamna ca optiunea locala a incetat sa fie un compromis. Raman de verificat cifrele reale pe hardware real, si acesta e urmatorul test pe care il am in plan.

Daca evaluezi ce model sa adopti pentru firma ta si vrei sa intelegi daca are sens cloud-ul sau self-hosting-ul, scrie-mi. Gasesti tabloul complet si in serviciile de automatizari AI si de agenti AI. Alte materiale sunt pe blogul in romana.

Distribuie acest articol
Ai întrebări? Contactează-mă

Ești gata să-ți dai viață proiectului?

Contactează-mă ca să discutăm ideea ta și să primești o ofertă gratuită.

Să începem împreună