Qwen3.8-Flash-Next este un model open-weight cu 125 de miliarde de parametri care activeaza doar 6 pentru fiecare token. Alibaba l-a lansat pe 26 august 2026 ca previzualizare a arhitecturii Qwen4, este multimodal, costa 0,16 dolari la milionul de token-uri de intrare si pe benchmark-urile de coding bate Claude Opus 4.6. Detaliul care conteaza cu adevarat pentru cine lucreaza local este altul: raportul dintre parametrii totali si cei activi.
Am citit fisa tehnica oficiala in loc de comunicate. Sunt trei lucruri pe care nimeni nu le povesteste in romana, si unul dintre ele priveste direct pe cine tocmai a dat doua mii de euro pe hardware pentru AI acasa.
Ce a lansat Alibaba, concret
Nu este modelul de varf. Echipa Qwen il defineste deschis ca o previzualizare experimentala a arhitecturii care va sustine Qwen4, nu ca un produs finit. E o alegere neobisnuita si trebuie citita ca atare: publica arhitectura in avans pentru ca dezvoltatorii sa se pregateasca pentru familia completa.
Cifrele din fisa oficiala:
| Caracteristica | Valoare |
|---|---|
| Parametri totali | 125 de miliarde |
| Parametri activi per token | 6 miliarde |
| N-gram embedding | 51 de miliarde |
| MTP (multi-token prediction) | 4 miliarde |
| Experti | 512, dintre care 10 rutati + 1 partajat |
| Layere | 48 |
| Context nativ | 262.144 token-uri |
| Context extensibil | 1.000.000 token-uri cu YaRN |
| Licenta | qwen-community-1.0 |
Este multimodal: accepta text, imagini si video. Si gandeste implicit, cu modul thinking activ si trei niveluri de efort (low, medium, xhigh).
Cele trei noutati arhitecturale care conteaza
Qwen Sparse Attention
Perechea Gated DeltaNet plus Gated Attention a fost refacuta prin introducerea QSA. Diferenta practica: in loc sa selecteze token-urile individuale de procesat, QSA lucreaza la nivel de micro-bloc, cu un buget de 512 blocuri sau 2.048 de token-uri. Rezultatul declarat este o reducere neta a latentei pe contextele lungi.
Nu e un detaliu academic. Sarcinile agentice — un agent care citeste un repository, ruleaza douazeci de minute, acumuleaza context — sunt exact cazul in care latenta pe contexte lungi te omoara. Qwen a optimizat pentru asta.
N-gram Embedding
Asta e partea cea mai interesanta, si revin imediat asupra ei. Modelul indexeaza 20 de milioane de bigrame si trigrame la al doilea layer. Sunt 51 de miliarde de parametri in plus, dar de un tip aparte.
Fisa oficiala e explicita in privinta motivului: embedding-urile permit cresterea numarului de parametri cerand mai putin calcul, si sunt mai potrivite pentru offloading decat Mixture-of-Experts. Modelul a fost proiectat gandindu-se la acceleratoare cu memorie putina.
Gated Residual
Moduleaza informatia care curge prin residual stream-urile largite printr-un gate de citire element cu element si un gate de scriere scalar pe ramura. In practica: mai multa expresivitate intre layere fara a pierde stabilitatea la antrenare, si cu overhead neglijabil la inferenta.
Benchmark-urile, citite cinstit
Publicatiile anglo-saxone au titrat "bate Opus 4.6". E adevarat pe mai multe randuri, si e adevarat ca aceste cifre vin de la un model care activeaza 6 miliarde de parametri, fata de modele enorm mai mari.
| Benchmark | Qwen3.8-Flash-Next | Claude Opus 4.6 |
|---|---|---|
| SWE-bench Pro | 62,5 | 53,4 |
| SWE-bench Multilingual | 81,0 | 77,5 |
| LiveCodeBench v6 | 91,9 | 88,8 |
| GPQA Diamond | 91,7 | 91,3 |
| IFBench | 81,3 | 62,5 |
| HLE | 35,9 | 40,0 |
Acum partea pe care titlurile o sar.
Sunt benchmark-uri auto-raportate. Qwen le-a rulat, pe Qwen. Nu e o vina, o fac toti, dar trebuie spus.
Doua benchmark-uri sunt interne. CoWorkBench si RecreationBench sunt definite chiar de fisa tehnica drept benchmark-uri "in-house". Un test construit in casa de cel care prezinta modelul nu poate fi verificat de nimeni.
La HLE pierde. Rationamentul multidisciplinar ramane terenul lui Opus, cu 40,0 fata de 35,9. Iar la NL2Repo-Bench modelul ia 48,1, in urma lui DeepSeek-V4-Flash care face 54,2.
O nota curioasa care spune multe despre starea domeniului: scorul HLE a fost judecat de GPT-4o. Un model care evalueaza alt model.
Punctul care priveste pe cine lucreaza local
Aici ajungem la motivul pentru care aceasta lansare conteaza mai mult decat altele.
In articolul despre mini PC-ul Ryzen AI Max+ 395 am explicat regula care guverneaza viteza unui LLM local: latimea de banda a memoriei impartita la dimensiunea modelului. Un model dens de 70B cuantizat cantareste 40 GB, iar pe 215 GB/s latime de banda reala iti da circa 5 token-uri pe secunda. Lent.
Cu un MoE calculul se schimba radical, pentru ca la fiecare token se activeaza doar parametrii expertilor selectati. Aici vorbim de 6 miliarde active din 125. Modelul trebuie sa stea integral in memorie, dar latimea de banda pe care o consuma pentru a genera fiecare token este cea a unui model mic.
Adauga faptul ca cele 51 de miliarde de n-gram embedding sunt proiectate sa fie descarcate in afara memoriei acceleratorului, si obtii un model cu cunostintele unui 125B si costul de banda al unui 6B.
Pe hartie este combinatia ideala pentru hardware-ul cu memorie unificata. Pe o masina cu 128 GB, o cuantizare agresiva ar trebui sa il faca sa incapa, iar viteza ar trebui sa fie mult superioara celei a unui model dens de 70B.
Ar trebui. Nu l-am incercat inca si nu exista benchmark-uri independente pe aceasta clasa de hardware. Sunt calcule facute pe arhitectura, nu masuratori. Cand voi avea cifre reale le public aici.
Vestea buna e ca ecosistemul s-a miscat deja: in momentul in care scriu exista deja zeci de cuantizari facute de comunitate, utilizabile cu llama.cpp, Ollama, LM Studio si Jan. Cine vrea sa incerce nu trebuie sa astepte.
Cat costa prin API
Alibaba a stabilit pretul pentru Flash-Next la 0,16 dolari la milionul de token-uri de intrare si 0,47 la milionul de iesire. Este un pret agresiv, facut posibil chiar de eficienta la inferenta: multi parametri, putini activi, cost mic.
Modelul este open-weight, deci il poti si self-hosta. Si aici trebuie facuta o consideratie care valoreaza mai mult decat lista de preturi.
Intrebarea pe care si-o pune o firma din Europa
Arun Chandrasekaran, analist Gartner, a comentat lansarea spunand ca firmele ar trebui sa evalueze daca are sens sa self-hosteze modelul in loc sa il consume prin API, si ca trebuie luate in calcul rezidenta datelor si implicatiile de securitate legate de furnizorii chinezi. Concluzia lui: pretul mic singur nu poate fi criteriul de alegere.
Tradus pentru o firma mica sau mijlocie:
- Daca folosesti API-ul, prompturile tale calatoresc catre infrastructura Alibaba. Pentru date de firma sensibile asta e o chestiune de GDPR, nu de preferinta tehnica
- Daca descarci greutatile si il rulezi tu, problema dispare complet. Datele nu ies, iar modelul ramane identic si daca maine se schimba termenii serviciului
Faptul ca un model de acest nivel este open-weight schimba calculul. Pana ieri, cine voia sa ramana in casa trebuia sa accepte modele sensibil mai slabe. Azi mai putin.
Intrebari frecvente
Ce este Qwen3.8-Flash-Next?
Este un model lingvistic multimodal open-weight lansat de Alibaba pe 26 august 2026. Are 125 de miliarde de parametri totali, dar activeaza doar 6 pentru fiecare token gratie arhitecturii Mixture-of-Experts. Este previzualizarea arhitecturii care va fi folosita in Qwen4.
Qwen3.8-Flash-Next se poate folosi gratis?
Greutatile pot fi descarcate liber de pe Hugging Face si ModelScope cu licenta qwen-community-1.0, deci il poti rula pe hardware-ul tau fara sa platesti nimic. Accesul prin API-ul Qwen Cloud este in schimb pe consum.
Ce diferenta este intre Qwen3.8-Flash-Next si Qwen3.8-Flash?
Flash-Next este versiunea open-weight experimentala. Qwen3.8-Flash este versiunea oficiala de productie, cu un context de un milion de token-uri activ implicit si unelte integrate.
E nevoie de o placa video puternica pentru Qwen3.8-Flash-Next?
E nevoie mai ales de multa memorie, pentru ca cele 125 de miliarde de parametri trebuie incarcate. Dar fiindca activeaza doar 6 per token, latimea de banda ceruta in timpul generarii este mica. Asta il face potrivit pentru sisteme cu memorie unificata incapatoare, mai degraba decat pentru placi video cu VRAM putin.
Qwen3.8-Flash-Next e mai bun decat Claude Opus 4.6?
Pe benchmark-urile de coding publicate de Qwen da, cu 62,5 fata de 53,4 la SWE-bench Pro. La HLE, care masoara rationamentul multidisciplinar, pierde cu 35,9 fata de 40,0. Scorurile sunt auto-raportate si inca neverificate de terti.
In concluzie
Qwen3.8-Flash-Next nu este cel mai inteligent model existent, iar Alibaba nici nu sustine asta. Este ceva mai util: dovada ca poti avea calitatea unui model mare la costul computational al unuia mic, cu greutatile descarcabile.
Pentru cine dezvolta software asta inseamna ca optiunea locala a incetat sa fie un compromis. Raman de verificat cifrele reale pe hardware real, si acesta e urmatorul test pe care il am in plan.
Daca evaluezi ce model sa adopti pentru firma ta si vrei sa intelegi daca are sens cloud-ul sau self-hosting-ul, scrie-mi. Gasesti tabloul complet si in serviciile de automatizari AI si de agenti AI. Alte materiale sunt pe blogul in romana.



