CLM-8B este un decision model open source lansat pe 23 septembrie 2026 de cercetatori de la Stanford si NVIDIA. Nu scrie text: primeste starea unui agent AI si o lista de actiuni posibile, apoi o alege pe cea potrivita comparand vectori. In testele autorilor este de pana la 9 ori mai rapid decat Jev de la TypeSafe, are ponderi cu licenta Apache 2.0 si ruleaza pe un singur GPU NVIDIA.
In acest ghid iti explic ce este CLM-8B, cum functioneaza, cum il instalezi in cinci pasi si mai ales cand merita folosit intr-un proiect real pentru o firma din Romania. Citesc cifrele cu prudenta, pentru ca o parte din rezultate au fost masurate pe subseturi de benchmark si cu module antrenate special.
CLM-8B pe scurt: ce trebuie sa stii
- Ce este: primul Contrastive Language Model (CLM) deschis, un model care alege intre optiuni cunoscute in loc sa genereze cuvinte.
- Cine l-a facut: proiectul este condus de Jacky Kwok de la Stanford, impreuna cu Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Marco Pavone, Christopher Re si Azalia Mirhoseini. Codul este publicat de organizatia Contrastive-LM.
- Baza: un Qwen3-8B inghetat plus doua module mici de proiectie, de aproximativ 20 de milioane de parametri fiecare.
- Licenta: Apache 2.0 pentru cod si ponderi, deci utilizarea comerciala este permisa.
- Viteza: pana la 9 ori mai rapid decat Jev in cel mai bun test, aproximativ de 13 ori cu circa o mie de actiuni candidate.
- Cost: fara abonament. Platesti doar hardware-ul sau serverul GPU pe care il rulezi.
Ce este un decision model AI si de ce se vorbeste atat de el
Un decision model AI este un model construit pentru un singur lucru: sa ia o decizie rapida in interiorul unui software. Ii dai un context (un tichet, ecranul unui agent, rezultatul unui tool) si o intrebare cu raspunsuri deja definite. El returneaza optiunea cea mai probabila, cu un scor.
Un LLM clasic, in schimb, genereaza text token cu token. Chiar daca ai nevoie doar de numele unei functii, trebuie sa citeasca tot promptul si sa scrie raspunsul cuvant cu cuvant. Pentru o singura decizie nu conteaza mult. Pentru un agent care ia zeci de micro-decizii la fiecare sarcina, milisecundele se aduna.
Categoria a explodat in septembrie 2026 odata cu Jev de la TypeSafe, care a numit aceste modele "System One", dupa Sistemul 1 al lui Daniel Kahneman: gandirea rapida si automata. In saptamanile urmatoare au aparut CLM-8B si propunerile OpenAI, Cloudflare, AWS, Perplexity si Microsoft. Daca vrei sa intelegi modelul de la care a pornit totul, am scris un ghid despre ce este Jev de la TypeSafe si cum il folosesti in cod.
Cum functioneaza CLM-8B: doua encodere, un singur spatiu
Ideea este simplu de explicat. CLM-8B transforma starea curenta intr-un vector si transforma si fiecare actiune posibila intr-un vector, in acelasi spatiu. Apoi calculeaza cat de apropiati sunt (produs scalar plus softmax) si returneaza o distributie de probabilitate pe actiuni. Castiga actiunea cea mai apropiata de stare.
Arhitectura
Dedesubt este un Qwen3-8B inghetat, adica neantrenat din nou, folosit ca motor de intelegere a textului. Deasupra sunt doua module de proiectie: unul pentru stari, unul pentru actiuni. Sunt singurele parti antrenate, aproximativ 20 de milioane de parametri fiecare. Fisierul pe care il descarci la prima pornire are 75 MB.
De aceea se numeste "8B": numarul se refera la backbone, nu la partea antrenata. Este acelasi principiu ca embedding-urile din sistemele RAG, aplicat insa alegerii unei actiuni in loc de cautarea unui document.
Antrenarea in trei etape
Modelul este antrenat cu InfoNCE, o functie de pierdere contrastiva care apropie fiecare stare de actiunea corecta si o departeaza de cele gresite. Etapele declarate sunt trei:
- Pre-training pe aproximativ 60 de milioane de perechi intrebare si raspuns din setul Nemotron DQA al NVIDIA.
- Mid-training pe aproximativ 30 de milioane de "hard negatives" sintetice, adica raspunsuri plauzibile dar gresite, generate cu Gemini 2.5 Flash-Lite.
- Post-training pe aproximativ 1 milion de traiectorii de agenti, cu un mix de 40% date Nemotron si 60% date agentice.
Autorii raporteaza efectul fiecarei etape pe aproximativ 100.000 de intrebari excluse din antrenare: 52,1% acuratete top-1 dupa pre-training, 69,2% dupa mid-training.
De ce este atat de rapid: cache-ul actiunilor
Aici este diferenta reala fata de Jev. Potrivit lui Kwok, Jev si Laya pun in cache mai ales reprezentarea starii. CLM, avand doua encodere separate, poate calcula si pastra si vectorii actiunilor.
Gandeste-te la un agent IT intern care alege mereu dintre aceleasi 50 de operatiuni aprobate: resetare parola, deschidere tichet, escaladare la echipa de securitate. Cu CLM codifici cele 50 de actiuni o singura data. La fiecare cerere calculezi doar starea noua si compari vectorii. Cu cat ai mai multe actiuni, cu atat avantajul creste.
CLM-8B vs Jev: cifrele declarate
Acestea sunt rezultatele publicate de echipa. Primele patru randuri sunt teste zero-shot, adica fara antrenare specifica.
| Test | CLM-8B | Jev | Latenta CLM-8B | Latenta Jev |
|---|---|---|---|---|
| Jocul T-Rex din Chrome | 5/5 | 5/5 | 16,5 ms | 149,8 ms |
| Super Mario | 5/5 | 5/5 | 33,5 ms | 132,6 ms |
| Tool calling (BFCL v4) | 95,2% | 99,2% | 76,8 ms | 125,5 ms |
| WikiRacing | 26/30 | 30/30 | 79,8 ms | 225 ms |
| Verificare patch DeepSWE (38 task-uri) | 81,6% | 71,1% | 79 ms | 449 ms |
| Terminal-Bench 2.1 (30 task-uri) | 87,6% | 83,1% | 32 ms | 131 ms |
Cum citesti aceste cifre fara sa te pacalesti
- "De 9 ori" vine dintr-un singur test: jocul T-Rex, unde aceleasi actiuni se repeta la fiecare stare. La tool calling avantajul este de aproximativ 1,6 ori.
- La tool calling pur CLM pierde: 95,2% fata de 99,2%. Intr-un flux unde un tool gresit costa scump, cele 4 puncte conteaza.
- Rezultatele pe cod folosesc module antrenate special si subseturi de 38 si 30 de task-uri, nu clasamentele complete. Solutiile candidate au fost scrise de Claude Opus 5 si Fable 5: CLM a ales doar pe cea mai buna.
- Jev este inchis, deci comparatia nu poate fi reprodusa de terti. La fel pentru toate cifrele furnizorilor din aceasta categorie.
Un detaliu interesant: pe cele doua probe de cod, alegerea facuta de Jev da un rezultat mai slab decat pass@1, adica mai slab decat o singura incercare. CLM in schimb imbunatateste rezultatul (81,6% fata de 73,7% pe DeepSWE).
Cum instalezi CLM-8B in 5 pasi
Ai nevoie de un server Linux cu un GPU NVIDIA. Autorii folosesc un RTX 4090 pentru benchmark-urile locale si un H100 pentru latentele verificatorului. Acestia sunt pasii din repository-ul oficial.
- Instaleaza pachetul cu
pip install contrastive-lm. Daca vrei si torch, vLLM si dependentele exemplelor, cloneaza repository-ul de pe GitHub si folosestepip install -r requirements.txt. - Porneste encoderul Qwen3-8B cu vLLM in modul pooling:
vllm serve Qwen/Qwen3-8B --served-model-name qwen3-8b --runner pooling --max-model-len 2048 --port 8090. - Porneste serverul CLM cu
clm-serve. La prima pornire descarca modulul de referinta de 75 MB si deschide API-ul pe portul 8700. - Testeaza playground-ul deschizand
http://localhost:8700/: scrii o stare, adaugi intrebarile si vezi distributia raspunsurilor. Fiecare cerere apare si ca JSON, curl si Python. Daca serverul este la distanta, redirectioneaza portul prin SSH. - Conecteaza-l la codul tau cu clientul Python
CLMClientsi metodasystem_one(state, questions), sau prin HTTP pePOST /v1/systemonesiPOST /v1/rank.
Atentie la un detaliu pe care aproape nimeni nu il mentioneaza: cu configuratia implicita starile de peste 2.048 de tokeni sunt trunchiate. Daca trimiti conversatii lungi sau pagini intregi, trebuie sa cresti impreuna --max-model-len in vLLM si --max-tokens in clm-serve, si sa iei in calcul mai multa memorie GPU.
Cele trei intrebari pe care le poti pune lui CLM-8B
API-ul este compatibil cu cel al TypeSafe, deci cine a integrat deja Jev il poate testa schimband cateva randuri. Primitivele sunt trei, plus o functie de ranking:
- Noul: probabilitatea ca o afirmatie sa fie adevarata. Exemplu: "clientul cere o rambursare?".
- Choice: o singura optiune dintr-un set declarat, cu probabilitatile tuturor. Exemplu: la ce departament trimit tichetul.
- Score: pozitia pe o scala ordonata. Exemplu: urgenta de la 1 la 5.
- Rank: ordoneaza candidati liberi de la cel mai bun la cel mai slab. Exemplu: care dintre patru patch-uri de cod il propui.
Fiecare raspuns raporteaza si tokenii folositi si latenta in milisecunde, util ca sa masori castigul real pe cazul tau.
Fine-tuning: se antreneaza doar modulele
Backbone-ul ramane inghetat, deci ca sa adaptezi CLM la domeniul tau antrenezi doar cele doua module de 20 de milioane de parametri, cu scriptul train/finetune.py. Costul este mult mai mic decat fine-tuning-ul unui LLM intreg.
Unde as folosi CLM-8B intr-o firma din Romania
Cand construiesc agenti AI si automatizari AI pentru firme, partea lenta aproape niciodata nu este raspunsul final. Sunt deciziile intermediare: ce tool apelez, daca un email este urgent, daca agentul o ia pe un drum gresit. Acolo un decision model ca CLM-8B poate avea sens.
Triajul tichetelor si al cererilor
Un departament de suport primeste emailuri, formulare si mesaje. Cu o intrebare Choice decizi departamentul, cu Score urgenta, cu Noul daca e nevoie de un om. Departamentele sunt mereu aceleasi, deci vectorii lor raman in cache.
Clasificarea documentelor primite
O firma care primeste facturi prin e-Factura din SPV-ul ANAF le poate trimite automat pe categoriile de cheltuieli folosite in contabilitate. Categoriile sunt fixe, deci se potrivesc bine cu cache-ul actiunilor. Cazurile cu scor mic merg la contabil.
Alegerea tool-ului intr-un agent
Un agent cu 30 sau 40 de unelte fixe este cazul ideal pentru cache-ul actiunilor. Aici insa tine minte 95,2% fata de 99,2% pe BFCL v4: eu as pune un prag de incredere si, sub el, as trimite decizia la un LLM mai lent.
Verificarea muncii unui model mai mare
Este impartirea sarcinilor propusa chiar de Kwok: modelele mari genereaza si rationeaza, CLM-urile selecteaza, verifica si monitorizeaza. Un agent de coding produce patru solutii, CLM alege pe care o deschizi in pull request.
Monitorizarea unui agent care lucreaza mult timp
Autorii au observat scoruri destul de separate intre traiectoriile reusite si cele esuate. Poate semnala un agent care deviaza, dar nu este un mecanism de securitate garantat. Pentru a izola cu adevarat un agent ai nevoie de unelte ca NVIDIA OpenShell si de permisiuni bine configurate.
Limitele CLM-8B
- Alege doar dintre optiunile pe care i le dai. Daca toti candidatii sunt gresiti, tot va indica unul drept cel mai bun. Probabilitatile sunt relative la set, nu absolute.
- Nu inlocuieste un LLM. Fara texte lungi, matematica sau planificare deschisa. O spune clar si Kwok.
- Este legat de Qwen3-8B. Modulul functioneaza doar cu embedding-urile acelui encoder.
- Nu este usor. Encoderul ramane de 8 miliarde de parametri: ai nevoie de un GPU serios, nu de orice laptop.
- Nicio comparatie de cost. Autorii nu au publicat o comparatie in euro sau dolari cu API-urile modelelor frontier.
- Generalizarea este limitata la aceasta scara, cum recunoaste chiar fisa modelului.
CLM-8B, Jev sau un LLM clasic: cum alegi
| Situatie | Ce as folosi |
|---|---|
| Datele nu trebuie sa iasa din firma | CLM-8B local (ponderi deschise) |
| Multe actiuni fixe refolosite la fiecare cerere | CLM-8B, cu cache-ul actiunilor |
| Acuratete maxima la tool calling, fara GPU propriu | Jev prin API |
| Trebuie explicat de ce s-a luat decizia | Un LLM cu rationament |
| Raspunsuri deschise, texte, rezumate | Un LLM generativ |
De multe ori raspunsul corect este o cascada: decision model-ul rezolva cazurile clare peste un prag de incredere, restul merge la un LLM sau la un om.
Confidentialitate si GDPR: avantajul ponderilor deschise
Cu un serviciu API ca Jev, fiecare tichet sau email pe care il clasifici ajunge la un furnizor extern. Cu CLM-8B instalat pe serverul tau, datele raman in firma. Pentru o companie din Romania care prelucreaza date ale clientilor (nume, CNP, adrese), asta simplifica mult evaluarea GDPR si discutia cu responsabilul de protectia datelor, inclusiv in fata ANSPDCP.
Faptul ca backbone-ul este Qwen, dezvoltat de Alibaba, nu schimba acest punct: ponderile ruleaza local si nu trimit date nimanui. Detaliez in articolul despre modelele AI chinezesti open source pentru firme. Licenta Apache 2.0 se aplica atat lui CLM-8B, cat si lui Qwen3-8B.
Ce urmeaza: CLM-35B-A3B
Echipa antreneaza CLM-35B-A3B, o versiune multimodala cu arhitectura mixture of experts, anuntata pentru inceputul lui octombrie 2026. Azi, 11 octombrie, pe pagina Hugging Face a Contrastive-LM sunt inca doar CLM-v0.1-8B si modulele pentru DeepSWE. Daca apare cum s-a promis, va putea alege o actiune uitandu-se direct la un screenshot, nu la descrierea lui in text.
Citeste si
- Jev TypeSafe AI: ce este si cum il folosesti in cod
- NVIDIA OpenShell: ce este si cum il instalezi
- AI chinezesc open source: modelele pe care le recomand
Concluzie: CLM-8B este o piesa a agentului, nu agentul
CLM-8B nu este un concurent pentru Claude sau GPT. Este o componenta: piesa care ia deciziile mici si repetate dintr-un agent, in cateva milisecunde si pe hardware-ul tau. Are sens cand optiunile sunt cunoscute si se repeta, cand datele trebuie sa ramana in firma si cand latenta conteaza.
Inainte sa il adopti, masoara acuratetea pe datele tale si nu te baza doar pe cifrele declarate. Daca vrei sa afli daca un decision model iti poate accelera agentii sau automatizarile, scrie-mi si ne uitam impreuna la cazul tau.



