Din cand in cand apare pe GitHub un proiect care te face sa citesti descrierea de doua ori. Colibri e unul dintre ele: un motor de inferenta scris in C pur, fara nicio dependenta, care ruleaza GLM 5.2 local, adica un model de 744 de miliarde de parametri, pe un calculator obisnuit cu aproximativ 25 GB de RAM. Fara GPU. Fara Python la rulare. Fara nici macar o biblioteca BLAS.
Proiectul, publicat de dezvoltatorul JustVugg sub licenta Apache 2.0, a explodat in comunitatea tech si a trecut deja de 13.400 de stele pe GitHub. Numele nu e intamplator: pasarea colibri cantareste cativa grame, dar viziteaza sute de flori pe zi. Motor minuscul, model imens.
Mi-am petrecut o seara intreaga pe repository si pe documentatie. In ghidul asta iti explic cum functioneaza trucul, cat de mare e modelul de fapt, cum il instalezi pas cu pas (evitand greseala care pacaleste jumatate din comunitate) si, cu cifrele reale pe masa, pentru cine are sens sa rulezi GLM 5.2 local cu Colibri.
Ce este Colibri si de ce vorbeste toata lumea despre el
Colibri este un runtime pentru modele Mixture-of-Experts (MoE) care trateaza VRAM-ul, RAM-ul si discul ca pe o singura ierarhie de memorie. Tot motorul sta intr-un singur fisier C de aproximativ 2.400 de linii (c/glm.c) plus cateva headere. Se compileaza cu gcc si OpenMP, iar la rulare nu mai ai nevoie de nimic altceva.
Modelul pe care il ruleaza este GLM 5.2 de la Z.ai, cu greutatile publicate sub licenta MIT, azi unul dintre cele mai puternice modele open-weight pe benchmark-urile de programare.
Daca urmaresti valul de modele open din China, l-am pus in context si in ghidul despre cele mai bune modele AI chinezesti open source.
In mod normal, un model de clasa frontier ca asta cere un cluster de GPU-uri de zeci de mii de euro. Colibri il transforma in GLM 5.2 local: raspunde incet, dar corect, pe o masina care, cum scrie chiar autorul, costa mai putin decat un ventilator de H100.
Cat de mare e GLM 5.2 si de ce nu incape in RAM
Una dintre cele mai cautate intrebari e "glm 5.2 size". Raspunsul scurt: foarte mare. Checkpoint-ul oficial in FP8 are aproximativ 756 GB. Versiunea cuantizata la int4 pe care o foloseste Colibri ca sa ruleze GLM 5.2 local ajunge la circa 370 GB pe disc. Niciun PC de acasa nu are atata memorie, iar un setup clasic cu GPU-uri ar avea nevoie de sute de GB de VRAM.
Aici intervine arhitectura MoE. Din cei 744 de miliarde de parametri, doar aproximativ 40 de miliarde se activeaza pentru fiecare token. Si din acestia, doar in jur de 11 GB se schimba efectiv de la un token la altul: sunt "expertii" alesi de router-ul modelului.
Cum functioneaza trucul: expertii stau pe disc
Colibri profita de aceasta raritate si imparte modelul in doua:
- Partea densa (attention, expertii comuni, embedding-urile, circa 17 miliarde de parametri) ramane permanent in RAM, cuantizata la int4, si ocupa doar 9,9 GB;
- Cei 19.456 experti rutati (circa 19 MB fiecare la int4) stau pe disc, aproximativ 370 GB in total, si sunt incarcati in streaming doar cand router-ul ii cere, cu un cache LRU pe fiecare strat si cu page cache-ul sistemului de operare ca al doilea nivel, gratuit.
Pe scurt: ca sa ai GLM 5.2 local nu cumperi 400 GB de VRAM, folosesti NVMe-ul ca memorie lenta si platesti pretul in viteza. E acelasi principiu care face modelele MoE atat de interesante pentru uz local, despre care am scris si in articolul despre Qwen 3.8 Flash Next, un MoE de 125B pentru AI local.
Mai sunt doua detalii care fac motorul mai destept decat pare. Learning cache-ul inregistreaza ce experti foloseste de fapt munca ta (fisierul .coli_usage) si la pornire ii blocheaza in RAM pe cei mai folositi: Colibri devine literalmente mai rapid cu cat il folosesti mai mult. Iar persistenta KV-cache (.coli_kv) redeschide conversatiile "calde" si dupa un restart, fara re-prefill, cu rezultat identic byte cu byte fata de o sesiune neintrerupta.
Cerinte hardware: de ce ai nevoie ca sa rulezi GLM 5.2 local
Inainte sa te apuci de GLM 5.2 local, lista cinstita:
- Sistem de operare: Linux, WSL2, macOS sau Windows 11 nativ (prin MinGW-w64, port recent);
- Procesor: x86-64 cu AVX2 (pe Apple Silicon exista un backend Metal experimental);
- RAM: minim 16 GB, recomandat 25 GB sau mai mult. Cu cat ai mai mult, cu atat mai multi experti raman in cache;
- Disc: aproximativ 370-400 GB liberi pe un NVMe local (ext4 sau NTFS, niciodata un disc de retea);
- Toolchain: gcc cu OpenMP. Python iti trebuie doar pentru conversia unica a modelului.
Pentru modelele obisnuite, care incap complet in memorie, am facut separat calculul in ghidul cata RAM iti trebuie pentru un LLM local.
O veste linistitoare despre SSD: streaming-ul Colibri e doar citire, iar citirile nu uzeaza semnificativ discul.
Riscurile reale sunt swap-ul (daca depasesti RAM-ul) si temperaturile pe SSD-uri ieftine sub sarcina prelungita, asa ca urmareste-le. Daca iti alegi acum hardware-ul, am comparat configuratiile in ghidul despre cel mai bun computer pentru AI in 2026, in functie de buget si in analiza despre mini PC-ul cu Ryzen AI Max 395 si 128 GB pentru LLM local.
GLM 5.2 e gratis? Ce platesti de fapt
Alta intrebare frecventa: "glm 5.2 free". Da, in sensul ca greutatile modelului sunt sub licenta MIT, iar Colibri e sub Apache 2.0: nu platesti licente si nu platesti tokeni. Costul real pentru GLM 5.2 local e altul: hardware-ul (mai ales un NVMe incapator si cat mai mult RAM), curentul consumat si, mai ales, timpul. Un raspuns lung poate dura minute, nu secunde.
Daca vrei sa faci calculul complet intre abonamente cloud si hardware propriu, l-am facut pas cu pas in articolul AI local: cat costa si cand merita in 2026.
Cum instalezi Colibri pas cu pas
Ai doua drumuri: conversia facuta de tine sau modelul deja convertit. Iti recomand a doua varianta, cu un avertisment important pe care il vedem imediat.
1. Compileaza motorul
Cloneaza repository-ul si ruleaza setup-ul, care verifica gcc si OpenMP, compileaza si face self-test-ul:
git clone https://github.com/JustVugg/colibri && cd colibri/c && ./setup.sh
2. Descarca modelul corect (atentie la capcana MTP)
Aici se impotmolesc cei mai multi, si e cea mai raportata problema in issue-urile proiectului. Pe Hugging Face exista doua mirror-uri ale modelului int4 deja convertit, iar unul dintre ele iti injumatateste performanta fara sa observi.
Colibri foloseste speculative decoding-ul nativ al GLM 5.2 (capul MTP, multi-token prediction) ca sa genereze 2,2-2,8 tokeni per forward in loc de unul. Dar capul MTP trebuie sa fie cuantizat la int8: la int4, acceptarea draft-urilor scade la 0-4% si speculatia nu porneste niciodata. Mirror-ul original (jlnsrk) are capetele la int4. Foloseste in schimb clona cu capetele int8 deja corectate: mateogrgic/GLM-5.2-colibri-int4-with-int8-mtp. Cu ea, acceptarea masurata este de 39-59%.
Descarca-l pe un NVMe rapid si seteaza variabila de mediu:
COLI_MODEL=/nvme/glm52_i4 ./coli chat
3. Alternativa: conversia facuta de tine
Daca preferi sa pornesti de la zero, o singura comanda descarca GLM 5.2 in FP8 shard cu shard, il converteste la int4 si corecteaza capul MTP. Checkpoint-ul FP8 de 756 GB nu trebuie sa existe niciodata intreg pe disc, iar procesul poate fi reluat daca se intrerupe:
./coli convert --model /nvme/glm52_i4
4. Verificare si prima pornire
Inainte sa incarci modelul, doua comenzi de diagnostic iti spun daca configuratia tine: coli plan arata ierarhia de memorie planificata (disc, RAM, VRAM), iar coli doctor face o verificare de pregatire doar in citire. Apoi pornesti: incarcarea dureaza aproximativ 30 de secunde, cu 9,9 GB rezidenti si un varf de circa 20 GB in timpul chat-ului, limitat automat ca sa nu trezeasca niciodata OOM killer-ul.
API compatibil OpenAI si dashboard web
Colibri nu e doar un chat in terminal. Cu coli serve expui un API HTTP compatibil cu protocolul OpenAI (chat completions, streaming SSE, coada FIFO pentru cereri): orice unealta care vorbeste cu OpenAI poate vorbi si cu GLM 5.2 local, de la agenti la scripturi interne. Daca ai deja fluxuri n8n care cheama API-ul OpenAI, schimbi endpoint-ul si merg mai departe.
Daca vrei sa legi GLM 5.2 local de fluxurile tale, pentru genul asta de integrari am o pagina dedicata la automatizari n8n.
Cu coli web primesti un dashboard in browser cu metrici live (tokeni pe secunda, time-to-first-token, coada) si pagina Brain: expertii modelului afisati ca un cortex viu, unde culoarea arata nivelul de memorie si fiecare expert rutat clipeste alb. Te uiti literalmente la model cum gandeste. Ca dezvoltator, e cel mai frumos demo pe care l-am vazut anul asta.
Benchmark GLM 5.2 local: cat de rapid e de fapt
Autorul e primul care o spune: GLM 5.2 local pe Colibri nu e rapid. Pe masina lui de dezvoltare (12 nuclee, 25 GB RAM, NVMe de circa 1 GB/s prin WSL2), un token "la rece" costa circa 11 GB de citiri de pe disc, deci 0,05-0,1 tokeni pe secunda. Benchmark-urile comunitatii pe hardware mai bun arata insa o scara interesanta:
| Configuratie | Viteza (decode) |
|---|---|
| Laptop dezvoltator, 25 GB RAM, NVMe lent | 0,05-0,1 tok/s |
| MacBook M5 Max, 128 GB unificati | 1,06 tok/s, pana la 2,06 tok/s cu Metal si experti fixati in RAM |
| EPYC cu 430 GB RAM (98% cache hit) | 1,00 tok/s |
| Ryzen 9950X3D2 + NVMe PCIe 5.0 | 1,23 tok/s (cel mai rapid rezultat x86) |
| 6 x RTX 5090, toti expertii rezidenti | pana la 6,84 tok/s |
Doua parghii gratuite de stiut: --topp 0.7 reduce citirile de pe disc cu 30-40%, iar learning cache-ul imbunatateste cifrele de la o sesiune la alta (pe un Framework 13, comunitatea a urcat de la 0,29 la 0,40 tok/s doar incalzind cache-ul).
Despre calitate: o prima masuratoare din comunitate da containerului int4 o medie de 62,5% pe HellaSwag, ARC si MMLU, sub scorul full-precision. Masuratoarea e insa distorsionata de scoring-ul 0-shot, care penalizeaza modelele de tip reasoning, asa ca deocamdata e un dat, nu un verdict.
Colibri vs alte variante de AI local
Ca sa fiu cinstit: la 0,1-2 tokeni pe secunda, GLM 5.2 local nu inlocuieste ChatGPT pentru chat-ul de zi cu zi.
Daca vrei raspunsuri rapide pe hardware de acasa, un model mai mic ruleaza mult mai fluid. Am comparat optiunile in ghidul cele mai bune LLM locale in 2026: ce model alegi. Colibri joaca in alta liga: nu castiga la viteza, ci iti da acces la un model de clasa frontier pe care altfel nu l-ai putea rula deloc.
Pentru cine are sens Colibri (si pentru cine nu)
Are sens concret in urmatoarele cazuri:
- Confidentialitate totala: date medicale, juridice sau de firma care nu au voie sa iasa din masina. Un model frontier care raspunde fara niciun apel in retea, util si cand te gandesti la GDPR;
- Procesari batch peste noapte: rezumate de documente, analize, extragere structurata (exista chiar suport pentru gramatici GBNF, pentru output JSON constrans), pornite seara si gata dimineata;
- Experimente si cercetare: sa intelegi arhitecturile MoE pe un cod C lizibil de 2.400 de linii e aur curat, iar proiectul primeste benchmark-uri de pe hardware diferit;
- Plan B fata de preturile cloud: un model local pe hardware pe care il ai deja iti da putere de negociere fata de furnizorii de API.
Nu are sens daca ai nevoie de reactie imediata, de mai multi utilizatori simultan sau de un asistent pentru toata echipa. Acolo castiga un model mai mic sau un serviciu cloud bine ales.
Parerea mea de dezvoltator
Colibri e proiectul unui singur om, dezvoltat pe un laptop cu 25 GB de RAM, si demonstreaza ceva important: raritatea modelelor MoE face posibil ce parea imposibil.
Cand doar in jur de 5% din parametri sunt activi pentru fiecare token, nu ai nevoie de tot modelul in memorie rapida, ai nevoie de o ierarhie inteligenta. Iar cu NVMe-urile PCIe 5.0 care trec de 10 GB/s, abordarea asta nu poate decat sa se imbunatateasca.
Mai e si o lectie de inginerie: fara framework-uri, fara dependente, un fisier C pe care il poate citi si intelege oricine. Intr-un ecosistem in care fiecare proiect AI trage dupa el gigaocteti de biblioteci Python, e o gura de aer proaspat.
Colibri nu va castiga nicio cursa de viteza, dar muta o granita: GLM 5.2 local, un model de 744 de miliarde de parametri care raspunde corect pe PC-ul tau, gratis, dupa un git clone si o seara de download.
Daca te gandesti sa rulezi AI local in firma ta, pentru confidentialitate, costuri sau independenta fata de furnizori, si vrei sa afli daca un model self-hosted tine pentru cazul tau, scrie-mi: ma uit eu la hardware, volume si alternative si iti spun sincer ce merita.



