Fuente
AI vs 314rock | Я до вас з AI-інженерними новинами:Вчора зʼявиився дуже цікавий open-s...
1 530 Vistas/Alcance
2026-07-12 14:02
Mensaje №247
Я до вас з AI-інженерними новинами:
Вчора зʼявиився дуже цікавий open-source проект від соло-розробника
🫴🏻
Colibri – це такий інференс двигун для AI, який дозволяє запускати величезні MoE LLM навіть на 1Т параметрів і все це на звичайних ноутбуках/ПК з 25+ GB RAM
Тобто стало можливим запустити флагманську локалку GLM 5.2 (744 мільярди параметрів) прямо на домашньому ПК без топ GPU 🤌🏻
Як це працює?
Двіжок написаний на чистому C (один файл на 2400 рядків, zero dependencies, без Python/GPU/BLAS).
Він тримає в RAM тільки щільну частину моделі (10 ГБ в int4), а тисячі routed experts (370 ГБ) stream’ить з SSD диска (NVMe) на вимогу з розумним LRU-кешем, prefetching та OS page cache. Модель активує лише 40B параметрів на токен.
👉🏻 З очевидних мінусів:
Швидкість дуже низька - всього 1 токен на секунду (для більшої швидкості до 40 t/s чекаємо GLIMPSE)
І треба бути обережними - заміряйте температуру вашого SSD (!)
Коротка інструкція запуску:
git clone https://github.com/JustVugg/colibri && cd colibri/c && ./setup.sh
Завантажте модель (вона важить десь 370 ГБ) з HF (рекомендую з int8 MTP-head для кращого speculation).
COLI_MODEL=/шлях/до/model ./coli plan --ram 48 та ./coli doctor
Запуск: COLI_MODEL=... ./coli chat --ram 48 (можна додати PILOT=1 для prefetch).
Вчора зʼявиився дуже цікавий open-source проект від соло-розробника
🫴🏻
Colibri – це такий інференс двигун для AI, який дозволяє запускати величезні MoE LLM навіть на 1Т параметрів і все це на звичайних ноутбуках/ПК з 25+ GB RAM
Тобто стало можливим запустити флагманську локалку GLM 5.2 (744 мільярди параметрів) прямо на домашньому ПК без топ GPU 🤌🏻
Як це працює?
Двіжок написаний на чистому C (один файл на 2400 рядків, zero dependencies, без Python/GPU/BLAS).
Він тримає в RAM тільки щільну частину моделі (10 ГБ в int4), а тисячі routed experts (370 ГБ) stream’ить з SSD диска (NVMe) на вимогу з розумним LRU-кешем, prefetching та OS page cache. Модель активує лише 40B параметрів на токен.
👉🏻 З очевидних мінусів:
Швидкість дуже низька - всього 1 токен на секунду (для більшої швидкості до 40 t/s чекаємо GLIMPSE)
І треба бути обережними - заміряйте температуру вашого SSD (!)
Коротка інструкція запуску:
git clone https://github.com/JustVugg/colibri && cd colibri/c && ./setup.sh
Завантажте модель (вона важить десь 370 ГБ) з HF (рекомендую з int8 MTP-head для кращого speculation).
COLI_MODEL=/шлях/до/model ./coli plan --ram 48 та ./coli doctor
Запуск: COLI_MODEL=... ./coli chat --ram 48 (можна додати PILOT=1 для prefetch).