
Projeto aberto Colibrì roda modelo de 744 bilhões de parâmetros em notebook sem GPU
26 set, 06:01Nível de hype: ProdutoOrigem: Global
O Colibrì, projeto de código aberto em C publicado no GitHub por um desenvolvedor identificado como JustVugg, permite rodar grandes modelos do tipo "mistura de especialistas" em computadores comuns. A ideia é manter na memória só a parte usada em todo passo, cerca de 9,9 GB no GLM-5.2, e buscar no SSD apenas os especialistas escolhidos para cada token.
Com isso, o GLM-5.2, de 744 bilhões de parâmetros e cerca de 372 GB em int4, roda com 16 a 24 GB de RAM. O projeto já suporta nove famílias de modelos, incluindo DeepSeek V4 Flash, Qwen e o Kimi K3, de 2,8 trilhões de parâmetros, que exige cerca de 1,6 TB de disco e 32 GB de RAM. Segundo o QbitAI, o repositório tem cerca de 32 mil estrelas.
A velocidade é baixa: cerca de 0,05 a 0,1 token por segundo no computador de 25 GB sem cache e perto de 1,8 token por segundo num desktop com 128 GB de RAM. O programa usa cache e tenta prever quais especialistas serão usados na camada seguinte.
O que muda pra você
- Dev
- Dá para testar modelos grandes localmente sem GPU, desde que a velocidade baixa não seja problema.
- PM
- Útil para protótipos offline e testes com dados sensíveis, não para uso interativo.
- Executivo
- Rodar modelos grandes em casa fica possível, mas ainda não substitui servidores para uso em produção.
- Investidor
- Técnicas que usam SSD como memória reduzem a barreira de hardware para modelos abertos.
- Educador
- Bom exemplo para explicar como funcionam os modelos de "mistura de especialistas".