Foto: William Henry Fox Talbot / rawpixel, domínio público
Modelos abertos(ver a linha do tempo)

Projeto aberto Colibrì roda modelo de 744 bilhões de parâmetros em notebook sem GPU

26 set, 06:01Nível de hype: ProdutoOrigem: Global

O Colibrì, projeto de código aberto em C publicado no GitHub por um desenvolvedor identificado como JustVugg, permite rodar grandes modelos do tipo "mistura de especialistas" em computadores comuns. A ideia é manter na memória só a parte usada em todo passo, cerca de 9,9 GB no GLM-5.2, e buscar no SSD apenas os especialistas escolhidos para cada token.

Com isso, o GLM-5.2, de 744 bilhões de parâmetros e cerca de 372 GB em int4, roda com 16 a 24 GB de RAM. O projeto já suporta nove famílias de modelos, incluindo DeepSeek V4 Flash, Qwen e o Kimi K3, de 2,8 trilhões de parâmetros, que exige cerca de 1,6 TB de disco e 32 GB de RAM. Segundo o QbitAI, o repositório tem cerca de 32 mil estrelas.

A velocidade é baixa: cerca de 0,05 a 0,1 token por segundo no computador de 25 GB sem cache e perto de 1,8 token por segundo num desktop com 128 GB de RAM. O programa usa cache e tenta prever quais especialistas serão usados na camada seguinte.

O que muda pra você

Dev
Dá para testar modelos grandes localmente sem GPU, desde que a velocidade baixa não seja problema.
PM
Útil para protótipos offline e testes com dados sensíveis, não para uso interativo.
Executivo
Rodar modelos grandes em casa fica possível, mas ainda não substitui servidores para uso em produção.
Investidor
Técnicas que usam SSD como memória reduzem a barreira de hardware para modelos abertos.
Educador
Bom exemplo para explicar como funcionam os modelos de "mistura de especialistas".