DeepSeek reduz a um quarto a memória que o modelo gasta por token no V4.1-Flash
A DeepSeek publicou em 17 de setembro no arXiv o relatório técnico do DeepSeek-V4.1-Flash, modelo multimodal de mistura de especialistas colocado em serviço em 10 de setembro, com 552 bilhões de parâmetros, contexto de até 1 milhão de tokens e pesos publicados.
O foco do relatório é a compressão do cache de chaves e valores, a memória que o modelo guarda de cada token já lido. O total cai para 890 bytes por token, cerca de um quarto do DeepSeek-V4-Flash. Segundo o ActuIA, os autores partem do uso real: agentes de longo prazo releem sem parar um contexto crescente, muito mais do que geram texto, e o custo passa a vir sobretudo da leitura.
Produto disponível
Modelo aberto publicado e relatório técnico com números verificáveis.
Critério: Qualquer pessoa pode usar hoje (pago ou grátis).
Fontes originais
Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.
O que muda pra você
- Dev
- Menos memória por token permite servir contextos longos e mais usuários por GPU.
- PM
- Agentes com contexto longo ficam mais baratos de operar com modelos assim.
- Executivo
- O custo de rodar agentes depende cada vez mais da eficiência de memória, não só do preço por token.
- Investidor
- A DeepSeek segue competindo por eficiência, o que pressiona preços de inferência.
- Educador
- Bom caso para explicar por que a memória é o gargalo de modelos com contexto longo.