Pular para o conteúdo
IA na China(ver a linha do tempo)Foto: rawpixel, domínio público

DeepSeek reduz a um quarto a memória que o modelo gasta por token no V4.1-Flash

18 de setembro de 2026Nível de hype: ProdutoOrigem: China

Compartilhar
WhatsAppLinkedIn

A DeepSeek publicou em 17 de setembro no arXiv o relatório técnico do DeepSeek-V4.1-Flash, modelo multimodal de mistura de especialistas colocado em serviço em 10 de setembro, com 552 bilhões de parâmetros, contexto de até 1 milhão de tokens e pesos publicados.

O foco do relatório é a compressão do cache de chaves e valores, a memória que o modelo guarda de cada token já lido. O total cai para 890 bytes por token, cerca de um quarto do DeepSeek-V4-Flash. Segundo o ActuIA, os autores partem do uso real: agentes de longo prazo releem sem parar um contexto crescente, muito mais do que geram texto, e o custo passa a vir sobretudo da leitura.

O que muda pra você

Dev
Menos memória por token permite servir contextos longos e mais usuários por GPU.
PM
Agentes com contexto longo ficam mais baratos de operar com modelos assim.
Ver para outros perfis (Executivo, Investidor, Educador)
Executivo
O custo de rodar agentes depende cada vez mais da eficiência de memória, não só do preço por token.
Investidor
A DeepSeek segue competindo por eficiência, o que pressiona preços de inferência.
Educador
Bom caso para explicar por que a memória é o gargalo de modelos com contexto longo.
Achou útil? Compartilhe
Reportar um erro
O que há de errado?

Não pedimos nome nem e-mail.

Destaques de hoje no Sinal.AI

Ver tudo o que importa hoje