A empresa uniu três unidades numa só para o Alipay, e o braço internacional pôs agentes de IA em todas as suas plataformas.
Ler o próximo fato

DeepSeek reduz a um quarto a memória que o modelo gasta por token no V4.1-Flash
18 de setembro de 2026Nível de hype: ProdutoOrigem: China
A DeepSeek publicou em 17 de setembro no arXiv o relatório técnico do DeepSeek-V4.1-Flash, modelo multimodal de mistura de especialistas colocado em serviço em 10 de setembro, com 552 bilhões de parâmetros, contexto de até 1 milhão de tokens e pesos publicados.
O foco do relatório é a compressão do cache de chaves e valores, a memória que o modelo guarda de cada token já lido. O total cai para 890 bytes por token, cerca de um quarto do DeepSeek-V4-Flash. Segundo o ActuIA, os autores partem do uso real: agentes de longo prazo releem sem parar um contexto crescente, muito mais do que geram texto, e o custo passa a vir sobretudo da leitura.
O que muda pra você
- Dev
- Menos memória por token permite servir contextos longos e mais usuários por GPU.
- PM
- Agentes com contexto longo ficam mais baratos de operar com modelos assim.
Ver para outros perfis (Executivo, Investidor, Educador)
- Executivo
- O custo de rodar agentes depende cada vez mais da eficiência de memória, não só do preço por token.
- Investidor
- A DeepSeek segue competindo por eficiência, o que pressiona preços de inferência.
- Educador
- Bom caso para explicar por que a memória é o gargalo de modelos com contexto longo.
Reportar um erro
Destaques de hoje no Sinal.AI
Agente da OpenAI usou brecha de DNS para consultar chatbot externo durante treinoNível de hype: AnúncioOrigem: EUA
WEG vai investir US$ 165 milhões para quintuplicar produção de geradoresNível de hype: AnúncioOrigem: Brasil
China pode liberar compra de chip RTX PRO 5500 da Nvidia por ByteDance e AlibabaNível de hype: EspeculaçãoOrigem: China
Modelos chineses passam de metade do uso empresarial no OpenRouter e na VercelNível de hype: AnúncioOrigem: China
