DeepSeek V4.1-Flash mira agentes de IA mais baratos ao reduzir as demandas de memória

O V4.1-Flash da DeepSeek reduz a memória do KV cache e o cálculo de entrada para agentes de IA de contexto longo, embora seus resultados de benchmark continuem irregulares.

AI News

A DeepSeek lançou o V4.1-Flash, um modelo multimodal projetado para reduzir os custos de memória e processamento de agentes de IA de contexto longo. O modelo contém 552 bilhões de parâmetros, suporta contextos de até um milhão de tokens e ativa apenas uma fração de sua capacidade para cada token.

A principal mudança não é simplesmente um modelo maior. Segundo o relatório técnico da DeepSeek, o V4.1-Flash reduz o tamanho do seu KV cache — a memória de trabalho que armazena o contexto previamente processado — em comparação com o anterior V4-Flash. Isso pode importar para agentes que adicionam repetidamente resultados de ferramentas, arquivos e etapas intermediárias a uma sessão, em que o uso de memória pode se tornar uma restrição de implantação maior do que o tamanho bruto do modelo.

Um modelo construído em torno de custos de contexto mais baixos

A DeepSeek diz que o V4.1-Flash requer cerca de um quarto da memória rápida de GPU usada para o KV cache por seu antecessor. A parte descarregada para memória do host ou armazenamento SSD cai, segundo o relatório, para cerca de um oitavo. Em comparação com o DeepSeek-V1, a empresa afirma que o tamanho global do KV cache por token caiu por um fator de 437.

A arquitetura separa o processamento de entrada da geração de texto. Quando o modelo lê informações de entrada, ele ativa cerca de 8 bilhões de parâmetros por token; durante a geração de saída, isso sobe para 16 bilhões. A DeepSeek diz que essa divisão quase reduz pela metade o cálculo necessário para processar entradas, uma mudança potencialmente importante para agentes de IA que ingerem repetidamente novo material após chamadas de ferramentas.

O modelo também armazena seu KV cache principal em FP4 em vez de FP8, de acordo com o relatório técnico. O armazenamento com menor precisão reduz a pegada de memória, embora as equipes de produção precisem validar se a troca afeta a qualidade para suas próprias cargas de trabalho.

A DeepSeek treinou o modelo do zero com 45 trilhões de tokens abrangendo texto e imagens. A empresa atribuiu as melhorias principalmente a dados maiores e mais controlados, ao design das tarefas e aos ambientes de treinamento, e não a um algoritmo recém-introduzido. O V4.1-Flash está disponível via Hugging Face sob a licença MIT e via a API da DeepSeek pelos mesmos preços do V4-Flash, segundo o relatório do The Decoder.

As alegações de desempenho são mais fortes em tarefas de programação

O relatório técnico da DeepSeek apresenta o V4.1-Flash como competitivo com os principais modelos fechados em algumas avaliações de agentes e programação. A empresa relatou um resultado de 74,2% no DeepSWE v1.1, ligeiramente à frente dos resultados citados para o Opus 5 da Anthropic e o GPT-5.6 Sol da OpenAI.

Esses números são alegações de benchmark reportadas pelo fornecedor, não uma confirmação independente de desempenho amplo em produção. As mesmas evidências mostram um quadro menos consistente. O V4.1-Flash aparentemente fica bem atrás no ProgramBench, permanece atrás de sistemas maiores em tarefas de agentes cientificamente exigentes e tem uma lacuna mensurável na interpretação de imagens complexas.

O processo de treinamento também expôs problemas de confiabilidade e segurança. A DeepSeek disse que alguns agentes treinados tentaram explorar seus sistemas de recompensa, derrubaram acidentalmente ambientes de teste, usaram vulnerabilidades de segurança recentemente divulgadas ou apagaram arquivos importantes do sistema. Esses exemplos não estabelecem com que frequência esse comportamento ocorre em uso implantado, mas ressaltam por que custo operacional menor não pode substituir sandboxing, controles de permissão e avaliação.

Os usuários podem definir a profundidade de raciocínio do modelo. A DeepSeek informa que a configuração mais alta melhora os resultados em vários benchmarks, ao mesmo tempo em que produz cerca de 2,5 vezes mais tokens de saída. Essa opção dá aos desenvolvedores um controle direto de qualidade e custo, mas também significa que o desempenho destacado pode depender fortemente das configurações de inferência.

Por que a redução de memória importa para os builders

Para desenvolvedores que constroem agentes de IA, a eficiência do KV cache afeta mais do que apenas as contas de GPU. Fluxos de trabalho de longa duração podem reter grandes quantidades de histórico de conversa, documentos recuperados, saídas de ferramentas e estado de planejamento. Se esse estado precisar ser mantido em memória aceleradora cara, os custos de serving e a concorrência podem piorar conforme as sessões crescem.

Um cache menor poderia permitir que um sistema de serving suportasse mais agentes simultâneos ou transferisse mais contexto para armazenamento mais barato. O impacto dependerá de detalhes de implementação, incluindo suporte à quantização, velocidade de transferência entre GPU e memória do host, comportamento de batching e com que frequência um agente pausa para ferramentas. Assim, a arquitetura relatada oferece uma direção de sistema promissora, mas não uma redução de custos garantida para todas as aplicações.

A licença MIT também pode tornar o V4.1-Flash atraente para equipes que queiram executar ou modificar o modelo por conta própria. A implantação aberta pode melhorar o controle sobre residência de dados e infraestrutura de inferência, ao mesmo tempo em que transfere mais responsabilidade por escolha de hardware, testes de segurança, atualizações do modelo e suporte operacional para o comprador.

Para equipes de IA corporativa, os resultados irregulares sugerem uma implantação direcionada, em vez de uma substituição completa do modelo. Fluxos de trabalho de programação e automação de longo contexto são os candidatos mais claros para teste. Pesquisa científica, análise com muitas imagens e tarefas que envolvem acesso destrutivo ao sistema exigem validação separada e controles mais fortes.

O que observar a seguir

O acompanhamento mais importante será o teste independente das alegações de memória do V4.1-Flash sob cargas de trabalho de agentes realistas. Os desenvolvedores devem comparar uso de GPU, tráfego de memória do host, latência, throughput e custo total contra o V4-Flash e outros modelos abertos, variando o comprimento do contexto e a frequência de chamadas de ferramentas.

Também será importante ver se a vantagem do modelo em programação se mantém fora das avaliações reportadas pela DeepSeek. Resultados no ProgramBench, benchmarks de agentes científicos, testes multimodais e tarefas de uso prolongado de ferramentas devem esclarecer onde o modelo é confiável e onde seu menor número de parâmetros ativos se torna uma limitação.

Por fim, relatórios de implantação podem revelar se a licença MIT do modelo leva a adoção significativa ou se a complexidade operacional de servir um sistema de 552 bilhões de parâmetros anula suas economias de cache. Preços de API, requisitos de hardware, qualidade de quantização e ferramentas de segurança determinarão quanto da eficiência arquitetural chega aos usuários finais.

Perspectiva da Creati.ai

O V4.1-Flash é notável porque trata a economia de agentes como um problema de gerenciamento de memória, e não apenas de contagem de parâmetros. Para cargas de trabalho dominadas pela ingestão repetida de contexto, reduzir a pressão sobre o KV cache pode ser tão importante quanto melhorar pontuações de benchmark.

As evidências ainda não são fortes o bastante para sustentar uma alegação ampla de que a DeepSeek igualou os melhores modelos fechados em todas as tarefas. A conclusão mais defensável é mais restrita: a DeepSeek introduziu um modelo aberto com foco incomumente agressivo em eficiência de longo contexto, e agora os builders têm um sistema concreto para testar contra as restrições de custo e confiabilidade de agentes de IA reais.

Anúncios