DeepSeek AI: Chegou a IA com 1 milhão de contexto!

DeepSeek-V4.1-Flash: A IA que Encolheu a Memória em 437x! Chega de gargalos!

Olá, pessoal! Aqui é o Lucas Tech e, se você acompanha o mundo da Inteligência Artificial, sabe que um dos maiores desafios dos LLMs (Large Language Models) de hoje é a "memória". Modelos que precisam de um contexto gigante, tipo um milhão de tokens, acabam gerando um tal de "KV cache" que sobrecarrega a memória RAM de alta velocidade (HBM), a capacidade dos SSDs e até a largura de banda. Isso cria gargalos que freiam o desenvolvimento e a implantação dessas IAs.

Mas a galera da DeepSeek AI acaba de lançar uma solução INCRÍVEL: o DeepSeek-V4.1-Flash! Eles resolveram exatamente esse problema e o resultado é de cair o queixo. Preparem-se para conhecer uma IA que está redefinindo os limites da eficiência!

Esse novo modelo multimodal Mixture-of-Experts (MoE) vem com impressionantes 552 bilhões de parâmetros na espinha dorsal, mais 196 bilhões de parâmetros Engram adicionais, e uma janela de contexto colossal de 1 milhão de tokens. Durante a fase de pré-preenchimento (prefill), ele ativa 8 bilhões de parâmetros por token, e 16 bilhões durante a decodificação. Mas o número mais importante? O consumo de cache KV global é de apenas 890 bytes por token! Isso é cerca de 1/4 do DeepSeek-V4-Flash e, pasmem, 437 vezes MENOR que o DeepSeek-V1!

E a cereja do bolo? Sim, ele é super deployável! Com licença MIT, ele já chega com suporte para vLLM, SGLang e Transformers no Hugging Face. A equipe ainda promete uma API pública com diferentes níveis de raciocínio – baixo, alto e máximo. Top demais!

Causal Encoder-Decoder: Metade do Prefill!

Sabe aquela arquitetura de 40 camadas? Pois é, ela foi dividida em um encoder causal de 20 camadas e um decoder de 20 camadas. Inspirado no YOCO, o decoder não precisa calcular o seu próprio KV cache global. Em vez disso, pesos de projeção por camada o derivam do estado oculto final do encoder.

Isso significa que os tokens do prompt param no encoder, cortando o processamento de prefill QUASE pela metade! A atenção de janela deslizante (SWA) com 128 tokens ainda roda em cada camada, mas os estados SWA do decoder são reconstruídos apenas com os últimos 128 tokens do prompt. A equipe chama isso de "Decoder SWA Bounded Replay" – tipo um "replay" inteligente e super econômico.

Atenção Escassa Comprimida 2 (CSA2): A Magia da Economia

No DeepSeek-V4, eles já usavam uma mistura de CSA com Atenção Pesadamente Comprimida. Agora, no V4.1-Flash, a aposta é pura CSA2, que ataca o tamanho do cache ao longo do eixo das camadas. Cada camada CSA2 recebe estaticamente um de 3 modos:

  • Full: Calcula seu próprio KV principal, projeta o Indexer K a partir dele e seleciona novos índices Top-512.
  • Reindex: Reaproveita o KV principal e o Indexer K da última camada "Full", mas os recalcula com seu próprio Indexer Q.
  • Reuse: Reutiliza tanto o KV principal quanto os últimos índices Top-K, pulando todo o processo de indexação.

Cada camada mantém seu próprio Q principal e SWA KV. É um sistema bem orquestrado para economizar recursos, com 18 camadas de encoder CSA2 usando uma taxa de compressão de 2 em 3 grupos de 6 (1 Full, 5 Reuse), e as 20 camadas de decoder usando taxa 1 em 5 grupos de 4 (o primeiro é Full + 3 Reuse, o resto Reindex + 3 Reuse). Um Indexador Esparso Hierárquico no decoder permite que a camada Full construa um pool de candidatos de até 16.384 posições, otimizando as camadas Reindex subsequentes.

FP4 KV, Bounded Replay e Outras Ferramentas Mágicas

O cache KV principal foi quantizado para E2M1, seguindo o NVFP4 (sem a escala global), quase cortando o armazenamento pela metade em comparação com o cache FP8 do V4. Isso foi introduzido através de treinamento consciente de quantização no pós-treinamento.

No nível de implantação, o SWA KV não é mais persistido em SSD. Ele vive em um pool distribuído de DRAM (cerca de 10% da RAM do host) com um tempo de vida curto (minutos), enquanto o KV global mantém uma vida útil garantida de 72 horas. Se houver uma falha, o Encoder SWA Bounded Replay recalcula apenas 128 tokens, em vez de refazer camadas e janelas inteiras. Isso é eficiência pura!

Outras mudanças incluem o mHC de Passagem Única, que otimiza o tráfego de memória, o módulo de memória condicional Engram nas camadas 1 e 14, a decodificação especulativa DSpark (treinada após o pré-treinamento com a espinha dorsal congelada) e o Muon por "head". E o mais legal: o número de operações (FLOPs) para decodificação de um único token aumenta apenas 1/4 quando o contexto vai de 4K para 1M! Impressionante, né?

Treinamento e Resultados: A IA no Campo de Batalha

O pré-treinamento cobriu 45 trilhões de tokens multimodais, numa proporção de 7:1 (texto para multimodal). A atenção esparsa foi treinada do zero em sequências de 64K sem aquecimento denso, e o contexto foi estendido para 1M tokens aos 34 trilhões de tokens. O modelo base igualou o DeepSeek-V4-Pro-Base em conhecimento geral e codificação, usando apenas 1/3 do total de parâmetros e 1/4 dos parâmetros ativados. Pense na economia!

O pós-treinamento não introduziu novos algoritmos, mas os ganhos vieram da síntese em larga escala de tarefas de agente verificáveis, Reinforcement Learning (RL) em várias plataformas (Claude Code, Codex, OpenCode, Pi, mini-SWE, DeepSeek Harness) e destilação on-policy de mais de 40 "professores". Muita inteligência sendo transferida!

Nos benchmarks mais exigentes, ele bateu o Opus-5 e o GPT-5.6 Sol em testes como Terminal-Bench 2.1 e DeepSWE v1.1. Isso não é pouca coisa, galera!

BenchmarkDS-V4.1-FlashDS-V4-FlashOpus-5GPT-5.6 Sol
Terminal-Bench 2.190.682.789.188.8
DeepSWE v1.174.254.474.073.0
Terminal-Bench 4.031.27.051.839.9
Automation-Bench54.837.750.345.8
GPQA Diamond90.989.993.494.1
Codeforces (rating)34713289n/an/a

Explicação Interativa (Um Plus para Você!)

O artigo original conta com um explainer interativo super legal que visualiza esses conceitos complexos. Como não consigo reproduzi-lo aqui, quero que saibam que ele existe e é uma ótima ferramenta para entender ainda mais a fundo!

Pontos Chave para Fixar:

  • Cache KV Global: Reduzido para incríveis 890 bytes por token, cerca de 1/4 do V4-Flash e 437x MENOR que o V1.
  • CED: Executa apenas 20 camadas do encoder no prefill (ativando 8B parâmetros) contra 16B no decode, otimizando o processamento.
  • CSA2: Compartilha KV principal, indexer K e índices Top-K entre as camadas através de modos Full, Reindex e Reuse para máxima eficiência.
  • FP4 KV: O KV principal em FP4, combinado com o SWA Bounded Replay, reduz o cache persistente para cerca de 1/8 do V4-Flash.
  • Desempenho: Superou o Opus-5 e o GPT-5.6 Sol em benchmarks importantes como Terminal-Bench 2.1 e DeepSWE v1.1, com pesos abertos sob licença MIT!

Minha Visão:

Galera, esse lançamento da DeepSeek-V4.1-Flash é um game-changer! O gargalo de memória sempre foi um dos grandes calcanhares de Aquiles para escalarmos LLMs de contexto longo. Reduzir o KV cache em 437 vezes não é apenas um feito de engenharia impressionante; é um portal para uma nova era de IA mais eficiente, mais acessível e capaz de lidar com tarefas muito mais complexas e demoradas. Isso significa que poderemos ter assistentes de IA que "pensam" por mais tempo, que entendem contextos massivos sem "esquecer" o que foi dito no início, e tudo isso com custos operacionais potencialmente menores. É a democratização do poder computacional dos LLMs!

E vocês, o que acham dessa revolução na memória dos LLMs? Quais novas aplicações ou possibilidades vocês veem surgir com essa eficiência toda? Deixem seus comentários!


Quer se aprofundar? Confiram o Modelo no Hugging Face e o Relatório Técnico! Ah, e não esqueçam de seguir a gente no Twitter e se juntar ao nosso 150k+ML SubReddit e se inscrever na nossa Newsletter. Tá no Telegram? Agora você também pode nos encontrar por lá.

Precisa de uma parceria para divulgar seu repositório GitHub OU página no Hugging Face OU lançamento de produto OU webinar etc.? Conecte-se conosco

Referência: Matéria Original

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Rolar para cima
Tutorial Elevenlabs