Daily Journal
Daily Journal

EverMind apresenta arquitetura MSA que escala contexto a 100M de tokens

Memory Sparse Attention mantém menos de 9% de degradação ao escalar de 16K a 100M tokens; modelo de 4B supera RAG em 16 pontos.

Daily Journal
||
19/03 às 09:00

Pontos principais

  • MSA escala contexto de 16K a 100 milhões de tokens com menos de 9% de degradação de desempenho
  • Modelo de 4B parâmetros superou sistemas RAG complexos por até 16 pontos percentuais
  • Combina quatro inovações: Memory Sparse Attention, Document-wise RoPE, KV Cache Compression e Memory Interleave
  • Inferência de 100M tokens em apenas duas GPUs A800 via offloading de KV para CPU DRAM
  • No benchmark NIAH de 32K a 1M tokens, MSA caiu apenas 3,93 pontos enquanto Qwen3-4B colapsou para 24,69%

A EverMind apresentou o Memory Sparse Attention (MSA), arquitetura que escala contexto de LLMs a 100 milhões de tokens com menos de 9% de degradação de desempenho. A inovação combina quatro técnicas: sparsificação baseada em conteúdo, Document-wise RoPE para extrapolação de contexto extremo, compressão de KV Cache com paralelismo de memória e Memory Interleave para raciocínio multi-hop.

Um modelo de apenas 4B parâmetros com MSA superou sistemas RAG complexos por até 16 pontos percentuais, inclusive sistemas usando modelos 58 vezes maiores. A arquitetura permite inferência de 100M tokens em apenas duas GPUs A800, offloadando KVs de conteúdo para DRAM de CPU.

Comentários

Carregando comentários...