EverMind apresenta arquitetura MSA que escala contexto a 100M de tokens
Memory Sparse Attention mantém menos de 9% de degradação ao escalar de 16K a 100M tokens; modelo de 4B supera RAG em 16 pontos.
Pontos principais
- MSA escala contexto de 16K a 100 milhões de tokens com menos de 9% de degradação de desempenho
- Modelo de 4B parâmetros superou sistemas RAG complexos por até 16 pontos percentuais
- Combina quatro inovações: Memory Sparse Attention, Document-wise RoPE, KV Cache Compression e Memory Interleave
- Inferência de 100M tokens em apenas duas GPUs A800 via offloading de KV para CPU DRAM
- No benchmark NIAH de 32K a 1M tokens, MSA caiu apenas 3,93 pontos enquanto Qwen3-4B colapsou para 24,69%
A EverMind apresentou o Memory Sparse Attention (MSA), arquitetura que escala contexto de LLMs a 100 milhões de tokens com menos de 9% de degradação de desempenho. A inovação combina quatro técnicas: sparsificação baseada em conteúdo, Document-wise RoPE para extrapolação de contexto extremo, compressão de KV Cache com paralelismo de memória e Memory Interleave para raciocínio multi-hop.
Um modelo de apenas 4B parâmetros com MSA superou sistemas RAG complexos por até 16 pontos percentuais, inclusive sistemas usando modelos 58 vezes maiores. A arquitetura permite inferência de 100M tokens em apenas duas GPUs A800, offloadando KVs de conteúdo para DRAM de CPU.
Comentários
Carregando comentários...
