Daily Journal
Daily Journal

Análise detalha funcionamento da memória Engram no modelo DeepSeek V4.1

Sistema Engram do modelo V4.1 Flash da DeepSeek utiliza vetores para armazenar e reutilizar padrões de texto, otimizando a predição de tokens.

Daily Journal
Foto: x.com
||
26/09 às 00:10

Pontos principais

  • O sistema Engram recupera vetores de sequências curtas para reutilizar padrões familiares.
  • A memória armazena dados variados, incluindo nomes, fragmentos de código e avisos de copyright.
  • Diferentes camadas do modelo processam a memória para descrições de objetos e relações lógicas.
  • A arquitetura permite recuperação assíncrona e descarregamento para DRAM sem perda de performance.

A análise da SemiAnalysis sobre o modelo V4.1 Flash da DeepSeek revelou o funcionamento da camada de memória Engram. O sistema atua recuperando vetores aprendidos para sequências curtas de tokens, o que possibilita a reutilização eficiente de padrões familiares durante a predição.

O armazenamento abrange desde fragmentos de código e nomes até avisos de copyright e textos boilerplate. A arquitetura foi projetada para suportar recuperação assíncrona e descarregamento para DRAM, garantindo que o desempenho do serviço seja mantido durante o processamento.

Comentários

Carregando comentários...