Daily Journal
Daily Journal

Nvidia libera Nemotron 3 Super, modelo aberto de 120B para sistemas multi-agente

Arquitetura híbrida Mamba-Transformer com MoE entrega 5x mais throughput e janela de 1M tokens com apenas 12B parâmetros ativos.

Daily Journal
||
12/03 às 09:00

Pontos principais

  • Modelo aberto de 120 bilhões de parâmetros totais com apenas 12 bilhões ativos
  • Arquitetura híbrida combina camadas Mamba-2, atenção Transformer e MoE latente
  • Throughput 5x superior ao Nemotron Super anterior, janela nativa de 1M tokens
  • Treinado em 25 trilhões de tokens com pesos abertos no Hugging Face
  • Parceiros de lançamento incluem Perplexity, Palantir, CodeRabbit e Siemens
  • Resolve 'explosão de contexto' (agentes geram até 15x mais tokens que chat padrão) e 'imposto do raciocínio'

A Nvidia liberou o Nemotron 3 Super em 11 de março, modelo aberto de 120 bilhões de parâmetros totais projetado especificamente para sistemas multi-agente. Com apenas 12 bilhões de parâmetros ativos graças à arquitetura híbrida que combina camadas Mamba-2, atenção Transformer e roteamento Mixture-of-Experts latente, o modelo entrega mais de 5x o throughput da versão anterior e uma janela de contexto nativa de 1 milhão de tokens.

O modelo foi treinado em 25 trilhões de tokens (10 trilhões únicos curados), com treinamento adicional em 10 bilhões de tokens de raciocínio e 15 milhões de problemas de código. Perplexity, Palantir, Siemens, Cadence e Dassault Systèmes estão entre os parceiros de lançamento, além de startups de agentes de desenvolvimento como CodeRabbit, Factory e Greptile.

Comentários

Carregando comentários...