Nvidia libera Nemotron 3 Super, modelo aberto de 120B para sistemas multi-agente
Arquitetura híbrida Mamba-Transformer com MoE entrega 5x mais throughput e janela de 1M tokens com apenas 12B parâmetros ativos.
Pontos principais
- Modelo aberto de 120 bilhões de parâmetros totais com apenas 12 bilhões ativos
- Arquitetura híbrida combina camadas Mamba-2, atenção Transformer e MoE latente
- Throughput 5x superior ao Nemotron Super anterior, janela nativa de 1M tokens
- Treinado em 25 trilhões de tokens com pesos abertos no Hugging Face
- Parceiros de lançamento incluem Perplexity, Palantir, CodeRabbit e Siemens
- Resolve 'explosão de contexto' (agentes geram até 15x mais tokens que chat padrão) e 'imposto do raciocínio'
A Nvidia liberou o Nemotron 3 Super em 11 de março, modelo aberto de 120 bilhões de parâmetros totais projetado especificamente para sistemas multi-agente. Com apenas 12 bilhões de parâmetros ativos graças à arquitetura híbrida que combina camadas Mamba-2, atenção Transformer e roteamento Mixture-of-Experts latente, o modelo entrega mais de 5x o throughput da versão anterior e uma janela de contexto nativa de 1 milhão de tokens.
O modelo foi treinado em 25 trilhões de tokens (10 trilhões únicos curados), com treinamento adicional em 10 bilhões de tokens de raciocínio e 15 milhões de problemas de código. Perplexity, Palantir, Siemens, Cadence e Dassault Systèmes estão entre os parceiros de lançamento, além de startups de agentes de desenvolvimento como CodeRabbit, Factory e Greptile.
Comentários
Carregando comentários...
