Daily Journal
Daily Journal

DeepSeek V4 deve ser lançado até 4 de março com 1 trilhão de parâmetros e otimização para chips chineses

Modelo MoE multimodal com janela de 1M tokens e custo até 89x menor que rivais ocidentais não foi compartilhado com Nvidia ou AMD.

Daily Journal
Foto: technode.com
||
02/03 às 15:30

Pontos principais

  • DeepSeek V4 é um modelo mixture-of-experts com aproximadamente 1 trilhão de parâmetros totais e ~32B ativos por token
  • Geração multimodal nativa em texto, imagem, vídeo e áudio com janela de contexto de 1 milhão de tokens
  • Lançamento cronometrado para antes das sessões parlamentares chinesas (abertura em 5 de março)
  • Otimizado para chips Huawei Ascend e Cambricon, mas treinamento ainda dependeu de GPUs Nvidia
  • DeepSeek não compartilhou o V4 com Nvidia ou AMD, quebrando prática padrão do setor
  • Benchmarks vazados sugerem ~90% no HumanEval e 80%+ no SWE-bench Verified
  • Custo estimado de US$ 0,14/milhão de tokens (entrada) — até 36-89x mais barato que Claude Opus 4.6

O DeepSeek V4 deve ser lançado até 4 de março, marcando o primeiro grande modelo da empresa desde janeiro de 2025. Trata-se de um mixture-of-experts com aproximadamente 1 trilhão de parâmetros totais, geração multimodal nativa (texto, imagem, vídeo e áudio), janela de contexto de 1 milhão de tokens e arquitetura que inclui Multi-head Latent Attention, Sparse Attention e memória condicional Engram.

O DeepSeek rompeu com a prática padrão ao não compartilhar o V4 com Nvidia ou AMD, concedendo acesso antecipado exclusivamente a fornecedores domésticos como Huawei e Cambricon. A tentativa de treinar com chips Huawei Ascend enfrentou falhas de estabilidade e velocidade de interconexão, forçando reversão para hardware Nvidia no treinamento — mas a inferência foi otimizada para hardware chinês. Benchmarks vazados sugerem performance competitiva com modelos de fronteira a uma fração dos custos ocidentais.

Comentários

Carregando comentários...