DeepSeek V4 deve ser lançado até 4 de março com 1 trilhão de parâmetros e otimização para chips chineses
Modelo MoE multimodal com janela de 1M tokens e custo até 89x menor que rivais ocidentais não foi compartilhado com Nvidia ou AMD.
Pontos principais
- DeepSeek V4 é um modelo mixture-of-experts com aproximadamente 1 trilhão de parâmetros totais e ~32B ativos por token
- Geração multimodal nativa em texto, imagem, vídeo e áudio com janela de contexto de 1 milhão de tokens
- Lançamento cronometrado para antes das sessões parlamentares chinesas (abertura em 5 de março)
- Otimizado para chips Huawei Ascend e Cambricon, mas treinamento ainda dependeu de GPUs Nvidia
- DeepSeek não compartilhou o V4 com Nvidia ou AMD, quebrando prática padrão do setor
- Benchmarks vazados sugerem ~90% no HumanEval e 80%+ no SWE-bench Verified
- Custo estimado de US$ 0,14/milhão de tokens (entrada) — até 36-89x mais barato que Claude Opus 4.6
O DeepSeek V4 deve ser lançado até 4 de março, marcando o primeiro grande modelo da empresa desde janeiro de 2025. Trata-se de um mixture-of-experts com aproximadamente 1 trilhão de parâmetros totais, geração multimodal nativa (texto, imagem, vídeo e áudio), janela de contexto de 1 milhão de tokens e arquitetura que inclui Multi-head Latent Attention, Sparse Attention e memória condicional Engram.
O DeepSeek rompeu com a prática padrão ao não compartilhar o V4 com Nvidia ou AMD, concedendo acesso antecipado exclusivamente a fornecedores domésticos como Huawei e Cambricon. A tentativa de treinar com chips Huawei Ascend enfrentou falhas de estabilidade e velocidade de interconexão, forçando reversão para hardware Nvidia no treinamento — mas a inferência foi otimizada para hardware chinês. Benchmarks vazados sugerem performance competitiva com modelos de fronteira a uma fração dos custos ocidentais.
Comentários
Carregando comentários...
