Custo de raciocínio em IA cai 99% em 19 meses
O custo para resolver tarefas complexas de raciocínio caiu de US$ 26 para cerca de um centavo, impulsionado pelo lançamento do DeepSeek V4 Flash.
Pontos principais
- O benchmark ARC-AGI-1 registrou uma redução de 99,95% no custo por tarefa entre o final de 2024 e meados de 2026.
- O modelo DeepSeek V4 Flash, lançado em julho de 2026, alcança 89% de precisão no ARC-AGI-1 com um custo de aproximadamente US$ 0,02 por tarefa.
- A arquitetura de mistura de especialistas (MoE) do DeepSeek V4 utiliza apenas 13 bilhões de parâmetros ativos, reduzindo significativamente o consumo computacional.
- O uso de fluxos de trabalho agenticos com 50 chamadas de raciocínio passou a custar cerca de US$ 1, comparado aos US$ 250 exigidos anteriormente.
- Fatores como otimização de hardware, design de prompts e o aumento da eficiência em modelos de pesos abertos contribuíram para a queda nos preços de inferência.
- Apesar da redução de custos, modelos como o Gemini 3 Deep Think mantêm liderança em benchmarks de alta complexidade, como o ARC-AGI-2, com custos superiores.
O setor de inteligência artificial atingiu um marco significativo na eficiência econômica de modelos de raciocínio. Dados do leaderboard ARC Prize revelam que o custo para atingir a marca de 75% de precisão no benchmark ARC-AGI-1 despencou de US$ 26 por tarefa, registrado com modelos anteriores em 2024, para cerca de um centavo de dólar em 2026, com a introdução do DeepSeek V4 Flash.
Essa redução drástica é atribuída a uma combinação de arquiteturas sparse, como a estrutura de mistura de especialistas, e melhorias na gestão de tokens durante o raciocínio adaptativo. Enquanto modelos de fronteira continuam a oferecer desempenho superior em tarefas extremamente complexas, a acessibilidade financeira de modelos como o V4 Flash permite que desenvolvedores implementem fluxos de trabalho agenticos mais extensos e verificações repetidas sem comprometer a viabilidade orçamentária de suas aplicações.
Comentários
Carregando comentários...
