Daily Journal
Daily Journal

Agentes de IA da Asari otimizam performance de LLMs em até 16%

Agentes autônomos da Asari AI aprimoraram a pilha de inferência de modelos como DeepSeek v4 Pro e GLM 5.2, elevando throughput e interatividade.

Daily Journal
||
05/08 às 01:43

Pontos principais

  • Otimização aplicada a modelos DeepSeek v4 Pro e GLM 5.2 rodando em GPUs NVIDIA B200.
  • Melhoria de até 16% em throughput e interatividade com o uso de vLLM v0.23.
  • Processo de otimização leva cerca de um dia por nível de concorrência.
  • Agentes ajustam toda a pilha de inferência, incluindo kernels, schedulers e load balancers.
  • Sistema utiliza checagem de correção baseada em distribuição estatística para garantir a integridade das saídas.
  • Capacidade de aprendizado cruzado permitiu evitar deadlocks em novos modelos com base em experiências anteriores.

A startup Asari AI apresentou uma nova classe de agentes de IA, denominados "co-inventores", capazes de otimizar de forma autônoma a infraestrutura de inferência para grandes modelos de linguagem (LLMs). Ao atuar sobre toda a pilha tecnológica, desde kernels de baixo nível até configurações de balanceamento de carga, os agentes conseguiram ganhos de performance de até 16% em ambientes de alta concorrência. O diferencial do sistema reside na sua capacidade de autoaperfeiçoamento, onde aprendizados obtidos durante a otimização de um modelo são transferidos para outros, reduzindo ineficiências operacionais.

Para garantir que o ganho de velocidade não comprometa a precisão, a Asari implementou um rigoroso processo de verificação que compara a distribuição estatística das saídas do modelo otimizado com a versão original. Diferente de testes funcionais tradicionais, esse método assegura que o comportamento do modelo seja preservado mesmo após modificações profundas no código. A tecnologia, que já apresenta resultados superiores às implementações padrão do vLLM, busca resolver a complexidade de otimizar sistemas dinâmicos onde a análise de código estática é insuficiente.

Comentários

Carregando comentários...