Daily Journal
Daily Journal

Novo motor TileRT acelera inferência de LLMs em GPUs NVIDIA

O software TileRT otimiza a latência de decodificação em GPUs NVIDIA, superando motores tradicionais em até 3 vezes na interatividade de LLMs.

Daily Journal
||
10/08 às 01:57

Pontos principais

  • O TileRT compila o grafo de decodificação em um único kernel persistente, eliminando o overhead de latência de kernels individuais.
  • Benchmarks da plataforma InferenceX mostram que o TileRT atingiu 500 tokens/s por usuário em servidores B200, superando o GB300 NVL72.
  • A tecnologia utiliza a técnica de desagregação prefill-decode, separando o processamento de entrada (prefill) da geração de tokens (decode).
  • O motor já está em uso comercial pela Xiaomi e pela Z.ai para oferecer modos de alta velocidade em seus modelos de IA.
  • O TileRT foca em cenários de alta interatividade com batch size 1, competindo com chips especializados como Groq LPU e Cerebras.
  • A solução é compatível com o ecossistema existente, permitindo que motores como vLLM gerenciem a fase de prefill enquanto o TileRT cuida da latência.

O surgimento do TileRT, um novo motor de inferência desenvolvido pela comunidade, promete reduzir drasticamente a latência de modelos de linguagem (LLMs) em hardware NVIDIA. Ao compilar todo o grafo de decodificação em um kernel persistente, o software contorna as limitações do modelo de programação tradicional de GPUs, que sofre com o custo de sincronização de múltiplos kernels em cenários de ultra-baixa latência. Testes realizados pela SemiAnalysis indicam que essa abordagem permite que GPUs padrão alcancem níveis de interatividade anteriormente restritos a chips especializados, como os da Groq e Cerebras.

A tecnologia já está sendo implementada em ambientes de produção, como nos serviços MiMo da Xiaomi e no GLM 5.1 da Z.ai. Ao operar em um modelo de desagregação, onde o TileRT gerencia a decodificação sensível à latência enquanto motores como vLLM processam o prefill, as empresas conseguem otimizar tanto o custo quanto a performance. Embora o TileRT suporte atualmente um catálogo restrito de modelos e opere com batch size 1, seu desempenho em benchmarks de interatividade coloca as GPUs NVIDIA em uma posição competitiva renovada para aplicações de tempo real, como assistentes de voz e sistemas de resposta imediata.

Tópicos relacionados

Comentários

Carregando comentários...