Acelerador AMD MI355X atinge 470 tokens por segundo em testes
O novo acelerador da AMD superou o desempenho do GB300 em 40% ao rodar o modelo GLM 5.3 com o motor de inferência TileRT.
Pontos principais
- O AMD MI355X alcançou 470 tokens por segundo no modelo GLM 5.3 utilizando precisão FP8.
- O resultado supera em 40% a performance do GB300 com TRTLLM em precisão FP4.
- A configuração utiliza uma arquitetura desagregada com vLLM e TileRT.
- O motor TileRT reduz a latência ao executar a decodificação em um kernel de GPU persistente.
O acelerador AMD MI355X registrou um desempenho de 470 tokens por segundo ao processar o modelo GLM 5.3 em precisão FP8. Os dados, divulgados pela SemiAnalysis, indicam que a marca é 40% superior à obtida pelo GB300 utilizando o motor TRTLLM em precisão FP4.
A configuração técnica emprega uma arquitetura desagregada, combinando o vLLM para o motor de prefill e o TileRT para o motor de decode. O uso do TileRT permite que a decodificação do modelo seja realizada em um kernel de GPU persistente, otimizando a redução de latência durante o processamento.
Comentários
Carregando comentários...
