Perplexity detalha arquitetura de sua infraestrutura de inferência
A Perplexity revelou detalhes técnicos dos sistemas Ivy, Tulip e ROSE, projetados para otimizar a busca e o processamento de modelos de embedding.
Pontos principais
- A infraestrutura utiliza o sistema Ivy para processamento HTTP e o Tulip para gerenciamento de gRPC.
- O motor ROSE é responsável pela execução de modelos e implementação de atenção irregular.
- A arquitetura emprega CUDA graphs para reduzir a sobrecarga da CPU.
- O uso de LazyTensors permite o processamento assíncrono entre CPU e GPU.
- O sistema visa reduzir a latência e os custos operacionais em comparação com soluções de mercado.
A Perplexity publicou um estudo técnico detalhando a arquitetura de sua infraestrutura de inferência, focada em otimizar a busca e o processamento de modelos de embedding. O sistema é composto pelo Ivy para processamento HTTP, o Tulip para gerenciamento de gRPC e o motor ROSE para a execução de modelos. Para aumentar a eficiência, a empresa utiliza CUDA graphs, que reduzem a sobrecarga da CPU, e LazyTensors para o processamento assíncrono entre CPU e GPU. O motor ROSE implementa atenção irregular em vez de atenção paginada, visando diminuir a latência e os custos operacionais em relação às soluções existentes no mercado.
Comentários
Carregando comentários...
