Perplexity libera código aberto do motor de inferência Lily
A ferramenta otimiza o desempenho do modelo Qwen3.6-35B-A3B em dispositivos Apple Silicon através de computação híbrida.
Pontos principais
- O motor Lily foi projetado para rodar o modelo Qwen3.6-35B-A3B em hardware Apple.
- O sistema utiliza computação híbrida entre nuvem e processamento local no Mac.
- Testes em MacBook Pro com chip M5 Max indicam desempenho superior ao framework MLX-LM.
- O Lily apresentou throughput de prefill 1,23 vezes maior e de decode 1,35 vezes maior que o MLX-LM.
- O código-fonte do motor de inferência já está disponível publicamente.
A Perplexity anunciou o lançamento em código aberto do Lily, um motor de inferência local desenvolvido para otimizar a execução do modelo Qwen3.6-35B-A3B em dispositivos com processadores Apple Silicon. A tecnologia utiliza um sistema de computação híbrida que distribui as tarefas de processamento entre a nuvem e o hardware local do usuário.
Em testes realizados em um MacBook Pro equipado com chip M5 Max, o Lily demonstrou desempenho superior ao framework MLX-LM. O motor registrou um throughput de prefill 1,23 vezes maior e de decode 1,35 vezes maior, consolidando-se como uma alternativa para otimização de modelos em dispositivos da Apple.
Comentários
Carregando comentários...
