Perplexity lança modelos de embedding pplx-embed-v2-late
A Perplexity disponibilizou modelos que permitem buscas integradas em textos, imagens e documentos sem necessidade de OCR.
Pontos principais
- Os modelos pplx-embed-v2-late utilizam interação tardia para preservar detalhes por token.
- A tecnologia permite realizar buscas diretas em PDFs, slides e imagens mantendo a estrutura original.
- Foram lançadas versões de 9B e 0.6B, destiladas a partir de um modelo de 18B.
- Os modelos superaram o nemotron-embed-8b no benchmark Q2D-Web com Recall@1000 de até 74,8%.
- O código e os modelos já estão disponíveis publicamente na plataforma Hugging Face.
A Perplexity anunciou o lançamento dos modelos pplx-embed-v2-late, projetados para realizar buscas em texto, imagens e páginas dentro de um espaço de embedding compartilhado. A tecnologia utiliza o método de interação tardia, que mantém vetores por token para preservar detalhes que modelos densos costumam perder.
Esses novos modelos permitem a consulta direta em arquivos como PDFs e slides sem a necessidade de OCR, preservando a formatação de tabelas e figuras. Disponíveis em versões de 9B e 0.6B, os modelos foram publicados na plataforma Hugging Face e superaram o nemotron-embed-8b em testes realizados no benchmark Q2D-Web.
Comentários
Carregando comentários...
