Benchmark avalia desempenho de modelos de IA em auditoria financeira
O Financial Audit Bench testou 11 modelos de IA em tarefas de auditoria, revelando limitações na precisão e consistência das ferramentas.
Pontos principais
- A Lightspeed apresentou o Financial Audit Bench, desenvolvido pela Modus Audit.
- O teste utilizou dados sintéticos e 1.100 horas de input de auditores humanos.
- Onze modelos de IA de fronteira foram avaliados em tarefas de papéis de trabalho.
- O melhor modelo atingiu 69,17% de sucesso em execuções individuais.
- Apenas 44,4% das tarefas foram concluídas com sucesso em todas as oito tentativas pelo melhor modelo.
A Lightspeed anunciou o lançamento do Financial Audit Bench, um novo benchmark criado pela Modus Audit para medir a eficácia de modelos de IA em auditorias financeiras. O projeto, que marca a estreia da Modus Labs, avaliou 11 modelos de fronteira utilizando dados sintéticos e mais de 1.100 horas de contribuições de auditores profissionais.
Os resultados indicaram desafios significativos para a tecnologia atual, com o modelo de melhor desempenho alcançando 69,17% de sucesso em execuções individuais. Além disso, a consistência foi limitada, visto que apenas 44,4% das tarefas foram concluídas com êxito em todas as oito tentativas realizadas pelo sistema mais eficiente.
Comentários
Carregando comentários...
