Daily Journal
Daily Journal

Benchmark avalia desempenho de modelos de IA em auditoria financeira

O Financial Audit Bench testou 11 modelos de IA em tarefas de auditoria, revelando limitações na precisão e consistência das ferramentas.

Daily Journal
Foto: x.com
||
01/10 às 15:10

Pontos principais

  • A Lightspeed apresentou o Financial Audit Bench, desenvolvido pela Modus Audit.
  • O teste utilizou dados sintéticos e 1.100 horas de input de auditores humanos.
  • Onze modelos de IA de fronteira foram avaliados em tarefas de papéis de trabalho.
  • O melhor modelo atingiu 69,17% de sucesso em execuções individuais.
  • Apenas 44,4% das tarefas foram concluídas com sucesso em todas as oito tentativas pelo melhor modelo.

A Lightspeed anunciou o lançamento do Financial Audit Bench, um novo benchmark criado pela Modus Audit para medir a eficácia de modelos de IA em auditorias financeiras. O projeto, que marca a estreia da Modus Labs, avaliou 11 modelos de fronteira utilizando dados sintéticos e mais de 1.100 horas de contribuições de auditores profissionais.

Os resultados indicaram desafios significativos para a tecnologia atual, com o modelo de melhor desempenho alcançando 69,17% de sucesso em execuções individuais. Além disso, a consistência foi limitada, visto que apenas 44,4% das tarefas foram concluídas com êxito em todas as oito tentativas realizadas pelo sistema mais eficiente.

Comentários

Carregando comentários...