Berkeley RDI prepara nova versão do benchmark para agentes de IA
O projeto Agents’ Last Exam expandirá sua base de avaliação para mais de 1.000 tarefas voltadas a fluxos de trabalho reais nos próximos meses.
Pontos principais
- O projeto Agents’ Last Exam (ALE) conta atualmente com 150 tarefas públicas.
- A versão V2 incluirá mais de 1.000 tarefas em 50 setores específicos.
- A iniciativa é liderada pelo Berkeley RDI com apoio de 300 especialistas.
O projeto Agents’ Last Exam (ALE), liderado pelo Berkeley RDI, anunciou o desenvolvimento da versão V2 de seu benchmark para avaliação de agentes de IA. A nova etapa do projeto contará com a colaboração de mais de 300 especialistas da indústria e tem previsão de lançamento para os próximos meses.
Atualmente, a iniciativa disponibiliza 150 tarefas públicas que abrangem mais de 50 setores distintos. A atualização V2 ampliará significativamente esse escopo, oferecendo mais de 1.000 tarefas detalhadas para testar o desempenho de agentes de IA em fluxos de trabalho reais.
Comentários
Carregando comentários...
