Pesquisadores da Meta criam técnica que eleva desempenho de modelos de IA
O framework EvoHarness-RL permite que modelos de IA menores alcancem resultados de sistemas de fronteira em tarefas complexas de longa duração.
Pontos principais
- A técnica utiliza a interface BPE para gerenciar compreensão, progresso e histórico do agente.
- O treinamento combina ajuste fino supervisionado e aprendizado por reforço consciente de custos.
- Um modelo Qwen3-8B atingiu 96,9% de sucesso no benchmark ALFWorld com o novo método.
- O framework possibilita a redução da dependência de ferramentas externas conforme o agente evolui.
Pesquisadores da Meta e da Universidade de Illinois desenvolveram o EvoHarness-RL, um framework inovador que permite a modelos de IA de menor escala, como o Qwen3-8B, atingir níveis de desempenho comparáveis a modelos de fronteira, como o Claude Opus 4.5. A técnica introduz uma camada de abstração que ensina o agente a gerenciar seu próprio ambiente de trabalho por meio de uma interface unificada, focada em crenças, progresso e experiência. O processo de treinamento ocorre em duas etapas, otimizando a eficiência operacional e a capacidade de resolução de problemas complexos. A relevância desta descoberta reside na possibilidade de executar tarefas sofisticadas com modelos menores, reduzindo significativamente os custos computacionais e a dependência de infraestruturas massivas, ao mesmo tempo em que o agente demonstra maior autonomia ao adaptar o uso de recursos conforme a complexidade da tarefa.
Comentários
Carregando comentários...
