Daily Journal
Daily Journal

Pesquisador apresenta TailRL para otimizar aprendizado por reforço

O novo método TailRL estende o aprendizado por reforço de máxima verossimilhança para recompensas contínuas, focando em amostras de alto desempenho.

Daily Journal
Foto: x.com
||
06/09 às 20:10

Pontos principais

  • O TailRL prioriza amostras raras de alta recompensa ao maximizar o logaritmo esperado das probabilidades da cauda superior.
  • A técnica é compatível com pipelines existentes por meio de uma modificação na função de vantagem.
  • O método foi testado com sucesso em navegação, localização de objetos, fundamentação de GUI e otimização de código.
  • O gradiente do TailRL pode ser interpretado como uma mistura de gradientes do tipo Best-of-(k).

O pesquisador Russ Salakhutdinov anunciou o desenvolvimento do Tail-Likelihood Reinforcement Learning (TailRL), uma abordagem que amplia o aprendizado por reforço de máxima verossimilhança para lidar com recompensas contínuas. O método funciona priorizando amostras raras de alta recompensa através da maximização do logaritmo esperado das probabilidades da cauda superior, sendo integrável a sistemas atuais via ajuste na função de vantagem. Testes práticos demonstraram a eficácia do TailRL em tarefas como navegação em labirintos, localização de objetos, otimização de código e fundamentação de interfaces gráficas. Além disso, o gradiente resultante do modelo oferece uma interpretação técnica como uma mistura de gradientes do tipo Best-of-(k).

Comentários

Carregando comentários...