---
title: "Pesquisador apresenta TailRL para otimizar aprendizado por reforço"
url: https://dailyjournal.news/news/2026-09-06/pesquisador-apresenta-tailrl-para-otimizar-aprendizado-por-reforco
published: 2026-09-06T23:10:34.599939+00:00
updated: 2026-09-06T23:10:34.599939+00:00
categories: ["technology"]
source_count: 1
outlet_count: 0
language: pt-BR
publisher: "Daily Journal"
---

# Pesquisador apresenta TailRL para otimizar aprendizado por reforço

O novo método TailRL estende o aprendizado por reforço de máxima verossimilhança para recompensas contínuas, focando em amostras de alto desempenho.

## Pontos principais

- O TailRL prioriza amostras raras de alta recompensa ao maximizar o logaritmo esperado das probabilidades da cauda superior.
- A técnica é compatível com pipelines existentes por meio de uma modificação na função de vantagem.
- O método foi testado com sucesso em navegação, localização de objetos, fundamentação de GUI e otimização de código.
- O gradiente do TailRL pode ser interpretado como uma mistura de gradientes do tipo Best-of-(k).

O pesquisador Russ Salakhutdinov anunciou o desenvolvimento do Tail-Likelihood Reinforcement Learning (TailRL), uma abordagem que amplia o aprendizado por reforço de máxima verossimilhança para lidar com recompensas contínuas. O método funciona priorizando amostras raras de alta recompensa através da maximização do logaritmo esperado das probabilidades da cauda superior, sendo integrável a sistemas atuais via ajuste na função de vantagem. Testes práticos demonstraram a eficácia do TailRL em tarefas como navegação em labirintos, localização de objetos, otimização de código e fundamentação de interfaces gráficas. Além disso, o gradiente resultante do modelo oferece uma interpretação técnica como uma mistura de gradientes do tipo Best-of-(k).

## Fontes

- [@rsalakhu: Check out our new work on Tail-Likelihood Reinforcement Learning (TailRL), extending maximum-likelihood RL from binary to continuous rewards.](https://x.com/rsalakhu/status/2096727730209329469) (2026-09-06)

---

Publicado por Daily Journal. Versão HTML: https://dailyjournal.news/news/2026-09-06/pesquisador-apresenta-tailrl-para-otimizar-aprendizado-por-reforco
