---
title: "Nova técnica RLSD otimiza modelos de raciocínio com menos recursos"
url: https://dailyjournal.news/news/2026-04-29/nova-tecnica-rlsd-otimiza-modelos-de-raciocinio-com-menos-recursos
published: 2026-04-29T00:05:16.356678+00:00
categories: ["technology"]
topics: ["inteligencia-artificial"]
source_count: 1
outlet_count: 1
language: pt-BR
publisher: "Daily Journal"
---

# Nova técnica RLSD otimiza modelos de raciocínio com menos recursos

Pesquisadores da JD.com e instituições acadêmicas desenvolveram o RLSD, uma técnica que permite construir modelos de raciocínio personalizados com menor custo computacional e maior eficiência.

## Pontos principais

- A técnica RLSD (Reinforcement Learning with Verifiable Rewards with Self-Distillation) permite construir modelos de raciocínio personalizados com menos recursos computacionais.
- O RLSD combina o rastreamento de desempenho do aprendizado por reforço com o feedback granular da autodistilação.
- Modelos treinados com RLSD superam algoritmos clássicos de destilação e aprendizado por reforço em experimentos.
- A técnica foi testada com o modelo Qwen3-VL-8B, resultando em maior precisão e velocidade de convergência em benchmarks de raciocínio visual.
- Empresas podem integrar o RLSD usando dados proprietários sem a necessidade de um professor externo ou de enviar dados para fora da rede.

Pesquisadores da JD.com e de instituições acadêmicas desenvolveram uma nova técnica chamada Reinforcement Learning with Verifiable Rewards with Self-Distillation (RLSD), que permite a construção de modelos de raciocínio personalizados com uma fração dos recursos computacionais tradicionalmente necessários. O RLSD combina o rastreamento de desempenho confiável do aprendizado por reforço com o feedback granular da autodistilação, superando algoritmos clássicos de destilação e aprendizado por reforço em testes práticos.

Esta inovação aborda desafios como o feedback esparso e o alto custo computacional de métodos anteriores, além de evitar o vazamento de informações. A técnica desacopla a direção da atualização (determinada por feedback verificável) da magnitude da atualização (determinada por um auto-professor). Testes com o modelo Qwen3-VL-8B demonstraram que o RLSD alcançou maior precisão e velocidade de convergência em benchmarks de raciocínio visual, oferecendo às empresas a capacidade de integrar a técnica em seus fluxos de trabalho usando dados proprietários sem a necessidade de um professor externo ou de enviar dados para fora da rede.

## Fontes

- [How to build custom reasoning agents with a fraction of the compute](https://venturebeat.com/orchestration/how-to-build-custom-reasoning-agents-with-a-fraction-of-the-compute) — VentureBeat (2026-04-28)

## Tópicos relacionados

- [Inteligência Artificial](https://dailyjournal.news/topics/inteligencia-artificial)

---

Publicado por Daily Journal. Versão HTML: https://dailyjournal.news/news/2026-04-29/nova-tecnica-rlsd-otimiza-modelos-de-raciocinio-com-menos-recursos
