---
title: "Eric Horvitz alerta para dificuldade de monitorar abusos em modelos de IA"
url: https://dailyjournal.news/news/2026-09-04/eric-horvitz-alerta-para-riscos-no-monitoramento-de-modelos-de-ia
published: 2026-09-04T22:16:21.784114+00:00
updated: 2026-09-04T22:40:51.553+00:00
categories: ["technology"]
source_count: 2
outlet_count: 0
language: pt-BR
publisher: "Daily Journal"
---

# Eric Horvitz alerta para dificuldade de monitorar abusos em modelos de IA

Chief Scientific Officer da Microsoft defende o uso de 'tandem training' para aumentar a interpretabilidade e o monitoramento de sistemas de IA.

## Pontos principais

- O modelo Astra apresenta desafios crescentes para o monitoramento de abusos via Chain of Thought (CoT).
- Horvitz defende que a monitorabilidade deve ser priorizada além dos esforços de alinhamento e recusas.
- A técnica de 'tandem training' incentiva modelos a serem mais compreensíveis para humanos.
- O método utiliza modelos mais fracos para avaliar a clareza e a interpretabilidade da inteligência de máquina.

O Chief Scientific Officer da Microsoft, Eric Horvitz, manifestou preocupação com a crescente complexidade de monitorar abusos em modelos de inteligência artificial, destacando que o uso de técnicas como Chain of Thought (CoT) torna o processo de supervisão mais difícil. Segundo o executivo, é fundamental que a indústria de tecnologia priorize investimentos em monitorabilidade, indo além das estratégias convencionais de alinhamento e recusas de segurança. Para enfrentar esse desafio, Horvitz apresentou o 'tandem training', uma abordagem de treinamento focada em tornar os modelos de IA mais compreensíveis. A técnica utiliza sistemas menos potentes para avaliar a clareza das respostas, visando aumentar a interpretabilidade humana sobre a inteligência de máquina. A iniciativa busca garantir que o desenvolvimento de modelos avançados não comprometa a capacidade de supervisão e controle sobre possíveis comportamentos abusivos.

## Fontes

- [@erichorvitz: Astra's model card shows that monitoring for abuse via CoT may become increasingly difficult.  Beyond efforts on alignment & refusals, impt. to invest in maintaining monitorability…](https://x.com/erichorvitz/status/2095993034169262223) (2026-09-04)
- [@erichorvitz: Tandem training: An approach aimed at incentivizing models to be understandable.  Considered "understanding" by weaker models--but had human interpretability of machine intelligenc…](https://x.com/erichorvitz/status/2096002494740762744) (2026-09-04)

---

Publicado por Daily Journal. Versão HTML: https://dailyjournal.news/news/2026-09-04/eric-horvitz-alerta-para-riscos-no-monitoramento-de-modelos-de-ia
