---
title: "Datasets com 21 milhões de músicas são usados para treinar IAs"
url: https://dailyjournal.news/news/2026-06-18/datasets-com-21-milhoes-de-musicas-sao-usados-para-treinar-ias
published: 2026-06-18T16:18:14.629383+00:00
updated: 2026-06-18T16:18:14.502+00:00
categories: ["technology"]
topics: ["inteligencia-artificial"]
source_count: 1
outlet_count: 0
language: pt-BR
publisher: "Daily Journal"
---

# Datasets com 21 milhões de músicas são usados para treinar IAs

Investigação revela quatro grandes bancos de dados com músicas protegidas por direitos autorais circulando entre desenvolvedores de IA.

## Pontos principais

- Quatro datasets contendo mais de 21 milhões de gravações musicais foram identificados circulando na comunidade de desenvolvimento de IA.
- Os bancos de dados incluem obras de artistas como Taylor Swift, Bad Bunny, Nirvana e Beatles, além de milhares de músicos independentes.
- O maior dataset, LAION-DISCO-12M, possui 12 milhões de faixas e foi lançado para fins de pesquisa acadêmica, não comercial.
- Empresas como Google e Stability AI utilizaram o Free Music Archive, um dos datasets menores, para treinar seus modelos.
- A indústria musical enfrenta ao menos 12 processos judiciais contra plataformas como Suno e Udio por uso indevido de material protegido.
- Universal Music Group e Warner Music Group firmaram acordos de licenciamento com empresas de IA, enquanto a Sony mantém litígios ativos.
- Plataformas de streaming como a Deezer relatam que músicas geradas por IA já compõem 44% dos novos uploads diários.

Uma investigação conduzida pelo The Atlantic revelou a escala do uso de material protegido por direitos autorais no treinamento de modelos de inteligência artificial. Quatro grandes datasets, que somam mais de 21 milhões de gravações, têm sido compartilhados amplamente entre desenvolvedores. Embora alguns desses bancos de dados tenham sido criados originalmente para fins acadêmicos, como o LAION-DISCO-12M, a ausência de transparência na indústria dificulta a identificação precisa de quais empresas utilizaram cada coleção para o desenvolvimento de seus produtos comerciais. O cenário jurídico é marcado por uma série de processos movidos pela RIAA e grandes gravadoras, que acusam startups como Suno e Udio de infração em massa de copyright. Enquanto parte da indústria optou por acordos de licenciamento e a criação de ambientes controlados para o uso de IA, a Sony Music e outros detentores de direitos continuam a batalha judicial. Paralelamente, o impacto dessas ferramentas é visível no mercado de streaming, onde o volume de faixas sintéticas cresce exponencialmente, levantando preocupações sobre a sustentabilidade financeira dos artistas humanos e a integridade dos direitos autorais.

## Fontes

- [Datasets com 21 milhões de músicas são usados para treinar IAs](https://www.musicbusinessworldwide.com/four-music-datasets-holding-millions-of-tracks-are-being-shared-among-ai-developers-the-atlantic-reports/) (2026-06-18)

## Tópicos relacionados

- [Inteligência Artificial](https://dailyjournal.news/topics/inteligencia-artificial)

---

Publicado por Daily Journal. Versão HTML: https://dailyjournal.news/news/2026-06-18/datasets-com-21-milhoes-de-musicas-sao-usados-para-treinar-ias
