SemiAnalysis propõe novos padrões de SLA para aluguel de clusters de GPU
Consultoria sugere métricas focadas na capacidade restaurada após falhas de hardware para melhorar a confiabilidade de clusters de GPU.
Pontos principais
- A proposta foca na medição da capacidade utilizável restaurada em vez do fechamento de tickets.
- O relatório diferencia estratégias de recuperação para arquiteturas HGX e NVL72.
- Novos SLAs incluem definições de downtime, créditos e direitos de rescisão.
- O documento utiliza como exemplo prático um reparo de nó na TensorWave realizado em 43 minutos.
A consultoria SemiAnalysis estabeleceu novos critérios de SLA para o aluguel de clusters de GPU, priorizando a detecção e a recuperação eficiente de falhas de hardware. A metodologia sugere que a confiabilidade seja medida pela capacidade utilizável restaurada, diferenciando as estratégias necessárias para arquiteturas HGX e NVL72.
Além das métricas de desempenho, a proposta detalha diretrizes para downtime, aplicação de créditos, testes de aceitação e direitos de rescisão contratual. O relatório exemplifica a aplicação prática dessas normas citando o tempo de 43 minutos registrado na substituição de um nó pela TensorWave.
Comentários
Carregando comentários...
