---
title: "vLLM adiciona suporte para Speculative Decoding com Pipeline Parallelism"
url: https://dailyjournal.news/news/2026-09-08/vllm-adiciona-suporte-para-speculative-decoding-com-pipeline-parallelism
published: 2026-09-08T22:40:37.245908+00:00
updated: 2026-09-08T22:40:37.245908+00:00
categories: ["technology"]
source_count: 1
outlet_count: 0
language: pt-BR
publisher: "Daily Journal"
---

# vLLM adiciona suporte para Speculative Decoding com Pipeline Parallelism

A nova atualização do vLLM permite combinar Speculative Decoding e Pipeline Parallelism para otimizar o uso de GPUs em modelos de larga escala.

## Pontos principais

- A funcionalidade de Speculative Decoding (DSpark) agora é compatível com Pipeline Parallelism no vLLM.
- O desenvolvimento foi realizado pelos colaboradores yongqinwang-cmd e Inferact.
- A melhoria visa otimizar a eficiência de hardware para modelos massivos, como o Kimi K3 de 2,8 trilhões de parâmetros.

O framework vLLM implementou suporte para o uso simultâneo de Speculative Decoding e Pipeline Parallelism. A atualização, desenvolvida pelos colaboradores yongqinwang-cmd e Inferact, atende a uma demanda por maior eficiência no processamento de modelos de grande escala. A integração permite que configurações que exigem Pipeline Parallelism utilizem o Speculative Decoding para otimizar o desempenho de GPUs, facilitando a execução de modelos como o Kimi K3, que possui 2,8 trilhões de parâmetros.

## Fontes

- [@SemiAnalysis_: Spec Decoding (DSpark) finally works with Pipeline Parallelism in vLLM!! 🔥 A lot of the GPU poor/proletarian have been asking for this feature for a while now, but it took the rec…](https://x.com/SemiAnalysis_/status/2097445137521524787) (2026-09-08)

---

Publicado por Daily Journal. Versão HTML: https://dailyjournal.news/news/2026-09-08/vllm-adiciona-suporte-para-speculative-decoding-com-pipeline-parallelism
