Vllm · Vllm · CVE-2026-54234
**Nome do Software Vulnerável e Versões Afetadas**
vLLM versões anteriores a 0.24.0
**Description**
Uma falha no amostrador de rejeição durante cargas de trabalho de decodificação especulativa de múltiplas solicitações permite a produção de um token recuperado igual ao valor limite do vocabulário do modelo. Este valor é convertido em menos um quando o mecanismo seleciona o próximo token ativo e é gravado nos ids de entrada do drafter. Esse valor fora do vocabulário é posteriormente processado pelo caminho de incorporação e atenção do modelo, resultando em uma asserção do lado do dispositivo GPU que trava o worker do mecanismo. Esta condição pode ser acionada remotamente através dos endpoints gRPC 'Generate' e 'Abort', permitindo que um cliente cause uma negação de serviço em todo o serviço ao abortar solicitações simultâneas e travar o worker compartilhado do mecanismo.
**Recommendations**
Atualize o vLLM para a versão 0.24.0.