PT-2026-50472 · Vllm · Vllm

·

CVE-2026-53923

·

Publicado

2026-06-17

·

Atualizado

2026-07-13

CVSS v3.1

7.5

Alta

VetorAV:N/AC:L/PR:N/UI:N/S:U/C:H/I:N/A:N
Nome do Software Vulnerável e Versões Afetadas vLLM versões 0.5.5 até 0.23.1rc0
Description A truncagem de inteiros nas dimensões do tensor nos kernels de desquantização GGUF em csrc/quantization/gguf/gguf kernel.cu leva ao processamento parcial do tensor. O tensor de saída é alocado em tamanho total via torch::empty, que cria memória não inicializada, mas o kernel CUDA de desquantização processa apenas um número truncado de elementos porque o parâmetro de contagem de elementos k no ponteiro de função to cuda ggml t é definido como um int de 32 bits. Quando o produto das dimensões m * n excede INT MAX, o valor truncado é usado como o tamanho da grade de lançamento do kernel, deixando a parte restante do tensor não preenchida.
Em implantações de inferência multi-tenant, essa memória residual da GPU pode conter dados de tensor de solicitações de inferência de outros usuários, resultando em divulgação de informações. Este problema afeta as seguintes funções em csrc/quantization/gguf/gguf kernel.cu:
  • ggml dequantize()
  • ggml mul mat vec a8()
  • ggml mul mat a8()
  • ggml moe a8()
Recommendations Atualize o vLLM para a versão 0.23.1rc0 ou posterior.

Exploit

Correção

Information Disclosure

Encontrou algum problema na descrição? Tem algo a acrescentar? Fique à vontade para nos escrever 👾

Enumeração de Fraquezas

Identificadores relacionados

CVE-2026-53923
GHSA-5JV2-G5WQ-CMR4
PYSEC-2026-3403

Produtos afetados

Vllm