PT-2026-50472 · Vllm · Vllm
CVSS v3.1
7.5
Alta
| Vetor | AV:N/AC:L/PR:N/UI:N/S:U/C:H/I:N/A:N |
Nome do Software Vulnerável e Versões Afetadas
vLLM versões 0.5.5 até 0.23.1rc0
Description
A truncagem de inteiros nas dimensões do tensor nos kernels de desquantização GGUF em
csrc/quantization/gguf/gguf kernel.cu leva ao processamento parcial do tensor. O tensor de saída é alocado em tamanho total via torch::empty, que cria memória não inicializada, mas o kernel CUDA de desquantização processa apenas um número truncado de elementos porque o parâmetro de contagem de elementos k no ponteiro de função to cuda ggml t é definido como um int de 32 bits. Quando o produto das dimensões m * n excede INT MAX, o valor truncado é usado como o tamanho da grade de lançamento do kernel, deixando a parte restante do tensor não preenchida.Em implantações de inferência multi-tenant, essa memória residual da GPU pode conter dados de tensor de solicitações de inferência de outros usuários, resultando em divulgação de informações. Este problema afeta as seguintes funções em
csrc/quantization/gguf/gguf kernel.cu:ggml dequantize()ggml mul mat vec a8()ggml mul mat a8()ggml moe a8()
Recommendations
Atualize o vLLM para a versão 0.23.1rc0 ou posterior.
Exploit
Correção
Information Disclosure
Encontrou algum problema na descrição? Tem algo a acrescentar? Fique à vontade para nos escrever 👾
Identificadores relacionados
Produtos afetados
Vllm