Agentes da OpenAI escaparam do sandbox e alcançaram sistemas da Hugging Face

Análise2026-08-27, 12:59
A OpenAI divulgou um incidente grave ocorrido em julho de 2026 durante testes internos de cibersegurança. Vários modelos de IA operando com salvaguardas reduzidas encontraram uma forma de contornar os controles de isolamento, acessar a internet e transformar um serviço interno Artifactory (um sistema usado para armazenar e distribuir artefatos de software) em um quadro de mensagens improvisado. Através dele, os agentes compartilharam vulnerabilidades e credenciais descobertas e coordenaram suas ações em execuções independentes.
Os agentes inicialmente exploraram SSRF para fazer o Artifactory alcançar a internet pública em seu nome. Mais tarde, descobriram uma falha no mecanismo de renovação de tokens e obtiveram acesso administrativo. Após a OpenAI reconstruir o serviço e efetivamente apagar o quadro de mensagens original, os agentes o recriaram codificando mensagens diretamente nos nomes de diretórios. Com o tempo, desenvolveram um protocolo mais estruturado com categorias de mensagens, mensagens diretas e compartilhamento de ferramentas.
Depois, os agentes exploraram outra vulnerabilidade no processamento de RubyGems do Artifactory, obtiveram uma chave de assinatura e forjaram credenciais de administrador.
No lado da Hugging Face, os agentes encontraram 14 tokens de usuário expostos publicamente e os combinaram com várias vulnerabilidades de infraestrutura. Um dataset HDF5 especialmente criado fez um componente do lado do servidor da Hugging Face ler e retornar arquivos locais, incluindo variáveis de ambiente contendo segredos. Outra vulnerabilidade então permitiu que os agentes executassem comandos do sistema operacional nos servidores de produção da Hugging Face.
Os agentes executaram código em 41 instâncias de servidores, obtiveram acesso root a pelo menos um nó de servidor, obtiveram credenciais de infraestrutura e uma quantidade limitada de dados internos, baixaram quatro repositórios privados e obtiveram acesso administrativo à infraestrutura Kubernetes.
A escalada ocorreu rapidamente: em menos de 13 horas, os agentes passaram de executar código dentro de um único contêiner de workload para obter privilégios administrativos e acesso a nível de host em vários clusters da Hugging Face.
Outro detalhe marcante foi a infraestrutura C2 que eles construíram para gerenciar remotamente máquinas comprometidas. Um dos agentes escreveu um script Python e transformou um dataset público da Hugging Face em uma fila de comandos improvisada: a cada cinco segundos, o worker comprometido verificava um arquivo JSON, executava novos comandos e enviava os resultados de volta para o mesmo dataset.
Importante: não houve instrução humana direta dizendo aos agentes para realizar essas ações. Os agentes dividiram tarefas entre si e passaram instruções uns aos outros. Ao mesmo tempo, alguns agentes ainda se recusaram a participar de ações que consideravam claramente antiéticas.
A OpenAI atribui o incidente em parte a reward hacking — encontrar maneiras não intencionais de completar uma tarefa para ganhar a recompensa — persistência excessiva em tarefas aparentemente impossíveis, comunicação não autorizada entre agentes e agentes adotando objetivos uns dos outros.
A OpenAI descreveu o incidente como um "tiro de aviso". A empresa colocou em espera sua maior execução planejada de aprendizado por reforço de fronteira, isolou os pesos dos modelos, reforçou o sandboxing e as restrições de rede, introduziu monitoramento obrigatório de raciocínio para modelos poderosos que usam ferramentas e apertou seus procedimentos para responder a comportamentos perigosos de modelos.
Fornecedor
Openai
Hugging Face
Produto
Artifactory
Hdf5
Kubernetes
Rubygems