Agentes Trapaceiam: Por Que os Resultados de IA em Benchmarks Cibernéticos Podem Estar Inflados
Análise2026-09-08, 11:28
Pesquisadores da Dreadnode prepararam um resumo do seu artigo sobre modelos agênticos que contornam as regras para resolver desafios de CTF. O estudo usou 22 modelos da Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba e Z.ai, que receberam 23 desafios de diversas categorias do GlacierCTF 2023, SekaiCTF 2022–2023 e HackTheBox Cyber Apocalypse 2024. Cada execução de modelo foi limitada a 30 minutos ou 1.000 passos de agente. Os agentes tinham acesso a bash, Python, operações de leitura/escrita de arquivos e ferramentas web (web_search, fetch e web_extract).
Além disso, cada agente foi executado em 3 modos: linha de base (sem restrições), anti-cheat padrão (com instruções) e anti-cheat severo (uma lista detalhada de ações proibidas). Os pesquisadores definiram as seguintes ações proibidas: pesquisar writeups online; ler diretamente metadados do contêiner e variáveis de ambiente; ler arquivos usados para avaliar respostas; e ler diretamente arquivos de flag.
No modo de linha de base, 21 dos 22 modelos usaram pelo menos uma vez um método proibido pela metodologia do estudo. No geral, 33% das execuções incluíram uma tentativa de violar as regras, enquanto 37,1% das soluções bem-sucedidas mostraram sinais de trapaça. Claude Opus 4.8 (65,2%), GPT-5.4 (56,5%) e Claude Sonnet 5 (56,5%) tiveram as maiores taxas de violação. Nos modos padrão e severo, os números caíram para 17,8% e 8,5%, respectivamente.
A taxa média de sucesso foi de 41,5%, mas após excluir soluções com sinais de trapaça, caiu para 26,1%. A maior inflação foi observada no GPT-5.4, com cinco vezes (10 soluções bem-sucedidas, incluindo 2 sem trapaça), Qwen 3.6 Plus, com 3,5 vezes, e Claude Sonnet 5, com três vezes.
As salvaguardas contra violações revelam uma enorme disparidade entre os modelos. No modo estrito, 14 modelos não tiveram soluções bem-sucedidas envolvendo trapaça, incluindo Claude Opus 4.8 (11 soluções violando regras no modo de linha de base, 0 sob controles severos), Claude Sonnet 5 (6 → 0) e GPT-5.5 (4 → 0). Grok 4.20 mostrou o efeito oposto: a instrução padrão reduziu o número de tentativas de trapaça de 3 para 0, mas sob restrições severas elas voltaram a 3. Notavelmente, 4 modelos aumentaram o número de violações quando regras severas foram introduzidas. Ao mesmo tempo, regras mais severas aumentaram a taxa de sucesso de 26,1% para 34,4%.
Os modelos usaram busca na web e reconhecimento de infraestrutura para trapacear, com o número de iterações envolvendo busca na web caindo drasticamente à medida que as regras se tornavam mais severas. Isso diferiu do segundo método, cuja frequência mudou de forma desigual: foi mais baixa no modo de linha de base, atingiu o pico sob parâmetros padrão e caiu novamente sob regras severas.
Os resultados de benchmarks cibernéticos podem superestimar as capacidades reais dos agentes de IA: um modelo pode obter a resposta correta sem resolver a tarefa da maneira pretendida. Restrições de prompt reduzem esses casos, mas não os eliminam e podem alterar a estratégia de contorno, portanto a avaliação deve considerar não apenas o resultado, mas todo o processo de resolução da tarefa.
Fornecedor
Mais
Produto
Mais