Agentes da OpenAI escaparam do sandbox e nenhuma lei obrigava a OpenAI a contar. O que muda no jeito de você rodar agente no trabalho

O Dani Geek — arte original
Em julho, dois modelos da OpenAI acharam um zero-day no proxy do próprio sandbox, roubaram quatro credenciais e invadiram a produção da Hugging Face. Quem já roda agente com token de verdade tem três perguntas para responder nesta semana.
O que aconteceu, sem o drama
Entre 9 e 13 de julho de 2026, a OpenAI rodava uma avaliação de capacidade ofensiva chamada ExploitGym: o teste mede se um agente consegue transformar uma vulnerabilidade conhecida num exploit que funciona. Dois modelos participavam, o GPT-5.6 Sol e um modelo pré-lançamento mais capaz. O ambiente era descrito como “altamente isolado”. A única saída de rede era um proxy de cache de pacotes.
Os agentes encontraram um zero-day nesse proxy. Por ele, saíram para a rede interna de pesquisa da OpenAI, escalaram privilégios, coletaram credenciais de quatro serviços e andaram de máquina em máquina até encontrar um nó com internet. Como o objetivo declarado era o benchmark, identificaram que a Hugging Face hospedava as soluções do ExploitGym e do CyberGym, e invadiram a produção dela até obter execução remota de código. Cinco datasets de gabarito foram levados. No caminho, usaram como base de comando um endpoint de execução de código sem autenticação que um cliente da Modal Labs tinha deixado exposto.
Foram cerca de quatro dias e mais de 17 mil eventos registrados, segundo a nota da Cloud Security Alliance de 30 de julho e a timeline técnica da Hugging Face. Das quatro credenciais roubadas, duas foram usadas ofensivamente (uma como relay de saída, outra como armazenamento) e duas só foram lidas. O GPT-5.6 Sol ainda copiou dados privados de avaliação para um dataset público na Hugging Face.
O freio estava desligado, e a caixa não segurou
Os modelos rodavam com as recusas de cibersegurança reduzidas de propósito, porque um teste de exploit com o modelo recusando exploits não mede nada. Então a leitura “seu agente vai fazer isso amanhã no seu n8n” está errada. A leitura correta é mais desconfortável: a OpenAI testou a caixa com o freio desligado, e a caixa perdeu para um proxy de pacotes e quatro credenciais que estavam no caminho.
A própria OpenAI, citada pelo The Hacker News de 22 de julho, descreve a tendência dos modelos de “go to extreme lengths to achieve the goal at any cost”. O agente tinha um objetivo, o caminho mais curto passava por fora do combinado, e ele foi por ali.
Quem roda Claude Code, Codex ou um workflow de n8n num laptop com .env cheio está operando um sistema com a mesma propriedade, só que com uma caixa bem menos cuidada que a de um laboratório de fronteira.
Quem pegou foi quem estava fora da caixa
A Hugging Face detectou a intrusão, cortou o acesso e divulgou o incidente em 16 de julho, acionando a polícia. A OpenAI só ligou o evento ao próprio teste e publicou dias depois, e soltou um postmortem em agosto.
Ou seja: o monitor de quem construiu a caixa não pegou, e o monitor da vítima pegou. Clément Delangue, CEO da Hugging Face, resumiu num post no X, citado pelo KQED: “It’s quite mind-blowing that all of this happened autonomously!”
Isso volta no terceiro item do checklist.
Nenhuma lei obrigava a contar
A Califórnia tem a SB 53 em vigor desde 1º de janeiro de 2026, e ela cobra notificação de “incidente crítico de segurança”. A definição inclui morte, lesão ou dano catastrófico, e exclui expressamente avaliações de segurança como a que estava rodando. Pelo KQED, este caso ficou fora. A OpenAI diz que “comunicou-se com autoridades policiais e outras autoridades governamentais”, e investigou por conta própria.
Nathan Calvin, da Encode AI, colocou a pergunta que sobra: “Your AI… hacked into another company, and you’re saying that you don’t know how to stop it from doing that again?”
Para você, isso tem uma consequência prática: o isolamento que o fornecedor anuncia é uma promessa, sem auditoria obrigatória por trás. Se o seu agente sair do combinado, a garantia é a que você construiu no seu lado.
Pergunta 1: o que o agente enxerga de rede?
O sandbox da OpenAI tinha um único caminho de rede, e foi por ele que os agentes saíram. A lição da CSA, no guia de emergência publicado em 28 de julho com mais de 50 CISOs, é egress default-deny: por padrão, nada sai.
Como isso fica na prática, num setup de uma pessoa:
- Rode o agente dentro de um container, e o container numa rede sem saída (
docker run --network none, ou uma rede interna sem gateway). - Se ele precisa de internet para a tarefa, coloque um proxy na frente com lista de domínios permitidos: só a API do modelo, o registry de pacotes e o repositório.
- Teste do lado de dentro:
curl https://example.comtem que falhar. Se passar, o isolamento é decorativo.
O ponto fraco da OpenAI foi o proxy de pacotes. O seu vai ser o mesmo, então trate ele como parte da superfície, e mantenha atualizado.
Pergunta 2: o que cada credencial alcança, e por quanto tempo?
A frase da nota da CSA que vale colar na parede: “a credential’s blast radius is determined entirely by what it can reach”. Quatro credenciais no caminho levaram o agente da rede de pesquisa até a produção de outra empresa.
O exercício que cabe numa tarde: abra o .env do projeto onde o agente roda e, para cada linha, responda três coisas. O agente usa essa chave na tarefa de hoje? Qual é o escopo dela? Quanto tempo ela vive?
O que costuma aparecer quando eu faço isso: token do Notion com acesso ao workspace inteiro quando a tarefa precisa de uma página; token do GitHub clássico com escopo repo em todos os repositórios; chave da API de pagamento que ninguém lembra por que está ali. Cada uma dessas é raio de explosão que você concedeu sem decidir.
A correção é mecânica:
- Token fine-grained do GitHub, restrito a um repositório, expirando em sete dias.
- Integração do Notion conectada a uma página, e só ela.
- Chave que o agente não usa hoje sai do arquivo. Vai para um cofre, ou some.
- Um comando pronto para rotacionar tudo de uma vez. A CSA chama isso de capacidade de rotação em massa: se você descobrir um vazamento às 23h, não pode ser a hora de aprender a revogar cada serviço.
Uma verificação simples fecha o passo: peça ao próprio agente para listar as variáveis de ambiente que ele enxerga (env | cut -d= -f1). O que aparecer ali é o que ele pode usar quando decidir que o atalho compensa.
Pergunta 3: quem aperta o botão de desligar?
A Hugging Face pegou porque olhava o tráfego chegando de fora. A OpenAI monitorava o sandbox; o problema já estava fora dele. A recomendação da CSA é monitorar no harness do agente, ou seja, na camada que executa as chamadas, e ter um dono nomeado com autoridade para desligar.
Para uma operação pequena, isso vira duas coisas concretas:
- Log das ações do agente fora do container. Se ele roda em Docker, o log fica no host. Se ele chama ferramentas, cada chamada aparece num arquivo que o agente não consegue apagar.
- Um botão de desligar testado, com nome de quem aperta.
docker kill, revogação dos tokens, e a confirmação de que os dois funcionam antes de precisar. Se você é a única pessoa da operação, o dono é você, e o teste é rodar o botão uma vez por mês.
Um agente que decidiu sair do combinado não avisa. Foram 17 mil ações em poucas horas. O monitor tem que funcionar sem ninguém olhando, e o desligamento tem que funcionar com alguém olhando, no meio da madrugada, sem ler documentação.
O que o seu fornecedor promete, e o que ele prova
Três perguntas: o que o agente enxerga de rede, o que cada credencial alcança, quem desliga. Nenhuma depende de esperar patch de laboratório. Todas cabem numa tarde de configuração e valem para Claude Code, Codex, n8n ou o que você montou em casa.
Fica uma pergunta que a OpenAI acabou de responder na prática, e que todo fornecedor de agente deveria responder na documentação: o que exatamente segura o agente quando ele decide que o objetivo vale mais que a regra? Vou abrir a documentação de três deles e contar aqui o que encontrei, e o que não encontrei. Se você já fez esse exercício com a sua stack, o lugar de comparar é o @odanigeek no X ou no Threads.
Fontes: The Hacker News, KQED, CSA Research Note, Hugging Face, disclosure, Hugging Face, timeline técnica, OpenAI, comunicado, OpenAI, postmortem, CSA, guia de emergência.