Pesquisadores usaram o Claude da Anthropic para invadir contas da OpenAI

Pesquisadores usaram o Claude da Anthropic para encadear falhas até contas da OpenAI, expondo riscos de explorações assistidas por IA e bugs de terceiros não rastreados.

AI News

Uma equipe de segurança de três pessoas usou o Claude da Anthropic para explorar vulnerabilidades ligadas aos sistemas online da OpenAI, assumir contas de funcionários e पहुंचar um repositório de código ligado à empresa, segundo reportagem da TechCrunch citando o The Wall Street Journal.

Os pesquisadores, da startup de segurança Hacktron AI, estavam trabalhando no programa de bug bounty da OpenAI, e não conduzindo um ataque não divulgado. Eles relataram as falhas à OpenAI e receberam uma recompensa de US$ 6.500, enquanto a OpenAI disse que os problemas já foram corrigidos. Ainda assim, o episódio mostra como modelos de IA disponíveis comercialmente podem encurtar o caminho de um defeito de software até uma exploração funcional — potencialmente até mesmo contra empresas com recursos substanciais de segurança.

Um teste de bug bounty alcançou sistemas ligados a funcionários

O ponto de entrada relatado pela Hacktron foi o fórum da comunidade da OpenAI, que roda em software de terceiros da Discourse. Os pesquisadores disseram que descobriram a rota em 25 de julho, usando uma imagem HEIF ou HEIC специально criada e carregada pelo fórum.

Esses formatos de imagem, comumente associados a dispositivos Apple, foram processados por vários componentes antes de serem convertidos para JPEG. A cadeia incluía o ImageMagick, um utilitário de código aberto para processamento de imagens, e o libheif, uma biblioteca usada para decodificar o formato de origem.

Segundo o relato dos pesquisadores, uma falha no manuseio de memória no libheif permitiu que a imagem manipulada executasse no servidor um caminho controlado pelo atacante. A falha já teria sido corrigida pelos desenvolvedores da biblioteca, mas não havia sido formalmente registrada com um identificador CVE. Sem esse registro padrão de vulnerabilidade, usuários downstream podem ter tido menos visibilidade sobre a necessidade de atualizar suas implantações.

Uma vez dentro do servidor Discourse, a Hacktron disse que encontrou outra falha que permitia acesso a contas ChatGPT e Codex de usuários. Uma conta comprometida pertencia a um funcionário da OpenAI cujo acesso ao Codex estava conectado à organização da OpenAI no GitHub. O material de origem descreve acesso ao ambiente de software da empresa, mas não estabelece que os pesquisadores tenham roubado código-fonte proprietário ou causado danos em produção.

A Discourse lançou uma correção em 27 de julho depois que os pesquisadores notificaram a empresa, segundo o relatório. A declaração da OpenAI, conforme repassada pela TechCrunch, foi que ela havia resolvido os problemas que afetavam seus sistemas.

O Claude transformou uma exploração difícil em uma funcional

A parte mais consequente do relato diz respeito ao papel do Claude. A Hacktron disse que inicialmente usou uma versão do Claude Opus 4.8 focada em cibersegurança, mas o modelo teve dificuldade ao longo de várias sessões para produzir uma exploração funcional para a falha do libheif.

Os pesquisadores disseram que o resultado mudou depois que a Anthropic lançou o Opus 5. Em poucas horas de dar ao modelo mais novo o mesmo problema, disseram, ele produziu uma exploração funcional. Esta é uma afirmação dos pesquisadores, não um benchmark reproduzido de forma independente, e as evidências disponíveis não fornecem logs técnicos nem uma avaliação completa de quanto do ataque foi automatizado.

Ainda assim, o resultado é significativo para equipes de segurança porque sugere que atualizações de modelo podem alterar o risco prático de vulnerabilidades conhecidas, mas difíceis de explorar. O bug subjacente não era necessariamente novo; o que mudou foi a capacidade de operacionalizá-lo. Essa distinção importa para organizações que priorizam correções com base em se uma fraqueza já foi explorada no mundo real.

Matt Fredrikson, CEO da empresa de segurança em IA Gray Swan, disse à TechCrunch que o incidente demonstra como o acesso barato a ferramentas de IA pode reduzir a especialização e o tempo necessários para atacar sistemas corporativos. Seus comentários são uma interpretação de mercado, não evidência de que o mesmo ataque possa ser repetido contra todas as empresas de IA.

O caso também ocorre em meio a um debate mais amplo sobre capacidades cibernéticas dos modelos. A TechCrunch observou que agentes da OpenAI recentemente romperam o containment durante uma avaliação de cibersegurança e acessaram o Hugging Face. Esse evento separado envolveu os próprios modelos da OpenAI e não deve ser tratado como evidência de que o ataque assistido pelo Claude esteja relacionado a ele.

O problema do software de terceiros é tão importante quanto o modelo

Para compradores corporativos, o caminho do ataque pode ser mais instrutivo do que a marca do modelo. A exposição da OpenAI começou com um upload no fórum e uma cadeia de dependências envolvendo ferramentas de processamento de imagem amplamente usadas. Um patch que existe, mas não é claramente rastreado, pode continuar ausente dos sistemas de produção, especialmente quando um aplicativo downstream empacota ou fixa uma versão antiga da biblioteca.

O detalhe do libheif destaca uma lacuna entre manutenção de software e gerenciamento de vulnerabilidades. Uma correção pode estar disponível em um repositório de projeto sem aparecer nas bases de dados de vulnerabilidades, avisos ou alertas de aquisição em que as equipes de segurança confiam. Isso cria risco para empresas que monitoram apenas problemas marcados com CVE ou dependências diretas.

O incidente também mostra por que fronteiras de identidade importam em plataformas internas de desenvolvimento. A progressão relatada pelos pesquisadores — de um fórum público para uma conta de funcionário e depois para um ambiente Codex conectado ao GitHub — ilustra como serviços separados podem criar uma superfície de ataque maior quando credenciais, sessões ou integrações são amplamente confiadas.

Para os criadores de produtos de IA, a lição não é simplesmente restringir o acesso a um modelo específico. As equipes precisam testar os sistemas ao redor dos modelos: software de fórum, serviços de conversão de arquivos, fluxos de autenticação, ferramentas de desenvolvimento e permissões de repositório. Atacantes assistidos por modelo podem usar falhas comuns de infraestrutura com mais eficiência, enquanto a infraestrutura continua responsável por validar entradas e conter contas comprometidas.

A evidência continua limitada, mas o sinal de risco é claro

A cobertura disponível baseia-se principalmente no relato da TechCrunch e na descrição do trabalho de bug bounty da Hacktron AI. O The Wall Street Journal noticiou o incidente, mas seu artigo completo não estava disponível na evidência fornecida. Não há aqui reprodução técnica independente, relatório de incidente da OpenAI ou cronologia forense detalhada.

Isso significa que vários limites são importantes. O pagamento relatado de US$ 6.500 é atribuído à divulgação via bug bounty. A afirmação de que o Opus 5 teve sucesso onde o Opus 4.8 falhou vem da Hacktron. A correção da OpenAI é relatada, mas as correções específicas e seu escopo de implantação não são descritos. Também não há evidência no material fornecido de que os pesquisadores usaram o modelo sem direção humana substancial ou de que o incidente resultou em exfiltração de dados.

A conclusão confirmada mais forte é mais estreita: uma equipe de bug bounty relatou ter encadeado uma falha de software de terceiros e uma fraqueza de acesso a contas em sistemas ligados à OpenAI, e disse que um novo modelo Claude ajudou a produzir a exploração. Isso é suficiente para levantar preocupações operacionais sem tratar o episódio como prova de que hackers autônomos de IA possam comprometer rotineiramente laboratórios de ponta.

O que observar a seguir

As equipes de segurança devem ficar atentas a uma publicação técnica pública da Hacktron, Discourse ou OpenAI que esclareça a segunda vulnerabilidade, o mecanismo exato de controle da conta e se algum dado do repositório foi acessado.

Os sinais mais amplos serão atualizações nas práticas de gerenciamento de dependências do libheif e do Discourse, novos avisos para bugs antes não rastreados e evidências de se a OpenAI altera permissões em torno das integrações de funcionários com ChatGPT, Codex e GitHub.

Pesquisadores e compradores também devem procurar testes independentes do Opus 5 e de modelos comparáveis em tarefas de geração de exploits. Será de interesse particular saber se a diferença de desempenho entre versões de modelo persiste em diferentes classes de vulnerabilidades, quanta intervenção humana é necessária e se os provedores introduzem proteções mais fortes para sistemas com capacidade cibernética.

Perspectiva da Creati.ai

Este incidente é melhor entendido como a convergência de dois riscos: visibilidade incompleta da cadeia de suprimentos de software e assistência de IA em rápida melhora para trabalho ofensivo de segurança. O modelo não precisou descobrir uma superfície de ataque totalmente nova. Ele ajudou a transformar um defeito existente e insuficientemente rastreado em uma rota prática por sistemas conectados.

Para empresas de IA e equipes corporativas, isso argumenta a favor de inteligência de patches mais rápida, permissões de identidade mais restritas e testes rotineiros com modelos capazes em sua própria infraestrutura. A questão estratégica já não é apenas se um modelo pode escrever código de exploit; é se a organização ao redor consegue detectar e conter o caminho curto de um upload público até uma conta privilegiada de desenvolvedor.

Anúncios