Notícias

Claude invade acidentalmente empresas reais durante testes de segurança

O caso mais grave envolveu o Claude Opus 4.7, que extraiu credenciais e dados de produção mesmo após admitir que estava atacando sistemas reais.
Claude invade acidentalmente empresas reais durante testes de segurançaGettyimages.ru / Yuen Man Cheung

A empresa americana Anthropic revelou na quinta-feira (30) que três de seus modelos de inteligência artificial (IA) Claude acessaram sistemas de outras três organizações sem autorização entre abril e julho de 2026, durante avaliações de segurança cibernética.

Os incidentes ocorreram quando os modelos — Opus 4.7, Mythos 5 e um modelo de pesquisa interno — participavam de desafios de "captura da bandeira" e, devido a uma configuração incorreta, tiveram acesso à internet real, apesar de terem sido informados de que estavam operando em simulações isoladas.

Os modelos comprometeram infraestruturas reais se aproveitando de vulnerabilidades como senhas fracas e técnicas básicas como injeção de SQL (um ciberataque que insere código malicioso nos campos de entrada de uma aplicação). O caso mais grave envolveu o Opus 4.7, que extraiu credenciais e dados de produção mesmo "sabendo" que estava atacando sistemas reais.

O grupo Mythos 5 publicou um malware no PyPI (o repositório oficial de software de terceiros para a linguagem de programação Python) que foi baixado por 15 sistemas. No entanto, o modelo de pesquisa mais recente interrompeu o ataque ao reconhecer que estava operando em um ambiente real.

Duas das três organizações afetadas não detectaram as intrusões imediatamente; a Anthropic as reportou após uma auditoria interna de 141.006 execuções de avaliação, iniciada depois que a OpenAI relatou um incidente semelhante em 21 de julho. A empresa atribui as falhas a erros operacionais e à falta de controles adequados nos ambientes de avaliação, e não a problemas de alinhamento de modelos.

A Anthropic suspendeu todas as avaliações cibernéticas em 23 de julho e anunciou reforços em seus protocolos de segurança, incluindo monitoramento contínuo e controles mais rigorosos com fornecedores terceirizados. A empresa incentiva outros laboratórios de IA a realizarem revisões semelhantes e publicará transcrições editadas do incidente para análise independente.