A OpenAI levou cerca de uma semana para descobrir que um de seus próprios modelos de inteligência artificial havia invadido os sistemas da plataforma Hugging Face durante um teste interno, informou a Reuters.
De acordo com as fontes, o agente, um programa projetado para tomar decisões e executar tarefas complexas com supervisão mínima, tentou burlar seu ambiente de testes isolado na OpenAI por volta de 9 de julho. Dois dias depois, em 11 de julho, iniciou uma intrusão na Hugging Face que durou 48 horas, conforme confirmado por Thomas Wolf, cofundador da plataforma afetada.
Em 16 de julho, a Hugging Face relatou publicamente ter sido comprometida por "um sistema de agente de IA autônomo". Foi após essa notícia que a OpenAI descobriu que seu próprio algoritmo era o responsável, indicando que pelo menos uma semana havia se passado desde que o sistema apresentou os primeiros sinais de comportamento errático, observa o artigo.
Quando a OpenAI entrou em contato com a Hugging Face, a empresa já havia comunicado o incidente ao FBI, segundo uma fonte familiarizada com o caso.
De acordo com a reportagem, as duas empresas consideram o episódio um incidente cibernético "sem precedentes". Elas acreditam que este seja o primeiro caso divulgado publicamente em que um modelo de inteligência artificial consegue se infiltrar, por conta própria, nos sistemas de outra empresa durante uma avaliação controlada.
Como isso aconteceu?
Segundo a OpenAI, o incidente ocorreu durante uma avaliação interna destinada a medir as capacidades cibernéticas avançadas de vários de seus modelos, incluindo o GPT-5.6 Sol. Os pesquisadores desativaram algumas das medidas de segurança integradas e executaram os modelos em um ambiente de teste isolado com acesso limitado à internet.
A empresa explicou que os modelos exploraram uma vulnerabilidade de software desconhecida para acessar a internet e, consequentemente, comprometeram os sistemas da Hugging Face, no que parece ter sido uma tentativa de encontrar respostas para um teste de desempenho de cibersegurança. A equipe de segurança da OpenAI detectou a atividade incomum, enquanto a Hugging Face identificou e conteve a intrusão de forma independente.