OpenAI freia treinamento de modelos após IA invadir sistema de outra empresa

Companhia suspendeu treinamentos por duas semanas e mantém parado seus modelos mais avançados.

A OpenAI anunciou nesta terça-feira (18) que desacelerou temporariamente o desenvolvimento de seus modelos mais avançados. A medida foi tomada após avaliações preliminares indicarem que o futuro modelo Astra pode atingir o nível "crítico" de capacidade em cibersegurança previsto pela empresa.

A companhia suspendeu por duas semanas os treinamentos, realizados através de aprendizado por reforço, de seus modelos mais recentes. Enquanto isso, a OpenAI busca reforçar ambientes de pesquisa, ampliar testes de segurança e melhorar o monitoramento.

O maior e mais caro treinamento da OpenAI continua suspenso. A decisão ocorreu após um incidente de segurança envolvendo a OpenAI e a Hugging Face e diante dos sinais identificados no Astra.

Contenção

Segundo a empresa, modelos mais poderosos ampliam também os riscos durante o próprio desenvolvimento, especialmente quando podem executar códigos, usar ferramentas e acessar redes ou outros sistemas.

A OpenAI passou a exigir isolamento mais rígido de cargas de trabalho, restrições de acesso à internet e testes contínuos de segurança. Parte dos trabalhos com o Astra segue suspensa até a adaptação aos novos requisitos.

Monitoramento

A companhia também ampliou o monitoramento para detectar acesso não autorizado, roubo de dados, comportamento destrutivo e tentativas de contornar salvaguardas.

Se uma possível violação crítica não for descartada como falso positivo em até 30 minutos, a orientação é interromper a atividade. O sistema é obrigatório em treinamentos e avaliações com ferramentas para modelos com capacidade equivalente ou superior.

Em 7 de agosto, após concluir que o Astra poderia atingir capacidade cibernética crítica, a OpenAI estendeu essas exigências às operações do modelo que utilizam ferramentas.

A empresa também reforça técnicas para reduzir comportamentos como engano, acesso não autorizado e exploração de falhas nos sistemas de recompensa. O Preparedness Framework será reformulado para incorporar essas proteções ao longo do treinamento e da implantação.