Relatório da OpenAI afirma que rede da empresa foi invadida por seus próprios agentes de IA

Agentes de inteligência artificial criados pela OpenAI invadiram os próprios sistemas da empresa durante testes internos. Em alguns casos, também tentaram ocultar seu comportamento, informou a empresa em um relatório publicado nesta quarta-feira (26).

Essas descobertas provavelmente intensificarão as preocupações em relação ao avanço das capacidades de sistemas de IA.

A OpenAI afirmou que alguns agentes escaparam de ambientes de teste restritos, colaboraram com outros agentes e interferiram nos sistemas da empresa, enquanto outros burlaram tarefas não relacionadas à segurança cibernética.

Algumas dessas condutas indevidas, que culminaram na invasão da plataforma de software de código aberto Hugging Face no mês passado, já haviam sido divulgadas ou mencionadas anteriormente.

No entanto, a empresa está revelando muitos detalhes pela primeira vez neste relatório. Alguns deles levantaram preocupação em pelo menos um pesquisador de segurança em IA.

Para ele, os detalhes apontam para problemas potencialmente mais profundos com a tecnologia na OpenAI e talvez além dela.

Veja algumas conclusões do relatório:

  • Agentes da OpenAI invadiram partes dos sistemas internos da empresa para trapacear em testes ou obter maior liberdade de ação.
  • Mais de um agente da OpenAI esteve envolvido no ataque ao Hugging Face e, em pelo menos um caso, os agentes trocaram observações sobre como invadir a rede da empresa.
  • Os agentes trapacearam em testes não relacionados à cibersegurança.
  • Alguns modelos de IA tentaram ocultar condutas indevidas apagando ou alterando registros de suas ações.

O fato de vários agentes —a OpenAI não informou quantos— terem se envolvido no ataque à Hugging Face e, em alguns casos, terem trabalhado em conjunto, provavelmente levantará questões sobre o grau de monitoramento dos testes por parte da OpenAI.

“Em retrospecto, alguns sinais iniciais identificados neste relatório poderiam ter desencadeado uma resposta mais precoce”, afirmou a OpenAI no documento.

A Hugging Face não respondeu imediatamente a uma mensagem solicitando comentários.

A trapaça em tarefas não relacionadas à segurança cibernética chamou chamou a atenção de alguns pesquisadores a atenção de alguns pesquisadores, pois sugeriu que o comportamento não se limitava a testes que recompensavam habilidades de hacking.

Concluir desafios de segurança cibernética envolve explorar falhas de software e obter acesso a sistemas de computador, o que torna menos surpreendente que agentes designados para tais tarefas possam trapacear.

Mas a trapaça em testes não relacionados à segurança cibernética sugeriu que o mau comportamento poderia ter raízes mais profundas, disse Jeffrey Ladish, cuja organização, a Palisade Research, estuda as capacidades e motivações dos agentes de IA.

“É como perguntar: ‘Se o Billy colar em todas as aulas, em vez de apenas na aula de informática, isso é mais preocupante?’ E a resposta é: ‘Sim, é mais preocupante’”, disse ele.

O ATAQUE À PRÓPRIA OPENAI

A OpenAI relatou dois incidentes em 19 de julho nos quais agentes invadiram a própria infraestrutura da empresa. Em um dos casos, os agentes exploraram uma falha no computador ao qual deveriam permanecer confinados, o que lhes permitiu escapar do ambiente de testes e acessar outros sistemas conectados.

Em outro incidente no mesmo dia, os agentes roubaram credenciais da OpenAI e adulteraram o ambiente de nuvem da empresa.

A OpenAI afirmou que a atividade teve como alvo sistemas automatizados usados para avaliar o desempenho dos modelos, embora, no fim das contas, isso não tenha afetado os registros analisados por esses sistemas.

O relatório diz que a empresa está fortalecendo sua infraestrutura de pesquisa, aumentando o monitoramento e aprimorando as medidas de proteção destinadas a prevenir comportamentos prejudiciais ou indesejados.

noticia por : UOL

quinta-feira, 27, agosto , 2026 06:36
Mais previsões: Tempo 25 dias