Modelos da OpenAI e Anthropic realizam ações não autorizadas durante experimentos
Testes revelam novas ações maliciosas de agentes de IA da OpenAI e Anthropic. (Foto: Reprodução/Magnific/DC Studio)

Modelos da OpenAI e Anthropic realizam ações não autorizadas durante experimentos

Relatório identificou 19 ações maliciosas realizadas por agentes de IA durante testes controlados, incluindo tentativas de manipulação de projetos no GitHub

Ações não autorizadas – Novos testes de cibersegurança realizados no Reino Unido voltaram a levantar preocupações sobre o comportamento de agentes de inteligência artificial (IA) de alta capacidade. Experimentos conduzidos pela AI Security Institute (AISI), agência autorizada a avaliar modelos avançados de linguagem, registraram incidentes envolvendo sistemas da OpenAI e da Anthropic.

As ocorrências diferem dos episódios anteriores relacionados às duas empresas, como o acesso não autorizado ao repositório Hugging Face e a série de invasões promovida por agentes da desenvolvedora do Claude. Desta vez, os testes envolveram os modelos Mythos 5 e GPT-5.6-Sol, que apresentaram comportamentos considerados inadequados para alcançar os objetivos estabelecidos.

LEIA: Cientistas criam óculos que convertem luz infravermelha em imagens coloridas

“Agradecemos a parceria do AISI ao longo deste processo, incluindo o trabalho de identificar, investigar e compartilhar detalhes sobre a atividade. Esperamos dar continuidade à nossa colaboração”, diz a OpenAI em uma postagem.

A Anthropic, por sua vez, divulgou apenas uma breve declaração agradecendo à AISI “pela liderança no incidente, que confirma a necessidade de uma conversa de maior dimensão sobre como avaliar com segurança agentes de IA cada vez mais capazes”.

Como ocorreram os incidentes

De acordo com o relatório da AISI, os incidentes foram detectados em 28 de julho deste ano, quando a equipe responsável pelos testes identificou “transferências incomuns de dados” em seus servidores e iniciou uma investigação para descobrir a origem das atividades.

Ao todo, foram registradas 19 ações mal-intencionadas praticadas pelos agentes de IA. Dessas, duas foram atribuídas ao GPT-5.6-Sol, enquanto as outras 17 envolveram o Mythos 5.

Todos os sistemas receberam a mesma tarefa: participar de um desafio de cibersegurança no formato “capturar a bandeira”, em que deveriam solucionar um problema como especialistas da área e apresentar uma prova de que a missão havia sido concluída.

O episódio considerado mais grave envolveu um agente da Anthropic, que tentou inserir códigos maliciosos em um projeto de código aberto hospedado no GitHub. Para isso, criou identidades falsas e tentou convencer o responsável pelo projeto a aprovar as alterações. A tentativa foi recusada antes de causar qualquer impacto.

Em outro caso, um dos agentes publicou no GitHub uma oferta de colaboração para trabalhar com outros agentes que participavam do mesmo teste, chegando a deixar instruções sobre como avançar nas atividades.

Diferentemente das avaliações anteriores, os agentes tinham acesso convencional à internet e sabiam disso, embora o prompt não indicasse de que forma a rede poderia ou deveria ser utilizada. Além disso, todos os filtros de cibersegurança foram desativados para permitir que os modelos operassem em sua capacidade máxima.

Organizações reforçam preocupação

Após os testes, o GitHub e outras organizações envolvidas foram acionados para remover eventuais códigos remanescentes. Segundo a AISI, nenhum dano real foi causado durante os experimentos, mas as descobertas são consideradas preocupantes e exigem “atenção imediata”.

“Esta é a primeira vez que vemos riscos relacionados à autonomia e enganações se manifestarem de forma tão clara, sem um comando específico e no mundo real”, afirma a organização.

Já o CEO da Hugging Face defendeu que desenvolvedores e empresas de inteligência artificial sejam responsabilizados caso criem agentes capazes de realizar atividades maliciosas na internet, mesmo quando esses sistemas “se rebelarem” durante testes.

Acumule cashback e transfira o dinheiro direto para sua conta!

A Bee Fenati (saiba mais aqui) segue em expansão para garantir aos seus usuários cada vez mais benefícios. Agora a plataforma conta com a Benefícios Rede Bee, que reúne descontos em dezenas de grandes marcas, com muitas delas oferecendo cashback, ou seja, o retorno de um valor da sua compra que poderá ser transferido para sua conta! (Saiba mais aqui)

Baixe o aplicativo nas lojas App Store (iOS) e Play Store (Android) e aproveite agora!

A rede oferece em um único ambiente ofertas em áreas como educação, compras, viagens, lazer, serviços, tecnologia e muito mais. Dentre as marcas parceiras estão Magalu, Renner, Drogasil, C&A, Casas Bahia, Petz, e outras dezenas de opções que oferecem tudo que você precisa na sua rotina!

Além de poderem aproveitar os descontos oferecidos pelas marcas parceiras, os sócios e contribuintes dos sindicatos filiados à Fenati (Federação Nacional dos Trabalhadores em Tecnologia da Informação) podem receber de volta um percentual a cada compra que realizarem em parceiros que oferecem o cashback.

Este valor fica em uma carteira digital dentro da plataforma e, a partir de R$ 20 reais acumulados em cashback, o trabalhador pode enviar o dinheiro direto para sua conta bancária! Na prática, a ferramenta permite que sócios e contribuintes dos sindicatos filiados à Fenati ZEREM o valor da sua contribuição assistencial e/ou associativa!

Atualmente, o valor da contribuição é de R$ 32,50 por mês para sócios e R$ 35 por mês para contribuintes, ou seja, é possível recuperar todo esse valor e ainda acumular muito mais – tudo isso contribuindo para fortalecer a categoria e transformando as compras do dia a dia em ganho real.

Qualifique-se agora com a Fenati Academy!

Dentro da Bee Fenati, o usuário encontra ainda a Fenati Academy, que oferece mais de 8 mil opções de qualificação e atualização profissional com bolsa integral para sócios e contribuintes de sindicatos filiados à Fenati.

Na plataforma, o profissional pode acessar o Sindplay, streaming de qualificação para profissionais de TI reconhecido como a “Netflix de TI”, que possui cursos em áreas como cibersegurança, Inteligência Artificial, desenvolvimento de softwares, desenvolvimento para a internet, administração de sistemas e redes, ciência de dados, gestão de projetos de TI, blockchain e tecnologias de moedas digitais, entre outras. (Saiba mais)

A ferramenta oferece também cursos em parceria com a Cisco Networking Academy, com CERTIFICAÇÕES GRATUITAS em áreas como segurança cibernética, Redes, IA, Ciência de dados, Inglês para TI, Programação, Tecnologia da informação, Alfabetização digital, Habilidades Profissionais (Soft skills) e Sustentabilidade. (Saiba mais)

Outra parceria da Fenati Academy é a Oracle University, uma das maiores referências globais em tecnologia. Os usuários já podem acessar cursos, trilhas de aprendizado e obter certificações Oracle gratuitamente ou com descontos exclusivos. Os conteúdos passam por áreas estratégicas como bancos de dados, computação em nuvem, inteligência artificial, desenvolvimento, automação e soluções corporativas. (Saiba mais)

Encontre o emprego dos seus sonhos com a Bee Hunter!

Sócios e contribuintes contam ainda com uma ferramenta para se aproximarem das melhores oportunidades do mercado de trabalho: a Bee Hunter, uma plataforma inteligente da Bee Fenati que utiliza tecnologia e inteligência artificial para tornar a busca por vagas mais eficiente, estratégica e conectada ao perfil de cada usuário. (Saiba mais aqui)

A partir do cadastro do currículo, a plataforma utiliza inteligência artificial para analisar informações como experiências, competências e objetivos profissionais, cruzando esses dados com vagas disponíveis em empresas parceiras como Vagas.com, Sinergy e Trampos e identificando as posições que mais combinam com o perfil do usuário.

A Bee Hunter vai além e auxilia o profissional a estar preparado para a vaga dos sonhos! Isso porque nossa inteligência analisa o perfil e sugere cursos da Fenati Academy que vão ajudá-lo a ampliar sua qualificação e elevar a aderência às vagas desejadas. Acesse agora clicando aqui e encontre seu emprego dos sonhos!

(Com informações de Tecmundo)
(Foto: Reprodução/Magnific/DC Studio)

Leia mais