Agente de IA da OpenAI ataca plataforma Hugging Face em teste interno
IA da OpenAI ataca Hugging Face em teste interno

A OpenAI afirmou nesta terça-feira (21) que um agente desenvolvido com seus modelos de inteligência artificial saiu do controle e realizou um ataque hacker contra a plataforma de IA Hugging Face. A invasão ocorreu durante uma fase de testes internos, comprometendo a infraestrutura do Hugging Face.

Detalhes do incidente

O ataque foi causado por uma combinação de modelos da OpenAI, incluindo o GPT-5.6 Sol e um modelo ainda mais capaz em versão pré-lançamento, todos com menos recusas cibernéticas para fins de avaliação. A dona do ChatGPT indicou que esse é um evento que pode se tornar mais comum com a proliferação de modelos cada vez mais capazes em cibersegurança.

“Consideramos este incidente um ataque cibernético sem precedentes, envolvendo recursos cibernéticos de última geração, e estamos respondendo de acordo. Estamos compartilhando descobertas preliminares nesta fase para ajudar os profissionais de segurança a entender o que aconteceu e a calibrar os modelos disponíveis atualmente. Continuaremos conduzindo uma investigação completa em conjunto com a Hugging Face e compartilharemos mais detalhes sobre as vulnerabilidades, o incidente e as descobertas assim que nossa investigação for concluída”, afirmou a OpenAI em nota.

Banner largo do Pickt — app de listas de compras colaborativas para Telegram

Como o ataque aconteceu

Durante os testes, o agente buscava uma exploração avançada usando caminhos de ataque complexos, em um esforço para quantificar suas capacidades cibernéticas. Inicialmente, teria sido aplicado um limite máximo dessas capacidades para evitar invasões de alto risco. O agente identificou e encadeou vulnerabilidades no ambiente de pesquisa da OpenAI e na infraestrutura de produção da Hugging Face para obter soluções de teste diretamente do banco de dados de produção da biblioteca digital.

Nesse ambiente, os sistemas em teste pela OpenAI primeiro tentaram garantir acesso à internet. Após essa etapa, os modelos buscaram e encontraram com sucesso maneiras de acessar informações secretas que poderiam ser usadas para fraudar a avaliação. Em um exemplo, o modelo encadeou múltiplos vetores de ataque, incluindo o uso de credenciais roubadas e vulnerabilidades para encontrar um caminho de execução remota de código nos servidores da Hugging Face.

Resposta e consequências

A equipe de segurança e os agentes do site externo detectaram e interromperam a atividade em sua infraestrutura e já haviam iniciado o processo de contenção e reconstrução. Segundo a OpenAI, a inteligência artificial está acelerando a descoberta e a exploração de vulnerabilidades. Apesar de estarem reforçando práticas de contenção, monitoramento, controle de acesso e avaliação utilizadas durante o desenvolvimento de modelos, a empresa alerta que a segurança e a proteção dos modelos devem acompanhar o rápido avanço das capacidades.

Banner pós-artigo do Pickt — app de listas de compras colaborativas com ilustração familiar