SÃO FRANCISCO — Meses antes de a inteligência artificial da OpenAI sair de controle, dois funcionários alertaram os principais executivos da empresa. Eles foram ignorados.
Em e-mails, os funcionários disseram estar preocupados com o fato de os modelos mais recentes de inteligência artificial da OpenAI não estarem sendo monitorados adequadamente durante os testes destinados a avaliar o nível de sofisticação da tecnologia e garantir a segurança dos modelos, segundo mensagens às quais o The New York Times teve acesso.
Em resposta, executivos da OpenAI disseram aos funcionários que os testes precisavam avançar o mais rapidamente possível para que os modelos de IA fossem lançados dentro do prazo. Nenhum protocolo adicional de segurança foi implementado, disseram os funcionários, que não estavam autorizados a falar publicamente sobre assuntos confidenciais.
Mais tarde, os modelos da OpenAI escaparam de seus ambientes de teste e atacaram a startup de IA Hugging Face e outras organizações, desencadeando um debate global sobre a segurança da inteligência artificial.
Sam Altman, CEO da Open Ai, não se envolve diretamente com os assuntos de segurança, segundo funcionários da OpenAI
Manuel Orbegozo/The New York Times
As trocas de mensagens entre funcionários e executivos da OpenAI — que não haviam sido divulgadas anteriormente — faziam parte de um padrão no qual a empresa de São Francisco não priorizava a segurança, segundo funcionários e pesquisadores independentes de segurança. Essa abordagem não ficou evidente apenas nos testes dos modelos de IA, afirmaram eles, mas também se manifestou em outras áreas da empresa, responsável pelo chatbot ChatGPT.
Pesquisadores independentes de segurança afirmaram ter encontrado falhas nos últimos meses que lhes permitiram acessar as comunicações internas dos funcionários da OpenAI. Eles também identificaram outras vulnerabilidades que lhes possibilitariam acessar o código-fonte interno da empresa e visualizar os registros de bate-papo dos usuários do ChatGPT. Segundo eles, quando os pesquisadores entraram em contato com a OpenAI a respeito de suas descobertas, a empresa inicialmente as ignorou.
“A segurança da OpenAI parece ser o que se esperaria de um laboratório de pesquisa que cresceu a um ritmo vertiginoso ao longo de quatro anos e se concentrou mais em superar seus concorrentes do que em proteger sua infraestrutura”, disse Joshua Saxe, diretor de tecnologia da empresa de segurança em IA Abundant Security.
Funcionários da OpenAI disseram que muitas das decisões do dia a dia relacionadas à segurança eram tomadas por Greg Brockman, presidente da empresa, e Dane Stuckey, diretor de segurança da informação. Segundo eles, o CEO Sam Altman não está diretamente envolvido nas questões de segurança.
A OpenAI não é a única empresa que divulgou recentemente incidentes de segurança envolvendo IA. Google, Meta e Anthropic também revelaram que suas tecnologias de IA mais avançadas escaparam de ambientes de teste e atacaram de forma autônoma outras infraestruturas de computadores sem o conhecimento das empresas.
Daniel Kokotajlo, ex-funcionário da OpenAI: “Parece que a segurança deles era muito ruim”, diz ele sobre a empresa de inteligência artificial
Ian C. Bates/The New York Times
Mas a forma como a OpenAI lidou com a segurança está sob escrutínio particularmente intenso porque seus modelos de IA estiveram envolvidos no maior número conhecido de episódios de comportamento que a própria empresa classificou como “preocupante” — e que especialistas consideraram os mais alarmantes.
Em cerca de uma dúzia de incidentes, os sistemas da OpenAI invadiram ou tentaram invadir organizações, incluindo sites de agências do governo dos Estados Unidos. A tecnologia também escondeu seus próprios erros, inventou dados, tentou enviar mensagens para outros chatbots e transferiu arquivos para a internet aberta sem autorização. Em todos esses casos, a IA agiu sem receber instruções para fazê-lo.
“De certa forma, este é um problema específico da OpenAI, na medida em que parece que eles tinham uma segurança muito precária e também práticas de treinamento de modelos pouco cuidadosas, o que levou os modelos a desenvolver esse tipo de propensão”, disse Daniel Kokotajlo, ex-funcionário da OpenAI que criticou as práticas de segurança da empresa e lidera uma organização de pesquisa sem fins lucrativos chamada AI Futures Project. Ele acrescentou, porém, que outras empresas de IA não eram muito melhores.
Pesquisadores relataram à OpenAI uma falha que permitiria que pessoas acessassem todos os registros de bate-papo privados de um usuário do ChatGPT
ERIC HELGAS/The New York Times
Drew Pusateri, porta-voz da OpenAI, disse que a empresa estava comprometida com a segurança e levava a sério quaisquer relatos ou preocupações relacionados ao tema. Segundo ele, o laboratório possui canais internos para comunicar problemas de segurança e tomou medidas imediatas em relação às falhas apontadas por pesquisadores independentes.
Dois funcionários da OpenAI disseram que, durante meses, trabalhadores haviam levantado preocupações sobre possíveis problemas de segurança nos testes dos modelos de IA, incluindo a falta de monitoramento adequado.
Os funcionários também questionaram vulnerabilidades no tipo de software que a empresa utilizava para administrar a segurança no dia a dia, segundo mensagens vistas pelo Times. Em todas as ocasiões, disseram eles, suas perguntas foram ignoradas ou receberam respostas e providências demoradas demais.
Pesquisadores de segurança disseram ter recebido tratamento semelhante quando alertaram a OpenAI sobre outras vulnerabilidades.
Em julho, pesquisadores da empresa de segurança Hacktron disseram ter informado à OpenAI que haviam encontrado uma maneira de invadir os sistemas da companhia com a ajuda de um modelo de IA criado pela rival Anthropic. Inicialmente, a OpenAI descartou as descobertas, segundo os pesquisadores.
Em um canal compartilhado na plataforma de mensagens Slack, Stuckey, da OpenAI, escreveu que era “muito triste” que os pesquisadores da Hacktron tivessem se esforçado tanto para demonstrar as vulnerabilidades da empresa, de acordo com cópias das comunicações às quais o Times teve acesso.
“Sentimos que eles estavam com raiva de nós”, disse Mohan Pedhapati, pesquisador da Hacktron, sobre a reação da OpenAI. Ele acrescentou que a empresa parecia continuar adotando práticas de segurança típicas de uma startup, utilizando serviços de software de terceiros para infraestrutura crítica em vez de desenvolver suas próprias ferramentas.
“Por que vocês estão usando o Slack para desenvolver seus projetos nucleares do tipo ‘Manhattan’?”, perguntou Pedhapati. O ataque de Hacktron poderia ter lhe concedido acesso total à plataforma de mensagens do Slack para ver o que os funcionários da OpenAI estavam dizendo, afirmou ele.
Stuckey posteriormente pediu desculpas à Hacktron, e a OpenAI concedeu aos pesquisadores US$ 6.500 pela divulgação da falha.
“Agradecemos aos pesquisadores por entrarem em contato conosco e compartilharem sua descoberta”, disse Pusateri.
Na semana passada, a OpenAI revelou que novas salvaguardas não haviam conseguido impedir que seu mais recente modelo de IA as contornasse para acessar a internet. Uma análise retrospectiva identificou outros casos de acesso não autorizado à internet que haviam passado despercebidos. A OpenAI anunciou que estava suspendendo o treinamento de seus modelos mais avançados e realizando uma ampla revisão dos comportamentos inesperados apresentados pela tecnologia.
Na segunda-feira, a empresa foi ainda mais longe. Disse que não lançaria seu mais novo modelo de IA, o GPT-6.1 Astra, devido a preocupações de segurança levantadas por seus pesquisadores.
OpenAI ignorou alertas de funcionários de que a empresa não estava tomando medidas suficientes em relação à segurança
