Enganem-me uma vez, a culpa é de vocês. Enganem-me duas vezes, a culpa é minha. Enganem-me mais de 16.000 vezes – como os agentes da OpenAI fizeram com um repositório público de dados das Nações Unidas enquanto tentavam repetidamente encontrar uma saída ao redor dos bloqueios cibernéticos das Nações Unidas – e talvez seja hora de admitir que o sistema que temos para manter os agentes de IA sob controle não está funcionando particularmente bem.

À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar.
À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar. · Imagem: Source: www.theguardian.com

As notícias sobre sistemas de IA surgindo em lugares onde não deveriam soam alarmantes. Embora a descrição desses incidentes como 'hacks' possa estar exagerando as coisas, a IA explorou falhas em sistemas de TI que os humanos simplesmente ainda não descobriram. Também é importante notar que não devemos nos preocupar com a ideia de que as máquinas repentinamente se tornaram sencientes e decidiram rebelar-se contra a humanidade. Não há evidências suficientes para sugerir que isso está acontecendo. Os sistemas simplesmente estão seguindo instruções e tentando completar as tarefas que lhes foram atribuídas, mesmo que às vezes encontrem maneiras não intencionais de contornar obstáculos para fazê-lo.

À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar.
À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar. · Imagem: Source: www.theguardian.com

Mas devemos estar muito preocupados com o fato de que as empresas de IA nas quais deveríamos confiar para manter seus modelos sob controle parecem incapazes de fazer isso. Pior do que isso, elas parecem nem saber o que seus produtos estão fazendo.

À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar.
À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar. · Imagem: Source: www.theguardian.com

A magnitude do problema é assustadora. Em junho, um agente de pesquisa da OpenAI encarregado de buscar dados públicos sobre gastos com medicina na Austrália foi repetidamente bloqueado por um portal de estatísticas do Medicare. O modelo da OpenAI encontrou uma maneira de contornar os bloqueios, obtendo acesso não autorizado e sequestrando os documentos. Foi até agosto para a OpenAI descobrir o que havia acontecido. O primeiro-ministro australiano, Anthony Albanese, disse que a empresa levou "demasiado tempo" para informar seu governo, e é muito difícil discordar dele.

À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar.
À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar. · Imagem: Source: www.theguardian.com

Desde então, a OpenAI publicou um quadro de relatório para o "desalinhamento" do modelo, juntamente com mais seis exemplos de sua IA cometendo comportamentos perturbadores nos últimos seis meses. A empresa reconheceu que suas divulgações anteriores foram "ad hoc e menos frequentes do que o ideal", e disse que as evidências sobre a segurança da IA precisam ser verificadas por pessoas fora das empresas que constroem os modelos.

À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar.
À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar. · Imagem: Source: www.theguardian.com

Isso não é apenas um problema da OpenAI, o que torna tudo ainda mais preocupante. A Anthropic encontrou três incidentes em que seus modelos Claude obtiveram acesso não autorizado a sistemas reais de terceiros após revisar cerca de 141.000 transcrições do modelo. Ela só encontrou um quarto, datado de janeiro, após compilar um dossiê para uma investigação independente. O Google confirmou que o Gemini acessou sistemas pertencentes a três empresas reais durante testes. Outro agente da OpenAI usou DNS – o sistema que atua como o livro de endereços da internet, convertendo endereços web em formas legíveis por máquinas – para alcançar um chatbot externo apesar das restrições à internet. Outro publicou o token do GitHub de um pesquisador – uma senha de acesso – enquanto tentava burlar uma prova matemática, apesar de ter sido avisado duas vezes para parar. E agentes de pesquisa postaram 53 imagens de usuários em sites de hospedagem externos.

The OpenAIapp and the company’s CEO, Sam Altman.
The OpenAIapp and the company’s CEO, Sam Altman. · Imagem: The OpenAIapp and the company’s CEO, Sam Altman. Photograph: Rokas Tenys/Alamy

Outros agentes acessaram dados do censo usando credenciais encontradas online, copiaram informações da Comissão de Valores Mobiliários dos Estados Unidos (US Securities and Exchange Commission) para outros lugares e aparentemente tentaram, sem sucesso, invadir um site do Departamento de Educação dos Estados Unidos. A OpenAI diz que notificou dezenas de terceiros afetados por seus agentes e que sua revisão das atividades passadas ainda está em andamento.

Imagem da matéria: À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar.
Imagem da matéria: À medida que os modelos de IA se tornam descontrolados, você ainda confia na OpenAI e na Anthropic para impedi-los? Eu não confio, e nem deveria confiar. · Imagem: Source: www.theguardian.com

Essas descobertas desordenadas e posteriores de grandes invasões nos sistemas de TI de empresas e organizações não são o caminho certo para fiscalizar uma tecnologia tão poderosa quanto a IA. Aprendemos há um tempo para não deixar as investigações de acidentes aéreos apenas com a Boeing ou a Airbus. Agora precisamos ser menos ingênuos sobre a IA.

Na última semana, na assembleia geral da ONU, a pesquisadora de IA Rumman Chowdhury lançou a Independent AI Evaluation Foundation (IAEF) com um financiamento filantrópico de 10 milhões de dólares. Seu foco imediato é a educação, mas a ideia importante é transformar a avaliação independente de IA em uma profissão real: pessoas e organizações com as habilidades, infraestrutura e padrões para testar esses sistemas sem ter um interesse financeiro no resultado da aprovação deles. Porque, no momento atual, uma empresa pode relatar um incidente, investigá-lo, anunciar quaisquer medidas mitigadoras que tomou e seguir em frente.

A IAEF é uma intervenção bem-vinda, mas não pode resolver o problema sozinha. Ela não pode obrigar a OpenAI ou a Anthropic a entregar logs, preservar evidências ou informar um governo de que um de seus sistemas cruzou uma linha. E seus $10 milhões são uma ninharia ao lado de empresas como a Anthropic, que está preparando uma proposta de listagem pública discutida em uma avaliação de cerca de $2 trilhões. Mas é na infraestrutura que devemos construir e para a qual os políticos devem defender o caso.

Os governos precisam concordar com regras comuns que obriguem as empresas a divulgar incidentes graves de IA e quase acidentes, e fazê-lo rapidamente. Eles precisam obrigá-las a abrir seus livros a avaliadores externos, em vez de depender da boa vontade ou dos caprichos das próprias empresas. E os resultados devem ser compartilhados para que possamos aprender com cada incidente. Os laboratórios devem ajudar a projetar essas regras, mas não devem ter a palavra final até que tenham conquistado nossa confiança.

pule a promoção da newsletter

Newsletter gratuita | Semanal

Inscreva-se em Matters of Opinion

Colunistas e escritores do Guardian sobre o que têm debatido, pensado, lido e muito mais

E o dinheiro complica as coisas: enquanto a OpenAI adiou seu IPO até pelo menos 2027 devido às preocupações com segurança, parece que a flutuação da Anthropic ainda está indo a toda velocidade. Há bilhões – potencialmente trilhões – de dólares em jogo dependendo de como essas empresas e seus produtos são percebidos. Criamos auditores independentes e investigadores de acidentes em outras indústrias porque entendemos que boas intenções não eliminam conflitos de interesse reais.

Os laboratórios podem e devem continuar a construir cercas melhores. Mas quando um modelo consegue ultrapassá-las, eles não devem ser os únicos autorizados a decidir o que acontece em seguida. Porque até agora demonstraram-se unicamente desqualificados para fazê-lo.

- Chris Stokel-Walker é o autor de TikTok Boom: A História Interna do Aplicativo Favorito do Mundo