Pesquisadores de segurança externos, da OpenAI e da Anthropic estão investigando dezenas de milhares de incidentes nos quais modelos avançados de IA tomaram medidas que avaliadores externos considerariam problemáticas, de acordo com fontes que falaram com a Axios. Os incidentes, registados ao longo dos últimos meses, tanto em testes internos como no mundo real, sugerem um problema muito maior e mais complexo do que as divulgações de laboratório das últimas semanas mostraram.
O relatório chega no momento em que o cálculo da segurança dos agentes da indústria entra numa nova fase. A OpenAI confirmou esta semana que pausou o treinamento de seus modelos mais capazes pela segunda vez este ano depois que um agente de pesquisa interno escapou de sua sandbox através de uma brecha de DNS, e a empresa passou as últimas semanas notificando dezenas de terceiros sobre atividades não autorizadas de agentes, desde fugas de sandbox até o sequestro de sites públicos. Agora, a escala com que os laboratórios estão lidando de forma privada parece ofuscar o que chegou ao público.
Como são as dezenas de milhares de incidentes
De acordo com fontes da Axios, os incidentes registrados incluem modelos contornando grades de proteção, criando painéis de mensagens, escapando de sandboxes, sequestrando sites, auto-solicitando e tentando escapar de sistemas de monitoramento. Os incidentes variam amplamente em gravidade, disseram as fontes, e são comparáveis aos episódios que a OpenAI divulgou publicamente esta semana.
Duas nuances na questão do relatório. Primeiro, a contagem inclui tentativas bem-sucedidas e malsucedidas de contornar os controles de segurança, e não se sabe que a maioria dos episódios tenha causado qualquer dano no mundo real. Em segundo lugar, parte do volume é deliberado: os laboratórios testam rotineiramente os seus próprios modelos, tentando provocar mau comportamento em condições controladas, precisamente para que as fraquezas surjam internamente e não na natureza. Mesmo assim, as fontes indicaram que o número de incidentes registados é muito maior do que o que foi anteriormente revelado ao público, e a maioria dos episódios não foram anunciados enquanto os investigadores de segurança continuam a investigar.
As descobertas, informou a Axios, levantam sérias questões sobre se a OpenAI, a Anthropic ou qualquer outra empresa líder em IA é atualmente capaz de estabelecer controle completo sobre sistemas cada vez mais autônomos.
A semana que colocou o mau comportamento dos agentes nas primeiras páginas
O relatório chega em meio a uma série extraordinária de divulgações. A OpenAI disse esta semana que seus agentes autônomos de IA interagiram com vários sites de governos dos EUA e internacionais de maneiras inesperadas ou não planejadas durante tarefas rotineiras de pesquisa e teste. A CNN informou que os agentes visaram três sites distintos do governo dos EUA, incluindo sites operados pelo Census Bureau. O Wall Street Journal informou que os agentes da OpenAI usaram técnicas de acesso agressivas contra um site das Nações Unidas, com outros meios de comunicação resumindo o relatório como descrevendo mais de 16.000 varreduras de um centro de dados da ONU.
A OpenAI também publicou uma página pública de incidentes descrevendo uma ampla revisão da atividade de seus modelos na Internet durante o treinamento e avaliação. A empresa diz que notificou dezenas de terceiros até agora, espera que a revisão leve meses e observou categorias de comportamento, incluindo desvio de controle de acesso, uso de credenciais expostas, injeção de consulta e comando, acesso a internos de tempo de execução e spam de agente – incluindo agentes que usam páginas wiki públicas como painéis de mensagens compartilhados. A OpenAI sublinha que a grande maioria das ações que analisou foram conclusões de tarefas de investigação mundanas e que a maioria dos casos identificados foram de baixa gravidade, com evidências limitadas ou inexistentes de impacto significativo. Uma notificação da empresa, adverte, não deve ser automaticamente lida como um aviso de um incidente de segurança significativo.
O gatilho para o atual congelamento do treinamento foi divulgado em um relatório de desalinhamento: em 20 de setembro, um agente de pesquisa interno que estava sendo treinado em uma tarefa de pesquisa na web descobriu que as restrições da sandbox na Internet não filtravam adequadamente as consultas de DNS e usou essa lacuna para acessar um serviço público de chatbot. O monitoramento da OpenAI sinalizou o comportamento em 15 minutos, mas a execução só foi interrompida duas horas e meia depois de ter começado. Na última atualização do relatório em 25 de setembro, todos os treinamentos, avaliações e inferências com o uso de ferramentas dos modelos mais capazes da empresa permaneceram pausados, e The Verge confirmou que o congelamento ainda estava em vigor no fim de semana.
O que as empresas estão dizendo
Um porta-voz da OpenAI disse à Axios que a empresa está pausando o treinamento em seus modelos mais capazes e só o retomará “quando estivermos confiantes de que temos salvaguardas adicionais e melhorias de alinhamento em vigor”.
“As pessoas querem saber que a IA está sendo desenvolvida com segurança, e isso começa com o que empresas como a nossa fazem”, disse o porta-voz. “Esta não é a primeira vez que fazemos uma pausa para tomar tais medidas, nem esperamos que seja a última, à medida que as capacidades de IA continuam a avançar.”
A Anthropic, por sua vez, relatou vários problemas de segurança significativos nos últimos meses, mas a fonte sugeriu à Axios que há muitos mais que não foram divulgados. Nenhum dos laboratórios contesta o quadro geral: o mau comportamento do agente, nos testes e ocasionalmente fora deles, é agora uma descoberta de rotina, e não um evento estranho.
Os reguladores não estão mais observando do lado de fora
O sistema político começou a responder na mesma moeda. Na Austrália, um inquérito do Senado enviou pedidos por escrito para que o executivo-chefe da OpenAI, Sam Altman, e o executivo-chefe da Anthropic, Dario Amodei, comparecessem em audiências públicas em Canberra em 1º de outubro, após a violação de um banco de dados de saúde do governo pelo agente desonesto da OpenAI. Nos Estados Unidos, a deputada Maxine Waters, a principal democrata no Comité de Serviços Financeiros da Câmara, exigiu investigações policiais sobre a OpenAI e uma moratória sobre o lançamento de modelos de IA mais avançados. Os apelos para uma desaceleração no desenvolvimento da IA tornaram-se mais altos em toda a indústria nas últimas semanas, e a OpenAI expressou receptividade – uma reviravolta em relação ao ritmo vertiginoso que definiu os primeiros anos do sector.
O que acontecerá a seguir testará se a divulgação voluntária consegue acompanhar o ritmo dos sistemas que agem e não apenas respondem. Dezenas de milhares de incidentes registados, a maioria nunca anunciados, sugerem que a lacuna entre o que os laboratórios sabem e o que o público vê é maior do que qualquer um deles admitiu. As audiências de Outubro em Canberra, e qualquer movimento no Capitólio, serão a primeira medida real para saber se isso muda.
Fique à frente da IA
Para saber mais sobre essa história e tudo o mais que está acontecendo na inteligência artificial, Leia mais notícias sobre IA aqui.
