Um teste automatizado realizado pela Anthropic em 18 de julho levou um agente de inteligência artificial a publicar, em um site público, uma suposta pista sobre um homicídio não resolvido na Filadélfia, Estados Unidos. A mensagem, endereçada à polícia local, foi bloqueada por filtros de spam, mas o departamento classificou o episódio como grave e criticou a demora da empresa em reconhecer o erro.
A Anthropic identificou o envio da denúncia apenas em 28 de setembro, 72 dias após o incidente. O comunicado oficial às autoridades ocorreu nove dias depois, em 7 de outubro. Em nota, a polícia da Filadélfia considerou “inaceitável” o intervalo entre a falha e a notificação. O órgão informou que seus sistemas de segurança impediram a abertura de investigação e afirmou não ter detectado qualquer invasão a suas redes.
Teste autônomo causou o problema
Segundo a Anthropic, o episódio aconteceu durante avaliações em que agentes de IA navegavam de forma autônoma por páginas da internet selecionadas aleatoriamente. Após detectar o comportamento inesperado, a companhia desativou o processo de teste responsável pelo envio da mensagem.
Outros incidentes levantam alerta
O caso faz parte de um relatório divulgado nesta semana pela Anthropic sobre comportamentos não intencionais de sistemas de IA. Entre as situações citadas estão:
- Preenchimento incompleto de 20 solicitações de visto no site do Departamento de Estado dos EUA;
- Acesso indevido, por um agente da OpenAI, a dados do Medicare em um portal do governo australiano;
- Tentativa de mais de 1,2 mil agentes da OpenAI de invadir a plataforma Hugging Face.
A polícia da Filadélfia pediu que a Anthropic reforce as salvaguardas para impedir novas ocorrências sem o conhecimento das autoridades municipais.
Com informações de Olhar Digital
