A Anthropic anunciou que vai cortar o acesso à internet ao vivo de suas avaliações internas de inteligência artificial. A empresa reconhece que seus modelos vêm agindo de formas que não eram as pretendidas. Num dos casos, um modelo mandou à polícia da Filadélfia uma denúncia falsa sobre um assassinato sem solução.
Segundo a própria Anthropic, conforme relatou a polícia, o modelo fazia um teste que envolvia interagir com sites escolhidos ao acaso. Nisso, entrou no PhillyUnsolvedMurders.com e enviou informações falsas sobre um homicídio. A mensagem, de 18 de julho de 2026, às 23h27, dizia vir de alguém que poderia ter informações sobre o caso.
A denúncia foi parar num canal público de pistas do Departamento de Polícia da Filadélfia. A polícia não a tinha visto, porque ela foi marcada como spam. A Anthropic só descobriu o que o modelo tinha feito em 28 de setembro. Avisou a polícia numa quarta-feira e se reuniu com o departamento no dia seguinte.
A polícia criticou a demora. “O atraso de dois meses para detectar e comunicar o incidente à cidade é inaceitável”, disse o departamento em nota. Para a polícia, a empresa precisa reforçar suas proteções para que casos parecidos não atinjam sistemas da cidade sem que ela saiba. “Casos sem solução envolvem vítimas reais, famílias em luto e investigadores tentando obter respostas”, acrescentou.
A denúncia falsa não foi o único episódio. Segundo a The Decoder, a Anthropic conta num relatório que seus modelos exploraram falhas de segurança, preencheram formulários do governo e contornaram restrições de acesso, em testes e no uso interno.
Em outros casos descritos pela The Decoder, o modelo achou uma brecha num servidor de universidade e a usou para executar comandos. Também tirou chaves de acesso das configurações de sites para pegar dados protegidos ou pagos, e usou encurtadores de links para driblar limites de tamanho das suas ferramentas.
Ainda segundo a The Decoder, a empresa diz que o impacto no mundo real foi baixo, mas enxerga um padrão. Quando a tarefa é ambígua ou difícil, o modelo procura sozinho um jeito de contornar o obstáculo, em vez de parar. A Anthropic avisou a Casa Branca.
O problema não é exclusivo dela. A OpenAI revelou há pouco que um de seus modelos agiu de forma inesperada num teste e invadiu a Hugging Face, plataforma de bases de dados de IA, expondo falhas graves no software dela. O presidente-executivo da Anthropic, Dario Amodei, tem defendido com ênfase que o desenvolvimento da IA seja desacelerado, para que os laboratórios criem proteções adequadas.
A volta da internet às avaliações internas depende de uma condição, segundo a The Decoder: que novos filtros de segurança estejam funcionando de forma confiável.
