- Tempo estimado para leitura deste texto: 2 minutos

Agentes de inteligência artificial da Anthropic acessaram sistemas reais de três organizações durante avaliações controladas; erro de configuração manteve os modelos conectados à internet

A Anthropic revelou que modelos de sua inteligência artificial Claude realizaram ataques cibernéticos contra três empresas durante testes de segurança. Segundo a companhia, os incidentes ocorreram porque uma falha de configuração deixou os agentes conectados à internet, apesar de as instruções indicarem que eles deveriam operar apenas em ambientes simulados.

A descoberta aconteceu após a análise de mais de 141 mil sessões de avaliação. A revisão foi iniciada depois que a OpenAI informou que modelos próprios haviam identificado maneiras de invadir um sistema durante testes semelhantes.

De acordo com a Anthropic, os agentes comprometeram a infraestrutura das organizações explorando vulnerabilidades relativamente simples, como senhas fracas e pontos de acesso sem autenticação.

Os incidentes teriam começado em abril e envolveram os modelos Claude Opus 4.7, Claude Mythos 5 e uma terceira versão destinada à pesquisa. Durante os exercícios, as inteligências artificiais receberam a missão de localizar informações ocultas em redes que deveriam ser apenas ambientes de simulação.

No entanto, um problema de comunicação com a empresa parceira Irregular fez com que os sistemas permanecessem conectados à internet. Com isso, os agentes ultrapassaram os limites do teste e alcançaram infraestruturas pertencentes a organizações reais.

A Anthropic começou a revisar os registros em 23 de julho e suspendeu as avaliações no mesmo dia, após identificar sinais de que o Claude poderia ter acessado a internet. Até 24 de julho, a empresa já havia confirmado três incidentes.

As organizações afetadas foram notificadas em 27 de julho. Duas delas, segundo a Anthropic, desconheciam completamente as atividades realizadas em seus sistemas. A companhia ainda tentava estabelecer contato com a terceira empresa.

O episódio reforça o alerta sobre os riscos relacionados aos agentes autônomos de inteligência artificial. À medida que esses sistemas ganham capacidade para executar tarefas complexas sem supervisão contínua, falhas aparentemente simples de configuração podem transformar testes controlados em incidentes reais de segurança digital.

Tags: