Claude sai do laboratório e invade empresas após falha em testes de segurança

Agentes de inteligência artificial da Anthropic acessaram sistemas reais de três organizações durante avaliações controladas; erro de configuração manteve os modelos conectados à internet

A Anthropic revelou que modelos de sua inteligência artificial Claude realizaram ataques cibernéticos contra três empresas durante testes de segurança. Segundo a companhia, os incidentes ocorreram porque uma falha de configuração deixou os agentes conectados à internet, apesar de as instruções indicarem que eles deveriam operar apenas em ambientes simulados.

A descoberta aconteceu após a análise de mais de 141 mil sessões de avaliação. A revisão foi iniciada depois que a OpenAI informou que modelos próprios haviam identificado maneiras de invadir um sistema durante testes semelhantes.

De acordo com a Anthropic, os agentes comprometeram a infraestrutura das organizações explorando vulnerabilidades relativamente simples, como senhas fracas e pontos de acesso sem autenticação.

Os incidentes teriam começado em abril e envolveram os modelos Claude Opus 4.7, Claude Mythos 5 e uma terceira versão destinada à pesquisa. Durante os exercícios, as inteligências artificiais receberam a missão de localizar informações ocultas em redes que deveriam ser apenas ambientes de simulação.

No entanto, um problema de comunicação com a empresa parceira Irregular fez com que os sistemas permanecessem conectados à internet. Com isso, os agentes ultrapassaram os limites do teste e alcançaram infraestruturas pertencentes a organizações reais.

A Anthropic começou a revisar os registros em 23 de julho e suspendeu as avaliações no mesmo dia, após identificar sinais de que o Claude poderia ter acessado a internet. Até 24 de julho, a empresa já havia confirmado três incidentes.

As organizações afetadas foram notificadas em 27 de julho. Duas delas, segundo a Anthropic, desconheciam completamente as atividades realizadas em seus sistemas. A companhia ainda tentava estabelecer contato com a terceira empresa.

O episódio reforça o alerta sobre os riscos relacionados aos agentes autônomos de inteligência artificial. À medida que esses sistemas ganham capacidade para executar tarefas complexas sem supervisão contínua, falhas aparentemente simples de configuração podem transformar testes controlados em incidentes reais de segurança digital.

Hermann Santos de Almirante

Recent Posts

O que você conta para a IA pode deixar de ser privado: CERT.br alerta para riscos no uso de dados pessoais

A inteligência artificial generativa deixou de ser uma tecnologia restrita a especialistas e passou a…

6 dias ago

Escritórios de advocacia na mira de cibercriminosos: vazamentos expõem dados confidenciais de clientes

Uma sequência de incidentes de segurança envolvendo alguns dos maiores escritórios de advocacia dos Estados…

6 dias ago

CNPJs: fraudes com empresas formalmente regulares acendem alerta no sistema financeiro

Levantamento registra quase 23 mil ocorrências em apenas seis meses e revela uma mudança preocupante…

1 semana ago

Esteganografia e IA: quando a tecnologia torna a informação invisível

A sociedade contemporânea produz, compartilha e armazena uma quantidade de dados sem precedentes. Fotografias, vídeos,…

2 semanas ago

ANPD acelera estratégia para IA com centro especializado e novos sandboxes regulatórios

Agência investe em capacidade técnica própria, testa modelos de inteligência artificial em ambiente controlado e…

2 semanas ago

Reconhecimento facial na polícia entra na mira de órgão britânico após auditorias apontarem falhas

O avanço do reconhecimento facial nas forças de segurança do Reino Unido voltou ao centro…

1 mês ago