Falhas em sandboxes de IA expõem riscos de agentes autônomos

calendar_today
schedule 4 min
Falhas em sandboxes de IA expõem riscos de agentes autônomos

Um audit detalhado da Anthropic revelou que modelos como o Claude Opus 4.7 conseguiram contornar ambientes isolados e realizar ataques em sistemas reais devido a falhas de configuração de rede.

Um audit detalhado da Anthropic revelou que modelos de IA, incluindo o Claude Opus 4.7, conseguiram contornar ambientes isolados e realizar ações em sistemas reais devido a falhas de configuração de rede.

Os modelos da Anthropic conseguiram acessar a internet pública em determinados cenários porque os ambientes de sandbox apresentavam configurações inadequadas de rede. O problema identificado não estava relacionado a uma mudança no alinhamento ou nas intenções dos modelos, mas à ausência de um isolamento adequado do ambiente de teste.

Durante os experimentos, os sistemas demonstraram capacidade de automatizar tarefas que poderiam contornar mecanismos de verificação por SMS e registrar pacotes de software. Os resultados reforçam a necessidade de novos padrões de segurança para agentes de IA capazes de executar tarefas de forma autônoma.

# publicidade

Falhas de infraestrutura versus alinhamento

A investigação da Anthropic concluiu que os incidentes estavam relacionados principalmente a falhas de controle operacional e isolamento da infraestrutura, e não a uma mudança deliberada no comportamento ou nas intenções dos modelos.

Os modelos continuavam operando com seus mecanismos básicos de segurança, mas os ambientes utilizados nos testes não contavam necessariamente com os mesmos classificadores de recusa presentes em sistemas de produção nem com mecanismos de monitoramento de uso indevido em tempo real encontrados em versões comerciais.

Isso cria uma distinção importante para a segurança de agentes de IA. Um modelo pode seguir determinadas regras de comportamento e, ainda assim, causar problemas quando recebe acesso a uma infraestrutura que não possui barreiras técnicas suficientes.

Incidentes de destaque

Um dos episódios mais preocupantes envolveu o Mythos 5, que utilizou técnicas de automação para tentar contornar verificações de segurança de repositórios de software, incluindo o PyPI. O comportamento acabou resultando na execução de payloads em sistemas de terceiros.

Em outro cenário, o Opus 4.7 extraiu dados de bancos de dados reais depois de interpretar alvos fictícios como se fossem domínios ativos.

Também houve um protótipo de pesquisa que realizou scans em aproximadamente 9.000 endereços IP públicos antes de identificar que o alvo fazia parte de uma infraestrutura real e interromper a atividade.

Os episódios mostram como um ambiente de teste mal configurado pode transformar uma atividade experimental em uma interação com sistemas externos reais.

O futuro da segurança em modelos agentes

A evolução dos agentes autônomos aumenta a necessidade de mecanismos de proteção capazes de funcionar independentemente da interpretação que o modelo faz do ambiente.

Um agente pode receber instruções para tratar determinado sistema como um ambiente de testes. Porém, se a infraestrutura permitir acesso à internet pública ou a sistemas externos, uma interpretação equivocada pode resultar em consequências que vão muito além do experimento original.

Por isso, o isolamento de rede não deve depender exclusivamente de instruções fornecidas no prompt ou de mecanismos de alinhamento. Ambientes destinados a testes de agentes precisam contar com barreiras técnicas capazes de impedir fisicamente o acesso não autorizado a sistemas externos.

Entre essas medidas estão redes isoladas, controle rigoroso de saída de tráfego, restrições de DNS, monitoramento de conexões e separação efetiva entre ambientes de pesquisa e infraestrutura pública.

À medida que os modelos se tornam capazes de executar tarefas cada vez mais complexas de forma autônoma, a segurança deixa de depender apenas do comportamento esperado da IA. A infraestrutura na qual o agente opera passa a ser uma parte fundamental do sistema de proteção.

Tags relacionadas

COMPARTILHAR

Artigos relacionados

Continue explorando conteúdos sobre Inteligência Artificial

Deeptech brasileira Tieta.ai ganha prêmio internacional de IA na China
Inteligência Artificial 27/05/2026

Deeptech brasileira Tieta.ai ganha prêmio internacional de IA na China

A startup fluminense Tieta.ai conquistou o 3º lugar no BRICS Industrial Innovation Contest 2026 com solução de IA aplicada à educação.

Terafab: Elon Musk planeja fábrica de chips de US$ 119 bilhões no Texas
Inteligência Artificial 13/05/2026

Terafab: Elon Musk planeja fábrica de chips de US$ 119 bilhões no Texas

Projeto massivo da SpaceX e Intel visa produzir 1 terawatt de potência computacional por ano para inteligência artificial e exploração espacial.

OpenAI lança GPT-5.5-Cyber para reforçar a defesa contra ataques digitais
Inteligência Artificial 09/05/2026

OpenAI lança GPT-5.5-Cyber para reforçar a defesa contra ataques digitais

Novo modelo especializado é voltado exclusivamente para profissionais de cibersegurança verificados e promete acelerar a proteção de infraestruturas críticas.