Pular para o conteúdo

Edição de domingo, 4 de outubro de 2026

6 min.

Publicidade

Openappa: motor de segurança para agentes de IA zera ataques em dois benchmarks

OpenAPPA, da Archestra, atingiu 0% de sucesso em ataques nos benchmarks Bench-Corp e AgentThreatBench, superando o auto mode do Claude Code (10%) e o Microsoft FIDES (31%).

Publicidade

A Archestra lançou o OpenAPPA, um motor de segurança open-source que registrou 0% de ataques bem-sucedidos nos Bench-Corp, benchmark corporativo no GitHub (github.com)s Bench-Corp (20 fluxos corporativos de múltiplas etapas) e AgentThreatBench no repositório inspect_evals (github.com), taxa que chega a 10% no auto mode do Claude Code e a 31% no Microsoft FIDES, segundo a equipe do projeto.

O que é o openappa e por que ele roda fora do loop do agente

O OpenAPPA é um motor de segurança open-source da Archestra projetado para impedir exfiltração de dados causada por prompt injection ou alucinação de modelos. Diferente das abordagens baseadas em um segundo modelo julgando cada chamada de ferramenta, ele executa fora do loop de prompt e execução do agente, de forma determinística.

Leia também · há 19 minutos Openappa: engine open-source da archestra zera ataques em dois benchmarks de segurança de agentes
Controle de fluxo de informação recuperável é a base do OpenAPPA: políticas de segurança aplicadas fora do agente, que o modelo subjacente não consegue inspecionar, negociar ou contornar.

A configuração se dá por um único arquivo appa.toml, que detalha fontes de dados, audiências (o conjunto autorizado de consumidores), níveis de confiança (grau de verificação do dado) e autoridades, com regras determinísticas de enforcement associadas. Os rótulos se compõem de forma monotônica por álgebra de reticulados: só podem ficar mais restritivos, nunca mais permissivos.

Por que classificadores probabilísticos falham na aprovação automática

A resposta da indústria para a fadiga de aprovação tem sido um segundo modelo julgando cada chamada de ferramenta: o auto mode do Claude Code, o auto-review do Codex e outros auto-modes. Segundo a documentação do OpenAPPA, essa abordagem estocástica falha por construção: os classificadores também são vulneráveis a prompt injection, então os harnesses escondem as saídas das ferramentas deles, e o juiz nunca vê o dado.

Há ainda o teto probabilístico. Mesmo os melhores detectores chegam a 99,3% de precisão: em milhões de chamadas, os 0,7% restantes representam muitas violações. Na avaliação do Mercado de TI, o argumento é sólido: segurança de dados em escala não combina com taxa de erro acumulativa.

Mas políticas rígidas demais também falham, certo? Sim. A documentação lembra que agentes são hábeis em contornar allowlists e denylists simples: um rm -rf negado pode ser substituído por um script Python equivalente. E restringir demais derruba a utilidade: o agente não vaza dado, mas também não completa a tarefa.

Como resume o repositório do projeto: um agente que permite fluxos não autorizados é inseguro, e um que recusa trabalho válido é inútil.

Como a álgebra de políticas funciona na prática

O OpenAPPA implementa a Agentic Permissions Policy Algebra (APPA), formalizada em artigo publicado no arXiv por Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov e Matvey Kukuy. Ler um ticket via get_ticket_from_crm restringe a audiência da trajetória a internal; a chamada seguinte a process_internal_data exige que a audiência esteja dentro de internal.

No eixo de confiança, o resultado de read_web_page é marcado como suspicious. Ao receber esse resultado, o motor bloqueia apply_db_migration, que exige dado trusted. Leitura de registros restritos estreita a audiência; leitura de páginas web externas não verificadas reduz a confiança.

[policy] version = 2 trust_chain = ["suspicious", "trusted"] [[policy.tool]] name = "read_web_page" delta = { trust = "suspicious" } [[policy.tool]] name = "apply_db_migration" requires = { trust = "trusted" }

Recuperação: o que acontece quando o agente tenta uma ação ilegal

O OpenAPPA tem semântica explícita de recuperação.

Quando o agente tenta uma ação ilegal, o motor interrompe o dispatch e oferece caminhos estruturados para prosseguir: sanitizers editam payloads (removendo dados pessoais, por exemplo, para ampliar a audiência permitida com segurança), autoridades roteiam o pedido a operadores humanos ou APIs internas de verificação para aprovação de ação única, e ramos filhos descartáveis isolam a leitura de dados não confiáveis em um subagente transitório, devolvendo ao pai apenas saídas sanitizadas e atestadas por schema.

O valor dessas estratégias aparece nos experimentos de ablação descritos no artigo: com os planos de remediação totalmente desativados, a taxa de conclusão de tarefas caiu para.

Dica: se você desenvolve agentes com acesso a sistemas internos, comece mapeando audiências e níveis de confiança dos seus dados antes de escolher qualquer ferramenta de enforcement. Essa modelagem é pré-requisito para abordagens como a APPA.

Números dos benchmarks: 0% de ataques e 89% de tarefas concluídas

O Bench-Corp é um benchmark especializado em assistentes corporativos, com 20 fluxos empresariais de múltiplas etapas, enquanto o AgentThreatBench operacionaliza o OWASP Top 10 para aplicações agênticas (2026) em tarefas executáveis, com pontuação dupla de utilidade e segurança. O AgentThreatBench foi incorporado ao repositório oficial inspect_evals do AI Safety Institute do Reino Unido. Ambos testam violações explícitas: compartilhamento de dados sensíveis, prompt injection, aprovação e ordenação, e isolamento entre tenants.

Os resultados publicados pela equipe mostram que segurança rígida não precisa matar a utilidade, o trade-off clássico da abordagem zero trust aplicada a agentes de IA:

O que isso significa para quem desenvolve agentes

O OpenAPPA está em preview, e os resultados vêm da própria Archestra, empresa que constrói a tecnologia: benchmarks patrocinados pelo fornecedor sempre pedem validação independente. Ainda assim, o movimento indica uma mudança de paradigma relevante, alinhada ao que o modelo de identidade para agentes do Uber já sinalizava: controle de segurança fora do modelo, não dentro do prompt.

Atenção: por estar em preview, o OpenAPPA pode mudar de API e de formato de configuração. Valide em ambiente de teste antes de apoiar qualquer fluxo de produção nele.

Para equipes brasileiras que operam sob a LGPD, a abordagem de sanitizers que removem dados pessoais para expandir audiências é particularmente útil: ela transforma conformidade em regra executável, não em revisão manual. Para quem quer se aprofundar no tema, vale ler também nossa análise sobre a maturidade real de zero trust na era da IA.

Resultados nos benchmarks Bench-Corp e AgentThreatBench, segundo a equipe do OpenAPPA.
SoluçãoTaxa de sucesso de ataquesTaxa de conclusão de tarefas
OpenAPPA (Archestra)0%89%
Claude Code auto mode10%90%
Microsoft FIDES31%41%

Arraste para o lado para ver toda a tabela.

O próximo passo é acompanhar a evolução do projeto no GitHub e a replicação independente dos números de benchmark. Se a comunidade confirmar o 0% de sucesso em ataques com utilidade acima de 89%, o controle determinístico de fluxo de informação tende a virar referência de arquitetura para agentes corporativos.

Quem escreveu

Dagmar Cirino

· Editor-chefe

Especialista em tecnologia, criador de conteúdo e fundador do portal Mercado de TI e Casa do Dev. Analiso tendências de mercado, Inteligência Artificial e carreira, entregando informações precisas, transparentes e acessí...

LinkedIn Site

Compartilhar