Engine de segurança open-source da Archestra registrou 0% de ataques bem-sucedidos nos benchmarks Bench-Corp e AgentThreatBench, contra 10% do modo auto do Claude Code e 31% do Microsoft FIDES. O sistema roda fora do loop de execução do agente e usa álgebra de permissões determinística.
A Archestra lançou o OpenAPPA, uma engine de segurança open-source que registrou 0% de ataques bem-sucedidos em dois benchmarks de segurança para agentes de IA: o Bench-Corp no GitHub (github.com), com 20 fluxos corporativos de múltiplas etapas, e o AgentThreatBench no inspect_evals (github.com). Na mesma comparação, o modo auto do Claude Code permitiu 10% de ataques e o Microsoft FIDES, 31%. O projeto foi divulgado em e está disponível como preview no GitHub.
O OpenAPPA foi projetado para impedir exfiltração de dados causada por prompt injection ou alucinação de modelo. Diferente das abordagens baseadas em um segundo modelo julgando cada chamada de ferramenta, a engine roda fora do prompt e do loop de execução do agente, aplicando regras determinísticas de política de segurança.
O que o openappa resolve
O OpenAPPA é uma engine de aplicação de políticas executada fora do loop do agente, o que impede que o modelo de linguagem subjacente inspecione, negocie ou contorne as regras definidas. A proposta ataca um problema que a documentação do projeto resume em dois eixos: um agente que permite fluxos não autorizados é inseguro, e um agente que recusa trabalho válido é inútil.
Leia também · há 1 hora
Openappa: motor de segurança para agentes de IA zera ataques em dois benchmarks
Mas por que abordagens atuais não bastam? Segundo a documentação do OpenAPPA, a resposta da indústria à fadiga de aprovações foi criar um segundo modelo que julga cada chamada de ferramenta: o modo auto do Claude Code, o auto-review do Codex e outros auto-modes. Por desenho, esses mecanismos não conseguem rastrear o fluxo de dados entre chamadas de ferramentas.
Atenção: agentes já demonstraram habilidade em contornar allowlists e denylists simples. Um rm -rf negado pode ser substituído por um script Python equivalente, segundo a documentação do OpenAPPA.
Como a álgebra de permissões appa funciona
A Archestra busca resolver a tensão entre aplicação estrita de regras e utilidade operacional com a Agentic Permissions Policy Algebra (APPA), descrita em um paper publicado no arXiv por Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov e Matvey Kukuy.
As políticas de segurança tomam a forma de um único arquivo de configuração appa.toml, que detalha fontes de dados, audiências, níveis de confiança e autoridades. A engine rotula e monitora conjuntamente a audiência (o conjunto autorizado de consumidores) e a confiança (o grau de verificação do dado).
Os rótulos se compõem de forma monotônica usando álgebra de reticulados: só podem se tornar mais restritivos. Ler registros restritos estreita a audiência; ler páginas web externas não verificadas reduz a confiança. Cada contrato de ferramenta define três atributos operacionais: requires (a audiência e os níveis de confiança necessários), delta (as restrições aplicadas quando a ferramenta retorna dados) e effects (trilha de auditoria das ações bem-sucedidas).
[[policy.tool]]
name = "get_ticket_from_crm"
delta = { audience = ["internal"] }
[[policy.tool]]
name = "publish_update"
requires = { audience = { contains = ["public"] } }
[[policy.tool]]
name = "process_internal_data"
requires = { audience = { within = ["internal"] } }
Nesse exemplo, ler um ticket via get_ticket_from_crm restringe a audiência da trajetória a interna. A chamada subsequente process_internal_data exige que a audiência esteja dentro do escopo interno, bloqueando qualquer vazamento para fora.
[policy]
version = 2
trust_chain = ["suspicious", "trusted"]
[[policy.tool]]
name = "read_web_page"
delta = { trust = "suspicious" }
[[policy.tool]]
name = "apply_db_migration"
requires = { trust = "trusted" }
No segundo exemplo, o resultado da ferramenta read_web_page é marcado como suspeito. Ao receber esse resultado, o OpenAPPA bloqueia apply_db_migration, porque a operação exige dados confiáveis. Esse modelo de rastreamento de fluxo de dados complementa abordagens como o modelo de identidade do Uber para sistemas autônomos.
Semântica de recuperação
O OpenAPPA inclui semântica explícita de recuperação. Quando um agente tenta uma ação ilegal, a engine interrompe o despacho e oferece caminhos estruturados para prosseguir, em vez de simplesmente travar a tarefa.
Sanitizers podem editar payloads, removendo informações de identificação pessoal, para expandir com segurança a audiência permitida. Autoridades roteiam solicitações a operadores humanos ou APIs internas de verificação para aprovação de ações individuais. Já os Disposable Child Branches permitem confinamento sob demanda: quando o agente precisa ingerir dados não confiáveis, a leitura é isolada em um ramo transitório de subagente, retornando ao pai apenas saídas sanitizadas e atestadas por schema.
Info: nos testes de ablação relatados no paper, desativar completamente os planos de remediação fez a taxa de conclusão de tarefas cair para 35,0%, validando o valor das estratégias de recuperação.
O que mostram os benchmarks bench-corp e agentthreatbench
Nos benchmarks Bench-Corp e AgentThreatBench, o OpenAPPA manteve alta utilidade sob restrições estritas de segurança, com 0% de taxa de sucesso de ataques e 89% de conclusão de tarefas.
| Solução | Taxa de sucesso de ataques | Taxa de conclusão de tarefas |
|---|---|---|
| OpenAPPA (Archestra) | 0% | 89% |
| Claude Code (modo auto) | 10% | 90% |
| Microsoft FIDES | 31% | 41% |
Arraste para o lado para ver toda a tabela.
Os dois benchmarks testam violações explícitas de política: compartilhamento de dados sensíveis, prompt injection, aprovação e ordenação, e isolamento entre tenants. O Bench-Corp é especializado em assistentes corporativos e avalia como as políticas se sustentam em fluxos empresariais complexos de múltiplas etapas.
O AgentThreatBench operacionaliza o OWASP Top 10 para Aplicações Agênticas (2026) em tarefas executáveis e foi recentemente incorporado ao repositório oficial inspect_evals do AI Safety Institute do Reino Unido. O benchmark usa pontuação dupla, avaliando utilidade e segurança, e o OpenAPPA obteve pontuação perfeita de segurança, sem nenhum ataque bem-sucedido.
Na avaliação do Mercado de TI, o resultado mais relevante não é apenas o 0% de ataques, mas a combinação com 89% de conclusão de tarefas: o histórico do setor mostra que políticas excessivamente restritivas derrubam a utilidade, como ocorreu com o FIDES, que completou apenas 41% das tarefas. A comparação entre os modos automáticos concorrentes está detalhada na página de comparação do OpenAPPA com auto-modes.
Dica: para times que já operam agentes em produção, o ponto de partida é mapear quais ferramentas do agente tocam dados sensíveis e definir audiências e níveis de confiança no appa.toml antes de qualquer deploy. A área de governança de agentes de IA tende a ganhar peso nas vagas de plataforma.
O OpenAPPA está em preview, com o formalismo da álgebra e as garantias de recuperação publicados no paper "APPA: Recoverable Information-Flow Control for Real-World LLM Agents", disponível no arXiv. Para o desenvolvedor brasileiro, o próximo passo prático é clonar o repositório, reproduzir os cenários do Bench-Corp e avaliar se a abordagem determinística se encaixa na stack de agentes em uso, um caminho alinhado ao que o portal já cobriu sobre governança de agentes em escala empresarial.
Fonte: Infoq
Quem escreveu
Dagmar Cirino · Editor-chefe
Especialista em tecnologia, criador de conteúdo e fundador do portal Mercado de TI e Casa do Dev. Analiso tendências de mercado, Inteligência Artificial e carreira, entregando informações precisas, transparentes e acessí...