O GitHub apresentou o Project HydraFusion, preview de pesquisa do Copilot que orquestra múltiplos modelos em tempo de execução para reduzir custos em até 67% em relação ao Claude Opus 5, mantendo qualidade praticamente equivalente. GitHub (github.com)
- HydraFusion usa três padrões de execução: single, cascade e critique
- Redução de custo estimado de 67% no TerminalBench 2.1 com ganho de 4,9 pontos percentuais
- No CheckpointBench, qualidade empatada com Claude Opus 5 com custo 65% menor
- Disponível via /experimental no GitHub Copilot CLI para todos os níveis
- Cinco princípios operacionais garantem produção: contabilidade, limites, isolamento, fail-safe e roteamento validado
Como funciona o roteamento em três padrões
O HydraFusion avalia cada prompt com sinais explícitos de capacidade para operações como raciocínio em múltiplas etapas, geração de código, depuração estruturada e uso avançado de ferramentas. Em vez de um modelo único para tudo, ele escolhe um de três fluxos conforme complexidade e contexto.
O padrão Single seleciona um modelo que executa diretamente quando tem capacidade suficiente, priorizando velocidade. O Cascade faz um modelo eficiente gerar rascunho que passa por portão de qualidade: se aprovado, segue; se reprovado, escala para modelo mais forte. O Critique usa modelo de rascunho, revisão por crítico somente leitura de outra família e revisão estruturada única.
- Single: um modelo selecionado executa direto, otimizando latência.
- Cascade: modelo eficiente gera rascunho avaliado por portão de qualidade antes de escalar.
- Critique: crítico independente e sem ferramentas revisa antes de revisão estruturada única.
Os cinco princípios operacionais
A arquitetura se ancora em contabilidade completa de tokens em cada etapa, execução limitada com timeouts e cancelamentos, revisão isolada sem acesso a ferramentas, rotinas fail-safe que rejeitam patches inválidos e roteamento validado que pré-verifica modelos e bindings.
Esses princípios garantem que o preview funcione de forma robusta em produção, mesmo com múltiplos modelos de fornecedores diferentes.
# publicidade
Resultados de benchmark e redução de custo
Em três benchmarks de codificação agêntica, os fluxos seletivos igualaram ou superaram a qualidade de referência com custos substancialmente menores. No TerminalBench 2.1, a qualidade verificada subiu 4,9 pontos percentuais com custo 67% menor em relação ao Claude Opus 5.
No CheckpointBench, benchmark interno curado de sessões reais do Copilot, a pontuação média ficou praticamente empatada com Claude Opus 5, diferença de 0,1 ponto percentual e custo 65% menor.
- TerminalBench 2.1: +4,9 pontos percentuais de qualidade e -67% de custo estimado.
- CheckpointBench: diferença de 0,1 ponto percentual para Claude Opus 5 e -65% de custo.
Como ativar o research preview
Desenvolvedores de todos os níveis do Copilot podem ativar o HydraFusion pela configuração /experimental no GitHub Copilot CLI.
O processo envolve atualizar o ambiente, executar /experimental on e selecionar HydraFusion na interface /model. O custo segue as taxas padrão de tokens dos modelos usados.
O que isso significa para o ecossistema de IA
A orquestração multi-modelo sinaliza que qualidade não depende de um único modelo, mas da combinação inteligente de vários. O padrão Critique ecoa revisão de código humana, com separação entre geração e revisão para reduzir viés.
| Padrão | Como funciona | Quando usar | Benefício principal |
|---|---|---|---|
| Single | Um modelo selecionado executa diretamente | Tarefas simples e independentes | Velocidade e baixa latência |
| Cascade | Modelo eficiente gera rascunho; portão de qualidade decide se escala | Tarefas com qualidade incerta | Economia ao evitar modelo caro desnecessário |
| Critique | Crítico somente leitura revisa antes de revisão única | Tarefas complexas que exigem verificação externa | Qualidade com revisão independente |
Arraste para o lado para ver toda a tabela.
Na avaliação do Mercado de TI, o HydraFusion aponta para gestão de custo e qualidade não binária, permitindo qualidade frontier apenas quando necessário. Para o mercado brasileiro, a economia de até 67% é relevante diante de tokens cobrados em dólar.
Leia também:
Fonte: Infoq