Codescene: agentes de IA refatoram 300 mil linhas de c em três semanas por us$ 4 mil

8 min
Codescene: agentes de IA refatoram 300 mil linhas de c em três semanas por us$ 4 mil

Estudo de caso da CodeScene mostra agentes refatorando o código de Street Fighter III: 3rd Strike, mas praticantes questionam o que o resultado realmente prova.

Estudo da CodeScene mostra agentes refatorando 300 mil linhas de C de Street Fighter III em três semanas por US$ 4 mil; o debate entre praticantes é sobre o que isso prova.

  • Agentes refatoraram 300 mil linhas de C em 3 semanas por cerca de US$ 4 mil em tokens, com 2.903 commits em 726 arquivos.
  • O Code Health subiu de 5,6 para 10,0, com 22 receitas de refatoração acumuladas pelos agentes.
  • Claude Code com Opus superou Codex com Sol na captura de padrões; modelos menores estagnavam em ótimos locais.
  • Praticantes questionam escopo: fork, não produção; e o oráculo de replay frame a frame não existe na maioria dos legados.
  • Projeções de 70% menos defeitos e 45% menos desperdício de tokens são extrapolações, não medições deste caso.

O que o estudo da codescene mediu

A CodeScene publicou no final de setembro de 2026 um estudo de caso em que agentes de codificação refatoraram uma base de 300 mil linhas de código C em três semanas, gastando cerca de US$ 4 mil em tokens. O trabalho produziu 2.903 commits distribuídos em 726 arquivos, modificou 252.055 linhas e levou o score de Code Health de 5,6 para 10,0, segundo a empresa.

A base escolhida foi Street Fighter III: 3rd Strike, proveniente de uma descompilação open-source. Adam Tornhill, fundador da CodeScene e autor do livro Your Code as a Crime Scene, escreveu que foi a primeira vez em três décadas trabalhando com sistemas grandes que ele viu o que chamou de desempenho de IA sobre-humano em escala. A empresa vende justamente a tecnologia usada no experimento, o que vale ter em mente ao ler os resultados.

Mas como os agentes sabiam que estavam melhorando o código, e não apenas mudando? Dois mecanismos sustentaram o trabalho. O primeiro foi um sinal de qualidade: o CodeHealth MCP Server, que deu aos agentes um score determinístico para otimizar e para julgar se cada transformação ajudou. O segundo foi correção: um harness de replay-trace que comparava o hash do estado de rollback frame a frame, permitindo verificar o comportamento após cada mudança.

O que os agentes aprenderam no caminho

O resultado mais inédito do estudo não é o número de commits, e sim o que os agentes construíram durante o processo. Em vez de aplicar um catálogo fixo de refatorações, eles acumularam um playbook próprio: 22 receitas e 82 notas de apoio ao final das três semanas.

# publicidade

Entre as receitas aparecem transformações conhecidas, como Extract Function e Guard Clauses, mas também padrões específicos daquela base. Shared Index Range captura loops repetidos que diferem apenas nos limites inicial e final. Action Parameter trata estruturas de controle duplicadas que diferem principalmente na função invocada. Uniform Step Table converte chamadas heterogêneas em dispatch orientado por tabela. Tentativas fracassadas também foram registradas, incluindo transformações que pioraram o Code Health.

A escolha do modelo fez diferença mensurável. A equipe optou por Claude Opus para o grosso do trabalho, relatando que o Claude Code com Opus foi significativamente melhor que o Codex com Sol em capturar e documentar os padrões emergentes. Arquivos processados com modelos menores frequentemente estagnavam, aparentemente presos num ótimo local do qual não conseguiam sair.

div class="callout-info"Info: os números medidos do caso são US$ 4 mil em tokens e três semanas de trabalho. Já as projeções de cerca de 70% de redução em defeitos induzidos por IA e 45% menos desperdício de tokens após o uplift são extrapolações de pesquisas anteriores da CodeScene, não medições deste estudo.

Por que a reação dos praticantes ficou dividida

A reação no LinkedIn se dividiu não sobre se o trabalho aconteceu, mas sobre o que ele prova. Paolo Perrone defendeu levar o caso a sério: a maioria das alegações de refatoração que ele leu se apoia numa suíte de testes verde, que só diz que os testes sobreviveram, enquanto replay de traces num jogo de luta impõe um padrão bem mais alto. Mats Iremark, CTO da Omda Response, relatou experiência comparável, escrevendo que o CodeScene MCP combinado com os agentes atuais é quase como trapacear.

Os céticos concentraram fogo no escopo. Konrad Otrębski, tech lead e consultor, perguntou se o trabalho foi mergeado, se chegou como um merge gigante ou vários, e se era um experimento em código open-source em vez de código de produção que gera dinheiro.

Daniel Webb, CTO da NeoSee e um dos dois engenheiros que executaram o trabalho, respondeu que foi mergeado na main de um fork, por meio de 54 pull requests.

Otrębski elevou a régua na sequência: o verdadeiro teste seria oferecer essa refatoração a um projeto open-source famoso, como o Grafana, e a definição de pronto seria o merge na master.

Críticas ao método e às receitas

Tracy Bannon, arquiteta de software e pesquisadora, contestou o enquadramento: descrever o resultado como perfeito é ousado.

Denis Baltor questionou as receitas descobertas, argumentando que DRY trata de duplicação de conhecimento e intenção, não de linhas idênticas, e que receitas definidas por loops que diferem só nos ranges podem estar colapsando os dois conceitos.

Asko Nõmm levantou a questão metodológica: como Claude Code e Codex são ajustados aos próprios modelos, não fica claro quanto do resultado mede o modelo e quanto mede o harness, e o custo variaria da mesma forma.

Ele acrescentou que arquitetura continua sem medição, então o código pode parecer saudável enquanto problemas fundamentais emergem depois.

Perguntas sem resposta dos próprios autores

Marc Bouvier perguntou se o comportamento não funcional melhorou, já que framerate, uso de memória e latência de input importam num jogo. Webb disse que um especialista em performance estava sendo trazido.

Perguntado se o harness capturava regressões sutis de timing de frames, respondeu que talvez não haja resposta definitiva, pois ele rodava como hook de pré-commit e algumas falhas foram corrigidas sem serem observadas.

Sobre tamanho de diffs, foi direto: se você não conhece o código e não revisa mais cada linha, quão grande um diff pode ser? Ele não afirmou nada, só fez perguntas.

div class="callout-warning"Atenção: o harness de replay funcionou porque um jogo descompilado oferece replay determinístico frame a frame. A maioria dos sistemas legados não tem oráculo equivalente, e o próprio Tornhill escreve que testes automatizados e checagens de equivalência são salvaguardas absolutamente essenciais, exatamente o que bases não saudáveis costumam não ter.

O que vem a seguir no estudo com a lund university

A própria seleção da base ilustra a limitação. Webb contou que a equipe considerou um código de licenciamento marítimo do Gov.UK em que ele havia trabalhado, mas ele estava saudável demais para ser útil à pesquisa seguinte. O jogo foi escolhido em parte porque a equipe joga e, portanto, é usuária do sistema.

O uplift produziu duas versões funcionalmente equivalentes do mesmo sistema, uma em Code Health 5,6 e outra em 10,0, para um estudo com a Lund University em que estudantes implementarão features em ambas usando modelos de fronteira e compararão custo e qualidade.

Na avaliação do Mercado de TI, é esse estudo futuro que vai dizer se o investimento em refatoração assistida por agentes se paga na prática, algo que o caso atual, apesar dos números impressionantes, ainda não responde.

Números do estudo de caso da CodeScene: o que foi medido e o que é projeção
IndicadorValorNatureza
Linhas de código C refatoradas300.000Medido
Commits gerados2.903 em 726 arquivosMedido
Linhas modificadas252.055Medido
Custo em tokens≈ US$ 4.000Medido
Duração3 semanasMedido
Code Healthde 5,6 para 10,0Medido
Pull requests54 (merge na main de um fork)Medido
Receitas de refatoração22 receitas, 82 notasMedido
Redução de defeitos induzidos por IA≈ 70%Projeção (pesquisa anterior)
Redução de desperdício de tokens≈ 45%Projeção (pesquisa anterior)

Arraste para o lado para ver toda a tabela.

Para quem acompanha o debate sobre como a IA está mudando o processo de code review e o uso de runtimes e harnesses para agentes de IA, o caso da CodeScene é um marco medido, mas de escopo limitado. O próximo passo é observar se resultados semelhantes se reproduzem em código de produção, sem oráculo determinístico e com revisão humana de verdade em cada um dos 54 pull requests, como já acontece em experimentos de migração test-driven com Claude e Cursor em produção.

D

· Editor-chefe

Especialista em tecnologia, criador de conteúdo e fundador do portal Mercado de TI e Casa do Dev. Analiso tendências de mercado, Inteligência Artificial e carreira, entregando informações precisas, tr...

LinkedIn Site

COMPARTILHAR