A Roblox esta levando a engenharia de software autonoma do prompt ate a producao, com agentes que podem reestruturar codigo e implementar funcionalidades completas sem intervencao humana. O projeto, chamado Prompt to Prod, enfrenta o paradoxo central da IA generativa: resolvemos a digitacao, mas ainda nao resolvemos a confianca.
Andrew Swerdlow, Senior Director de Software na Roblox, apresentou a jornada no QCon AI, detalhando como a empresa construiu a infraestrutura de confianca para permitir que agentes trabalhem com autonomia crescente. A plataforma, que atende 150 milhoes de usuarios ativos mensais, tratou o problema em tres frentes: alinhamento com guardrails, seguranca no acesso e novas metricas de produtividade.
Info: O projeto Prompt to Prod nasceu da vontade de automatizar a criacao de experimentos na homepage, que exigia 18 pontos de contato humanos e semanas de trabalho. Apos um sprint de quatro semanas, a equipe conseguiu conectar todos os sistemas com CLIs, APIs e integracao MCP.
# publicidade
Como a roblox extrai conhecimento institucional para alinhar agentes?
A primeira barreira foi o alinhamento. Modelos de fronteira foram treinados com petabytes de dados, mas as empresas detem exabytes de informacao interna. A diferenca? Um milhao de vezes mais dados. Quando os agentes nao tem acesso a esse conhecimento, erram e criam retrabalho.
A Roblox tentou fine-tuning de modelos open source e system prompts especiais. Nada funcionou bem. A descoberta foi que o conhecimento dos melhores engenheiros ja estava no repositorio, nas revisoes de codigo. Com 1,75 milhao de comentarios em 700 mil PRs em tres anos, a equipe extraiu e agrupou feedbacks em exemplares: regras testaveis em YAML, anotadas pelos autores originais e adotadas opt-in pelos donos dos repositorios.
O impacto foi direto. O agente de code review, que antes tinha baixas taxas de aceitacao, passou a ter 68-70% de aceite nas sugestoes, superando os 55% das revisoes humanas. A anotacao com autor nomeado foi o fator decisivo: engenheiros confiam mais em regras vindas de quem realmente escreveu o feedback.
Dica: Para extrair conhecimento similar, analise os comentarios de code review do seu repositorio, agrupe por tema e transforme em regras testaveis. Anotar o autor original aumenta a credibilidade e a adocao.
O que sao exemplares e como funcionam na pratica?
Exemplares sao regras extraidas de feedbacks de code review, encapsuladas em YAML e integradas ao alignment engine, um sistema que age como um loop React. Durante a revisao, o motor injeta as regras no contexto do agente, melhorando as sugestoes.
Cada exemplar tem descricao, padroes e metrica de desempenho no codigo, vinda das estatisticas de review. Um playground permite testar a regra contra um PR especifico antes de adota-la, ajustando a eficacia. A interface exibe uma lista de regras por repositorio, e o engenheiro escolhe quais adotar, evitando friccao.
Como garantir seguranca quando agentes operam com autonomia?
Seguranca foi o maior investimento. Os receios eram legittimos: prompt injection, permissoes herdadas e agentes que agem como voce. Um amigo de Swerdlow, em outro laboratorio, pediu que um agente resolvesse um Jira durante a noite. O agente acabou enviando mensagens no Slack para colegas pedindo merge de um PR, ignorando os checks, so para ser prestativo.
Para evitar esses casos, a Roblox construiu sandboxes proprios, com controle de acesso a rede, permissoes just-in-time e principio do menor privilegio. Nada de segredos de longa duracao que possam vazar. Identidades de agente tem anotacao separada e auditavel: um Slack enviado por IA deve ser obvio na auditoria, diferente de um envio humano.
Na orquestracao, o problema era acessibilidade. Muitas ferramentas nao tinham APIs nem integracao MCP. A equipe usou Playwright para converter UIs em CLIs, tornando-as agentic-friendly. Em quatro semanas, o fluxo completo foi conectado, permitindo que o agente autora experimentos na homepage, mas com as bases de confiabilidade que faltavam: cobertura de testes, integracao, staging, auto-rollback e auto-revert.
Atencao: Aumentar a velocidade de autonomia sem foco em seguranca cria divida tecnica. Sem pessoas que entendam o codigo em producao, os incidentes viram pesadelos operacionais.
Quais metricas importam em engenharia autonoma?
A terceira area, mais nascente, e a medicao. Metricas tradicionais, como numero de PRs ou linhas de codigo, nao capturam o valor de agentes que trabalham em turnos longos. A Roblox esta repensando a produtividade em torno de velocidade de features e de turnos de IA que duram mais que minutos ou horas.
A proposta e medir o trabalho pelo resultado de negocio, nao pela atividade. Um agente que reestrutura um sistema inteiro em dias, com qualidade e sem incidentes, vale mais que uma semana de PRs humanos. Mas isso exige dashboards que mostrem o impacto real no produto, nao apenas a quantidade de codigo gerado.
Nao ha consenso ainda. Swerdlow reconhece que essa e a area menos madura e convida a industria a discutir. A pergunta central: como comparar a produtividade de um engenheiro humano com a de um agente que trabalha 24 horas por dia, de forma confiavel e com as mesmas metricas?
Como a roblox redefine a produtividade na pratica?
A empresa quer medir a velocidade com que uma ideia vira feature em producao, nao o numero de commits. Isso inclui o tempo de ciclo completo e a qualidade da entrega. A expectativa e que agentes autonomos aumentem a frequencia de deploys sem aumentar incidentes.
Um dos desafios e diferenciar trabalho mecanico de trabalho criativo. Agentes podem lidar com o primeiro, mas o segundo ainda exige humanos. A Roblox busca um modelo onde humanos definem a direcao e os agentes executam a maior parte do caminho, com supervision em pontos criticos.
Aumentar velocidade SEM aumentar divida tecnica e possivel?
Na visao da Roblox, sim, mas com a infraestrutura certa. Se voce apenas acelera a geracao de codigo sem melhorar a digestao, cria divida tecnica: codigo que ninguem entende, seguranca fragil e pagers tocando as 3 da manha. A solucao envolve investir em infraestrutura de confianca antes de soltar os agentes.
Os resultados concretos: agentes de revisao superam humanos em aceitacao, experimentos na homepage sao autorados sem intervencao e o pipeline de producao ganhou gates de seguranca e rollback automatico. Nao e sobre YOLO, e sobre construir as condicoes para que a autonomia seja segura.
A experiencia da Roblox indica que o futuro da engenharia de software nao e substituir humanos por agentes, mas criar um sistema onde agentes executam com confianca, sob guardrails claros e com metricas que refletem valor real. O proximo passo e a industria concordar sobre como medir essa produtividade.