A Modal, plataforma serverless de computação voltada a workloads de IA, conseguiu criar 1 milhão de sandboxes concorrentes em menos de um minuto, com tempo mediano de menos de 0,5 segundo entre inicialização e disponibilidade de código.
O feito, detalhado pelos staff engineers Colin Weld e Connor Adams, exigiu abandonar a orquestração tradicional de containers e reconstruir a infraestrutura de sandboxes do zero. Google Substrate (github.com)
O ponto mais provocativo do trabalho é a decisão de não estender o Kubernetes: em vez de contornar os limites de coordenação centralizada e estado fortemente consistente do orquestrador, a equipe redesenhou o agendamento para se comportar como balanceamento de carga, com cada worker atuando como sua própria fonte de verdade.
Por que o Kubernetes não aguenta 1 milhão de sandboxes
Colin Weld e Connor Adams explicam que sistemas tradicionais de orquestração de containers, como o Kubernetes, enfrentam dificuldades nessa escala porque dependem de coordenação centralizada e estado fortemente consistente. Rodar 1 milhão de sandboxes exige dezenas de milhares de nós de computação, e há muitas operações de custo O(containers), O(nodes) ou ambos.
No caso específico do Kubernetes, a carga sobre o algoritmo de agendamento e sobre o etcd, o armazém durável central, cresce com o número de nós e pods.
# publicidade
Pods e nós gravam no etcd várias vezes, o que gera problemas sérios sob altas taxas de criação ou churn de pods, e o etcd não permite sharding nativo dentro de um keyspace.
Segundo os engenheiros, superar essas limitações é viável, mas exige trabalho pesado: reescrever ou substituir o etcd e paralelizar o algoritmo de agendamento.
O(sandboxes) é o princípio que guiou o redesenho: tudo que gera carga proporcional ao número de sandboxes ou de nós deve ser escalável horizontalmente por padrão, com o caminho de criação o mais simples possível.
Agendamento virou balanceamento de carga
A mudança fundamental da Modal foi parar de coordenar globalmente. Em vez de um datastore central como fonte de verdade e um agendador serializado único, a plataforma passou a operar com uma frota de servidores de agendamento em paralelo, enquanto cada worker se tornou responsável pelo próprio estado.
O fluxo funciona assim: o servidor de agendamento decide em qual worker criar um sandbox e o contata diretamente via RPC. O worker aceita a requisição se tiver recursos livres ou a rejeita. Segundo os autores, a arquitetura resultante tem um único gargalo: todos os workers publicam estado em um único stream do Redis. Testes de carga indicam que essa abordagem permanece viável até bem acima de 100 mil workers.
No benchmark final, a plataforma criou 1 milhão de sandboxes em menos de um minuto e sustentou 50 mil criações de sandbox por segundo, com mediana de tempo entre inicialização e código disponível abaixo de 0,5 segundo.
Info: a Modal é uma plataforma serverless de computação voltada a workloads de IA, com acesso programável a CPUs, GPUs, containers, inferência, treinamento, jobs em lote e sandboxes isolados.
O que a comunidade técnica disse
Comentando o anúncio no LinkedIn, o CEO da Hopsworks, Jim Dowling, observou que "novos problemas técnicos surgem a cada ordem de magnitude de escala", sugerindo que a equipe iterou o design várias vezes até chegar com confiabilidade às 50 mil criações de sandbox por segundo.
A leitura mais contundente veio de Alex Jones, principal AI engineer da AWS: para ele, a chave do feito foi não tentar estender o Kubernetes, mas "contornar a coisa toda" após entender suas limitações. Jones considera o trabalho o primeiro sinal crível de que o Kubernetes não está se adaptando rápido o suficiente ao que a infraestrutura de GenAI realmente precisa.
"Estamos caminhando para um desacoplamento entre coordenação e execução. O plano de execução quer o que a Modal construiu: fronteiras de isolamento que aparecem em milissegundos. O plano de coordenação (onde workflows multiagente precisam de memória compartilhada e fronteiras de segurança sobrepostas) ainda quer o que sistemas no formato do Kubernetes fazem bem." — Alex Jones, AWS
Modal não está sozinha na corrida para reconstruir a nuvem
A iniciativa da Modal se insere num movimento maior de reconstrução da infraestrutura de cloud em torno de escalabilidade extrema e cold starts abaixo de 10 milissegundos, impulsionado pela demanda de agentes de IA que executam código em ambientes isolados. Projetos que perseguem objetivos semelhantes incluem Unikraft, Google Substrate e Overdrive.
A aposta em sandboxes tem lógica clara para quem acompanha os riscos de segurança dos agentes autônomos: quanto mais código gerado por IA executando em produção, mais crítica se torna a capacidade de criar e destruir isolamento em milissegundos. Na avaliação do Mercado de TI, o movimento indica que a infraestrutura de execução efêmera pode se separar de fato do plano de coordenação, como aponta Jones, criando duas camadas de mercado distintas onde hoje o Kubernetes domina sozinho.
Dica: se você avalia infraestrutura para agentes de IA em produção, vale comparar a abordagem da Modal com alternativas como o Harness, runtime open-source da DeepSeek para agentes, e com plataformas que ainda apostam no ecossistema Kubernetes, como o TauGrid da Microsoft para workloads de IA em clusters com GPU.
Atenção: o único gargalo reconhecido da arquitetura é o stream único de Redis que concentra o estado de todos os workers. A solução foi validada em testes de carga até pouco mais de 100 mil workers; acima disso, o design ainda não tem resposta pública.
O que muda para quem constrói infraestrutura de IA
O resultado da Modal reforça uma tendência já visível no mercado: os limites do Kubernetes são otimizações de uma era em que containers viviam minutos ou horas, não milissegundos. Para times brasileiros que operam agentes de IA em produção, o desafio prático deixa de ser "como escalar meu cluster" e passa a ser "qual plano de execução suporta a granularidade que agentes exigem".
Nada disso significa abandonar Kubernetes amanhã: o próprio Alex Jones reconhece que o plano de coordenação continua bem servido por sistemas desse formato. A pergunta que fica é quanto tempo levará para o ecossistema mainstream absorver a separação entre coordenação e execução que a Modal demonstrou na prática com 1 milhão de sandboxes.
Perguntas frequentes
Por que o etcd limita a escala do Kubernetes?
Pods e nós gravam no etcd várias vezes, e o armazém não permite sharding nativo dentro de um keyspace, o que cria gargalo sob alta taxa de criação de pods, segundo os engenheiros da Modal.
Como a modal agenda sandboxes SEM coordenação central?
Uma frota de servidores de agendamento opera em paralelo e contata workers diretamente via RPC; cada worker, como própria fonte de verdade, aceita ou rejeita a criação conforme recursos disponíveis.
Quais empresas perseguem objetivos semelhantes aos da modal?
O InfoQ cita Unikraft, Google Substrate e Overdrive como projetos que também buscam reconstruir a nuvem com alta escalabilidade e cold starts abaixo de 10 milissegundos.
Fonte: Infoq