Modal ignora Kubernetes e cria 1 milhão de sandboxes de IA em menos de um minuto

7 min
Modal ignora Kubernetes e cria 1 milhão de sandboxes de IA em menos de um minuto

A Modal reconstruiu sua infraestrutura de sandboxes do zero, criando 1 milhão de ambientes isolados em menos de um minuto ao abandonar a coordenação centralizada do Kubernetes em favor de uma frota de agendadores paralelos.

A Modal, plataforma serverless de computação voltada a workloads de IA, conseguiu criar 1 milhão de sandboxes concorrentes em menos de um minuto, com tempo mediano de menos de 0,5 segundo entre inicialização e disponibilidade de código.

O feito, detalhado pelos staff engineers Colin Weld e Connor Adams, exigiu abandonar a orquestração tradicional de containers e reconstruir a infraestrutura de sandboxes do zero. Google Substrate (github.com)

O ponto mais provocativo do trabalho é a decisão de não estender o Kubernetes: em vez de contornar os limites de coordenação centralizada e estado fortemente consistente do orquestrador, a equipe redesenhou o agendamento para se comportar como balanceamento de carga, com cada worker atuando como sua própria fonte de verdade.

Por que o Kubernetes não aguenta 1 milhão de sandboxes

Colin Weld e Connor Adams explicam que sistemas tradicionais de orquestração de containers, como o Kubernetes, enfrentam dificuldades nessa escala porque dependem de coordenação centralizada e estado fortemente consistente. Rodar 1 milhão de sandboxes exige dezenas de milhares de nós de computação, e há muitas operações de custo O(containers), O(nodes) ou ambos.

No caso específico do Kubernetes, a carga sobre o algoritmo de agendamento e sobre o etcd, o armazém durável central, cresce com o número de nós e pods.

# publicidade

Pods e nós gravam no etcd várias vezes, o que gera problemas sérios sob altas taxas de criação ou churn de pods, e o etcd não permite sharding nativo dentro de um keyspace.

Segundo os engenheiros, superar essas limitações é viável, mas exige trabalho pesado: reescrever ou substituir o etcd e paralelizar o algoritmo de agendamento.

O(sandboxes) é o princípio que guiou o redesenho: tudo que gera carga proporcional ao número de sandboxes ou de nós deve ser escalável horizontalmente por padrão, com o caminho de criação o mais simples possível.

Agendamento virou balanceamento de carga

A mudança fundamental da Modal foi parar de coordenar globalmente. Em vez de um datastore central como fonte de verdade e um agendador serializado único, a plataforma passou a operar com uma frota de servidores de agendamento em paralelo, enquanto cada worker se tornou responsável pelo próprio estado.

O fluxo funciona assim: o servidor de agendamento decide em qual worker criar um sandbox e o contata diretamente via RPC. O worker aceita a requisição se tiver recursos livres ou a rejeita. Segundo os autores, a arquitetura resultante tem um único gargalo: todos os workers publicam estado em um único stream do Redis. Testes de carga indicam que essa abordagem permanece viável até bem acima de 100 mil workers.

No benchmark final, a plataforma criou 1 milhão de sandboxes em menos de um minuto e sustentou 50 mil criações de sandbox por segundo, com mediana de tempo entre inicialização e código disponível abaixo de 0,5 segundo.

Info: a Modal é uma plataforma serverless de computação voltada a workloads de IA, com acesso programável a CPUs, GPUs, containers, inferência, treinamento, jobs em lote e sandboxes isolados.

O que a comunidade técnica disse

Comentando o anúncio no LinkedIn, o CEO da Hopsworks, Jim Dowling, observou que "novos problemas técnicos surgem a cada ordem de magnitude de escala", sugerindo que a equipe iterou o design várias vezes até chegar com confiabilidade às 50 mil criações de sandbox por segundo.

A leitura mais contundente veio de Alex Jones, principal AI engineer da AWS: para ele, a chave do feito foi não tentar estender o Kubernetes, mas "contornar a coisa toda" após entender suas limitações. Jones considera o trabalho o primeiro sinal crível de que o Kubernetes não está se adaptando rápido o suficiente ao que a infraestrutura de GenAI realmente precisa.

"Estamos caminhando para um desacoplamento entre coordenação e execução. O plano de execução quer o que a Modal construiu: fronteiras de isolamento que aparecem em milissegundos. O plano de coordenação (onde workflows multiagente precisam de memória compartilhada e fronteiras de segurança sobrepostas) ainda quer o que sistemas no formato do Kubernetes fazem bem." — Alex Jones, AWS

A iniciativa da Modal se insere num movimento maior de reconstrução da infraestrutura de cloud em torno de escalabilidade extrema e cold starts abaixo de 10 milissegundos, impulsionado pela demanda de agentes de IA que executam código em ambientes isolados. Projetos que perseguem objetivos semelhantes incluem Unikraft, Google Substrate e Overdrive.

A aposta em sandboxes tem lógica clara para quem acompanha os riscos de segurança dos agentes autônomos: quanto mais código gerado por IA executando em produção, mais crítica se torna a capacidade de criar e destruir isolamento em milissegundos. Na avaliação do Mercado de TI, o movimento indica que a infraestrutura de execução efêmera pode se separar de fato do plano de coordenação, como aponta Jones, criando duas camadas de mercado distintas onde hoje o Kubernetes domina sozinho.

Dica: se você avalia infraestrutura para agentes de IA em produção, vale comparar a abordagem da Modal com alternativas como o Harness, runtime open-source da DeepSeek para agentes, e com plataformas que ainda apostam no ecossistema Kubernetes, como o TauGrid da Microsoft para workloads de IA em clusters com GPU.

Atenção: o único gargalo reconhecido da arquitetura é o stream único de Redis que concentra o estado de todos os workers. A solução foi validada em testes de carga até pouco mais de 100 mil workers; acima disso, o design ainda não tem resposta pública.

O que muda para quem constrói infraestrutura de IA

O resultado da Modal reforça uma tendência já visível no mercado: os limites do Kubernetes são otimizações de uma era em que containers viviam minutos ou horas, não milissegundos. Para times brasileiros que operam agentes de IA em produção, o desafio prático deixa de ser "como escalar meu cluster" e passa a ser "qual plano de execução suporta a granularidade que agentes exigem".

Nada disso significa abandonar Kubernetes amanhã: o próprio Alex Jones reconhece que o plano de coordenação continua bem servido por sistemas desse formato. A pergunta que fica é quanto tempo levará para o ecossistema mainstream absorver a separação entre coordenação e execução que a Modal demonstrou na prática com 1 milhão de sandboxes.

Perguntas frequentes

Por que o etcd limita a escala do Kubernetes?

Pods e nós gravam no etcd várias vezes, e o armazém não permite sharding nativo dentro de um keyspace, o que cria gargalo sob alta taxa de criação de pods, segundo os engenheiros da Modal.

Como a modal agenda sandboxes SEM coordenação central?

Uma frota de servidores de agendamento opera em paralelo e contata workers diretamente via RPC; cada worker, como própria fonte de verdade, aceita ou rejeita a criação conforme recursos disponíveis.

Quais empresas perseguem objetivos semelhantes aos da modal?

O InfoQ cita Unikraft, Google Substrate e Overdrive como projetos que também buscam reconstruir a nuvem com alta escalabilidade e cold starts abaixo de 10 milissegundos.

Fonte: Infoq

D

· Editor-chefe

Especialista em tecnologia, criador de conteúdo e fundador do portal Mercado de TI e Casa do Dev. Analiso tendências de mercado, Inteligência Artificial e carreira, entregando informações precisas, tr...

LinkedIn Site

COMPARTILHAR