O Google publicou benchmarks do GKE Pod Snapshots mostrando redução de até 89% na latência de inicialização de workloads no Kubernetes, com modelo de 70 bilhões de parâmetros carregando em 37 segundos.
Como o gke pod snapshots funciona por baixo do capô
Checkpoint e restore completos: memória de CPU e GPU, threads, registradores, rootfs, EmptyDir e tmpfs.
Requer gVisor via GKE Sandbox; Autopilot já inclui, Standard precisa de node pool dedicado.
Leia também
Form3: como uma fintech roda o mesmo código em três nuvens e sobreviveu a apagão do Google cloud
Compatibilidade validada por hash do distilled Pod spec, série de máquina e versões de kernel e driver.
Caso real: codeway cortou startup de 1 minuto para 8 segundos
Plataforma Retake usava cache customizado que levava startup a um minuto; snapshots reduziram para 8 segundos.
Time passou a ligar instâncias H100 por job e desligá-las ao final.
Quais são as limitações e o trabalho que migra para o time de plataforma
Invalidação de snapshots apontada como o problema mais difícil: CUDA, driver, GPU e runtime viram chave de compatibilidade.
Reidratação de secrets, DNS e conexões fica com a aplicação; snapshots de Pod inteiro não rodam em E2 e multi-GPU só em L4.
Agent sandbox, agent substrate e o que vem a seguir
Agent Sandbox em GA aloca até 300 sandboxes por segundo por cluster usando snapshots para suspender agentes ociosos.
Agent Substrate explora densidade maior em open-source, mas não está pronto para produção.
Leia também:
Fonte: Infoq