O que a vaga pede
Resumo: A Ideen está buscando uma Pessoa Site Reliability Engineer (SRE) para alocação em um dos nossos clientes, que é líder mundial no segmento industrial. Essa pessoa será responsável por melhorar a confiabilidade, a escalabilidade e a resiliência das plataformas e da infraestrutura do cliente, atuando na intersecção entre engenharia de software e engenharia de sistemas. O foco central é construir automação para eliminar tarefas manuais e repetitivas (toil) e prevenir proativamente incidentes que impactem os serviços, projetando e sustentando sistemas distribuídos, tolerantes a falhas e de alta disponibilidade em Google Cloud Platform (GCP).
Responsabilidades:
- Projetar, construir e manter ferramentas de automação e infraestrutura como código (IaC) para eliminar tarefas operacionais manuais e agilizar fluxos de deploy.
- Colaborar com times de produto e desenvolvimento para definir, monitorar e garantir SLIs e SLOs dos serviços críticos.
- Projetar e implementar sistemas robustos de monitoramento, alertas e logging, garantindo visibilidade profunda da saúde de aplicações e infraestrutura.
- Participar da escala de plantão (on-call) e conduzir post-mortems sem culpabilização (blameless), identificando causas-raiz e implementando medidas preventivas.
- Otimizar a infraestrutura GCP quanto a performance, custo e escalabilidade, gerenciando load balancing, roteamento de tráfego e auto-scaling.
- Apoiar e evoluir pipelines de CI/CD, garantindo entregas de software seguras, previsíveis e frequentes.
- Planejar, implementar e testar estratégias de disaster recovery, failover e backup, assegurando continuidade de negócio.
- Revisar arquitetura e código de aplicações, garantindo aderência a padrões de production readiness, segurança e escalabilidade.
Requisitos:
- Formação superior completa em Ciência da Computação, Tecnologia da Informação ou área correlata, ou combinação equivalente de formação e experiência.
- De 5 a 8 anos de experiência em funções de SRE, DevOps ou Cloud Systems Engineering.
- Experiência em deploy e gestão de workloads em GCP, com familiaridade com serviços core (GKE, Compute Engine, Cloud Run, Cloud Functions e BigQuery).
- Sólido domínio de Docker e Kubernetes (gestão, deploy e troubleshooting).
- Experiência prática com IaC (ex.: Terraform).
- Conhecimento profundo de administração Linux/Unix, protocolos de rede (TCP/IP, DNS, HTTP/S) e internals de sistema.
- Proficiência em ao menos uma linguagem de scripting/programação para automação (ex.: Python, Go ou Bash).
- Experiência com stacks de observabilidade (GCP Cloud Monitoring/Logging ou equivalentes open-source como Prometheus, Grafana e ELK).
- Experiência com pipelines de CI/CD e controle de versão (ex.: GitHub Actions, GitLab CI, Jenkins ou Google Cloud Build).
- Inglês fluente (obrigatório), para atuação com equipes internacionais.
- Disponibilidade para trabalho presencial de 2 a 3 vezes por semana, em escritório próximo à estação Brigadeiro, em São Paulo (SP).
Diferencial:
- Certificações Google Cloud (Professional Cloud DevOps Engineer, Professional Site Reliability Engineer) ou Certified Kubernetes Administrator (CKA).
- Vivência consolidada em cultura SRE, com foco em correções sistêmicas em vez de erro humano nas retrospectivas de incidentes.
- Aderência a práticas modernas de Change Management e fluxos GitOps para mudanças seguras em produção.
- Excelente capacidade de troubleshooting e análise, com histórico de depuração de sistemas distribuídos complexos sob pressão.
- Boa comunicação e colaboração com desenvolvedores, product managers, times de segurança e stakeholders de negócio.
Informações da Empresa:
Na Ideen unimos tecnologia e estratégia para transformar desafios complexos em soluções que geram impacto real para grandes empresas.
Somos um time movido por inovação, estratégia e resultados.
Se busca um ambiente com autonomia, desafios relevantes e oportunidades reais de crescimento, a Ideen pode ser o próximo passo da sua jornada.