SRE Sênior
Cadmus
Descrição da vaga
Buscamos um(a) SRE Sênior para atuar na sustentação, evolução e engenharia de plataformas cloud em uma empresa do segmento financeiro.
O profissional terá papel estratégico na construção de uma plataforma confiável, escalável, segura e automatizada, atuando próximo aos times de desenvolvimento para melhorar a disponibilidade dos serviços, reduzir riscos operacionais e acelerar o ciclo de entrega.
Será responsável por implementar práticas de Site Reliability Engineering (SRE), automação, observabilidade e infraestrutura como código, contribuindo para a evolução contínua da plataforma e dos processos de desenvolvimento e deploy.
Responsabilidades
- Projetar, implementar e evoluir plataformas e ambientes cloud com foco em confiabilidade, escalabilidade e segurança;
- Construir e manter pipelines CI/CD, promovendo automação e padronização dos processos de entrega;
- Provisionar e gerenciar infraestrutura utilizando Terraform e IaC;
- Administrar e evoluir ambientes Kubernetes;
- Automatizar processos de deploy, provisionamento, configuração e operações;
- Implementar e evoluir soluções de monitoramento, observabilidade e alertas;
- Definir e acompanhar SLIs, SLOs e indicadores de confiabilidade;
- Atuar na análise de incidentes, troubleshooting e RCA (Root Cause Analysis);
- Trabalhar na prevenção de incidentes e redução de problemas recorrentes;
- Apoiar os times de desenvolvimento na adoção de boas práticas de cloud, observabilidade, performance e confiabilidade;
- Evoluir padrões e componentes reutilizáveis da plataforma;
- Atuar na melhoria contínua da segurança e resiliência dos ambientes;
- Identificar oportunidades de automação e redução de atividades operacionais manuais;
- Contribuir para práticas de DevSecOps e FinOps;
- Utilizar ferramentas de IA como aceleradoras de produtividade, automação, troubleshooting e desenvolvimento.
Requisitos
- Experiência sólida como SRE, DevOps Sênior ou Platform Engineer;
- AWS em ambientes produtivos;
- Kubernetes e Docker;
- Terraform e Infraestrutura como Código (IaC);
- Construção e manutenção de pipelines CI/CD — GitHub Actions, GitLab CI ou Jenkins;
- Linux e automação com Bash e/ou Python;
- Experiência com observabilidade e monitoramento — Prometheus, Grafana ou similares;
- Gestão e análise de logs — ELK, OpenSearch ou similares;
- Conceitos sólidos de redes, segurança e arquitetura cloud;
- Experiência com automação de infraestrutura, deploy e processos operacionais;
- Conhecimento de práticas de SRE, como disponibilidade, confiabilidade, SLIs, SLOs, SLAs, error budget e gestão de incidentes;
- Experiência na atuação junto a times de desenvolvimento para identificação e resolução de problemas de performance, disponibilidade e confiabilidade;
- Obrigatório ter experiência prática na utilização de ferramentas de IA para desenvolvimento e/ou operações, como Kiro, Claude, GitHub Copilot, ChatGPT, Cursor ou similares.
Diferenciais
- Experiência no segmento financeiro;
- Conhecimento em Open Finance / Open Banking;
- Kafka;
- Helm;
- ArgoCD;
- Service Mesh — Istio ou similares;
- Práticas de DevSecOps;
- Conceitos de FinOps;
- Experiência com arquitetura e desenvolvimento de plataformas internas (Internal Developer Platforms);
- Conhecimento de GitOps;
- Experiência com estratégias de alta disponibilidade, disaster recovery e continuidade de serviços;
- Conhecimento em capacity planning e otimização de performance.
