SRE Sênior

Cadmus

📍 São Pauloremoto

Descrição da vaga

Buscamos um(a) SRE Sênior para atuar na sustentação, evolução e engenharia de plataformas cloud em uma empresa do segmento financeiro.

O profissional terá papel estratégico na construção de uma plataforma confiável, escalável, segura e automatizada, atuando próximo aos times de desenvolvimento para melhorar a disponibilidade dos serviços, reduzir riscos operacionais e acelerar o ciclo de entrega.

Será responsável por implementar práticas de Site Reliability Engineering (SRE), automação, observabilidade e infraestrutura como código, contribuindo para a evolução contínua da plataforma e dos processos de desenvolvimento e deploy.

Responsabilidades

  • Projetar, implementar e evoluir plataformas e ambientes cloud com foco em confiabilidade, escalabilidade e segurança;
  • Construir e manter pipelines CI/CD, promovendo automação e padronização dos processos de entrega;
  • Provisionar e gerenciar infraestrutura utilizando Terraform e IaC;
  • Administrar e evoluir ambientes Kubernetes;
  • Automatizar processos de deploy, provisionamento, configuração e operações;
  • Implementar e evoluir soluções de monitoramento, observabilidade e alertas;
  • Definir e acompanhar SLIs, SLOs e indicadores de confiabilidade;
  • Atuar na análise de incidentes, troubleshooting e RCA (Root Cause Analysis);
  • Trabalhar na prevenção de incidentes e redução de problemas recorrentes;
  • Apoiar os times de desenvolvimento na adoção de boas práticas de cloud, observabilidade, performance e confiabilidade;
  • Evoluir padrões e componentes reutilizáveis da plataforma;
  • Atuar na melhoria contínua da segurança e resiliência dos ambientes;
  • Identificar oportunidades de automação e redução de atividades operacionais manuais;
  • Contribuir para práticas de DevSecOps e FinOps;
  • Utilizar ferramentas de IA como aceleradoras de produtividade, automação, troubleshooting e desenvolvimento.


Requisitos

  • Experiência sólida como SRE, DevOps Sênior ou Platform Engineer;
  • AWS em ambientes produtivos;
  • Kubernetes e Docker;
  • Terraform e Infraestrutura como Código (IaC);
  • Construção e manutenção de pipelines CI/CD — GitHub Actions, GitLab CI ou Jenkins;
  • Linux e automação com Bash e/ou Python;
  • Experiência com observabilidade e monitoramento — Prometheus, Grafana ou similares;
  • Gestão e análise de logs — ELK, OpenSearch ou similares;
  • Conceitos sólidos de redes, segurança e arquitetura cloud;
  • Experiência com automação de infraestrutura, deploy e processos operacionais;
  • Conhecimento de práticas de SRE, como disponibilidade, confiabilidade, SLIs, SLOs, SLAs, error budget e gestão de incidentes;
  • Experiência na atuação junto a times de desenvolvimento para identificação e resolução de problemas de performance, disponibilidade e confiabilidade;
  • Obrigatório ter experiência prática na utilização de ferramentas de IA para desenvolvimento e/ou operações, como Kiro, Claude, GitHub Copilot, ChatGPT, Cursor ou similares.


Diferenciais

  • Experiência no segmento financeiro;
  • Conhecimento em Open Finance / Open Banking;
  • Kafka;
  • Helm;
  • ArgoCD;
  • Service Mesh — Istio ou similares;
  • Práticas de DevSecOps;
  • Conceitos de FinOps;
  • Experiência com arquitetura e desenvolvimento de plataformas internas (Internal Developer Platforms);
  • Conhecimento de GitOps;
  • Experiência com estratégias de alta disponibilidade, disaster recovery e continuidade de serviços;
  • Conhecimento em capacity planning e otimização de performance.

Mais vagas em São Paulo