Cloud Engineer / Site Reliability Engineer (SRE) Sênior

Groove Tech

📍 São Pauloremoto

Descrição da vaga

Estamos buscando um(a) Cloud Engineer / Site Reliability Engineer (SRE) Sênior para atuar na evolução, confiabilidade, segurança e escalabilidade de uma plataforma crítica.

O ambiente é 100% Google Cloud Platform (GCP), com Kubernetes/GKE como núcleo da arquitetura. Buscamos alguém com forte experiência em cloud, visão de arquitetura e mentalidade SRE, capaz de atuar de forma estratégica e hands-on.

Essa pessoa será uma referência técnica para os times de Engenharia e Produto, contribuindo para decisões de arquitetura, automação, observabilidade, segurança, performance e eficiência de custos.

Principais responsabilidades
Liderar tecnicamente a evolução da infraestrutura em GCP, principalmente GKE, Compute Engine, Cloud SQL, Cloud Storage, VPC, Load Balancing, IAM, Cloud DNS, Secret Manager, Pub/Sub e BigQuery.
Projetar arquiteturas com foco em alta disponibilidade, escalabilidade, resiliência, segurança, performance e custo.
Atuar com práticas de SRE, definindo e acompanhando SLIs, SLOs e Error Budgets.
Trabalhar com indicadores de confiabilidade como disponibilidade, latência, throughput, taxa de erro, saturação, capacidade, MTTR e MTBF.
Administrar e realizar troubleshooting avançado em Kubernetes/GKE em produção.
Definir estratégias de autoscaling, capacity planning, resource management e workload isolation.
Evoluir a estratégia de observabilidade, utilizando principalmente New Relic, além de OpenTelemetry, Prometheus, Grafana e ferramentas nativas de cloud.
Criar dashboards, alertas e métricas técnicas e de negócio, garantindo uma observabilidade acionável.
Atuar como Incident Commander em incidentes críticos e conduzir postmortems blameless.
Administrar e evoluir infraestrutura como código utilizando Terraform.
Desenvolver e manter módulos reutilizáveis, padrões de configuração, state management e pipelines de Terraform.
Administrar pipelines de CI/CD com GitHub Actions e processos de deployment utilizando ArgoCD/GitOps.
Implementar estratégias como rolling, blue/green e canary deployments.
Desenvolver automações utilizando Go, Python e Bash.
Criar soluções de Platform Engineering, self-service, templates, automações e golden paths.
Atuar com networking cloud, segurança, governança, IAM/RBAC, secrets, certificados e criptografia.
Contribuir para iniciativas de FinOps, otimização de recursos, rightsizing e redução de desperdícios.
Projetar e validar estratégias de Disaster Recovery, backup, restore, failover, RPO e RTO.
Atuar com performance e capacity planning, antecipando gargalos e necessidades de crescimento.

5+ anos de experiência atuando com infraestrutura crítica em produção em cloud pública.
Experiência sólida com Google Cloud Platform (GCP).
Experiência prática com Kubernetes em produção, preferencialmente GKE.
Conhecimento avançado de Terraform, incluindo módulos, state, versionamento e organização de ambientes.
Experiência prática com SLIs, SLOs e Error Budgets.
Conhecimento avançado de troubleshooting em Linux, redes, DNS, HTTP, TLS, Load Balancers e Kubernetes.
Experiência com automação utilizando Go, Python e/ou Bash.
Experiência com GitHub Actions, ArgoCD e GitOps.
Experiência na condução de incidentes críticos, postmortems e análise de causa raiz.
Capacidade de atuar em decisões arquiteturais e comunicar trade-offs técnicos, operacionais e financeiros.

Conhecimentos técnicos
Cloud
GCP — essencial
AWS e/ou Azure — desejável
Kubernetes: GKE, EKS e/ou AKS

ObservabilidadeNew Relic
OpenTelemetry
Prometheus
Grafana
Cloud Monitoring / CloudWatch / Azure Monitor

Infrastructure as Code
Terraform
Terragrunt
Atlantis
Terraform Cloud ou OpenTofu

CI/CD e Platform Engineering
GitHub Actions
ArgoCD
GitOps
Self-service
Golden Paths
Developer Portals

Automação
Go
Python
Bash

Networking
TCP/IP
DNS
HTTP/HTTPS
TLS
Routing
NAT
VPN
Firewalls
Load Balancers
Ingress Controllers
CDN

Segurança
IAM / RBAC
Least Privilege
Zero Trust
Secret Manager
AWS Secrets Manager
Azure Key Vault
Vault
External Secrets Operator

Diferenciais
Experiência prática em mais de um provedor de cloud.
Vivência em ambientes multi-cloud ou hybrid cloud.
Experiência com arquiteturas multi-região e Disaster Recovery.
Conhecimento de AWS EKS, RDS/Aurora e multi-account.
Conhecimento de Azure AKS e Landing Zones.
Experiência com Service Mesh, como Istio, Linkerd ou Anthos Service Mesh.
Experiência com API Gateway e gerenciamento de APIs.
Conhecimento de Chaos Engineering.
Conhecimento de FinOps.
Experiência com Platform Engineering.

Mais vagas em São Paulo