SRE Engineer - REMOTO
Verity
Descrição da vaga
A Verity está buscando novos talentos!
Somos uma consultoria de transformação e Engenharia digital e buscamos SRE Engineer para fazer parte dessa jornada.
Olha só quais são as experiências e conhecimentos que você precisa ter para acelerar e transformar com a gente:
Responsabilidades e atribuições
Definir e acompanhar SLIs, SLOs, SLAs, MTTR e MTTD.
Implementar observabilidade, monitoramento, alertas e APM.
Monitorar latência, tráfego, erros, saturação, disponibilidade e performance.
Atuar na prevenção, identificação e resolução de incidentes.
Conduzir análises de causa raiz e definir ações para evitar recorrências.
Identificar riscos, gargalos e pontos únicos de falha.
Apoiar o desenho de soluções resilientes, escaláveis e altamente disponíveis.
Automatizar atividades operacionais e reduzir tarefas manuais.
Operar e evoluir ambientes Kubernetes e Docker.
Apoiar estratégias de capacidade, continuidade e recuperação de desastres.
Participar de deploys e apoiar a estabilização das aplicações.
Trabalhar com os times para melhorar a confiabilidade desde a concepção das soluções.
Criar e manter dashboards, alertas, procedimentos e documentação operacional.
Promover uma cultura de confiabilidade, observabilidade e melhoria contínua.
Experiência como Site Reliability Engineer, SRE ou função equivalente.
Experiência prática com ambientes Cloud, utilizando GCP, AWS e/ou Azure.
Conhecimento em Kubernetes e Docker.
Experiência com observabilidade, monitoramento, alertas e APM.
Conhecimento em métricas e práticas de SRE, como SLI, SLO, SLA, MTTR e MTTD.
Experiência em gestão, investigação e resolução de incidentes.
Conhecimento em troubleshooting de aplicações e infraestrutura.
Experiência com administração de ambientes Linux.
Conhecimento em redes, segurança, performance e alta disponibilidade.
Experiência com automação e Infrastructure as Code.
Vivência com pipelines de CI/CD.
Boa comunicação e capacidade de atuar com times multidisciplinares.
Perfil analítico, proativo, colaborativo e orientado à prevenção de problemas.
Diferenciais:
Experiência com GKE, EKS ou AKS.
Conhecimento em Dynatrace, Datadog, Grafana, Prometheus ou ferramentas similares.
Experiência com ELK Stack, Elasticsearch e Kibana.
Conhecimento em Terraform e Ansible.
Experiência com ambientes críticos e sistemas distribuídos.
Vivência em instituições financeiras ou ambientes regulados.
Experiência com gestão de capacidade e otimização de custos Cloud.
Conhecimento em disaster recovery e continuidade de negócio.
Experiência na definição e gestão de error budgets.
Certificações em Cloud, Kubernetes ou SRE.
