Staff Software Engineer | Observability

PWS Cloud

📍 São Paulo/SPhibrido· CLT

Descrição da vaga

Estamos em busca de um(a) Staff Software Engineer – Observability para integrar o time de Engenharia da PWS Cloud e atuar na construção e evolução das capacidades de observabilidade da nossa plataforma de nuvem.Buscamos uma pessoa com sólida experiência em Engenharia de Software, sistemas distribuídos e observabilidade, que combine profundidade técnica, atuação hands-on e visão sistêmica para resolver desafios complexos envolvendo aplicações e infraestrutura.Como Staff, você terá um papel importante na evolução da observabilidade da plataforma, influenciando decisões técnicas e ajudando a estabelecer padrões para métricas, logs, traces, alertas e monitoramento. A atuação terá impacto entre diferentes times, contribuindo para ampliar a visibilidade sobre o comportamento dos sistemas e tornar a identificação de problemas mais rápida e eficiente.Mais do que implementar ferramentas, esperamos alguém capaz de transformar necessidades operacionais em soluções reutilizáveis e sustentáveis, avaliando trade-offs entre cobertura, performance, custo e complexidade.A posição também terá um papel importante em elevar a maturidade de observabilidade e confiabilidade da engenharia, contribuindo para que os times operem seus serviços com cada vez mais autonomia e segurança.Responsabilidades e atribuiçõesProjetar e evoluir a arquitetura de Observabilidade da plataforma, contemplando métricas, logs, traces e alertas;Definir e disseminar padrões de instrumentação utilizando OpenTelemetry, promovendo consistência entre aplicações e serviços;Desenvolver ferramentas, integrações e automações que simplifiquem a adoção de observabilidade pelos times de engenharia;Evoluir e operar soluções baseadas em Prometheus, Grafana, Loki ou tecnologias relacionadas;Definir estratégias de SLIs, SLOs e alertas, garantindo sinais relevantes para operação e experiência dos produtos;Apoiar os times na instrumentação, troubleshooting e análise de performance de aplicações e sistemas distribuídos;Atuar como referência técnica, liderando decisões arquiteturais e iniciativas de maior complexidade relacionadas à observabilidade;Desenvolver serviços e componentes de plataforma utilizando principalmente Go, quando necessário;Trabalhar em conjunto com Engenharia, SRE, Infraestrutura, Segurança e Produto na evolução da confiabilidade da plataforma;Identificar oportunidades de automação, redução de ruído operacional e melhoria contínua da experiência dos times.Requisitos e qualificaçõesSólida experiência com Observabilidade e monitoramento de sistemas distribuídos;Experiência com OpenTelemetry e instrumentação de aplicações utilizando métricas, logs e distributed tracing;Experiência com tecnologias como Prometheus, Grafana, Loki ou soluções equivalentes;Conhecimento de conceitos de SLI, SLO, error budget, alerting e incident response;Experiência com Kubernetes e observabilidade de workloads e aplicações executadas em ambientes cloud native;Experiência em desenvolvimento de software utilizando Go, Python ou linguagens equivalentes, com capacidade de construir ferramentas, integrações e automações;Conhecimento de APIs, sistemas distribuídos e arquiteturas orientadas a eventos;Experiência com troubleshooting, análise de performance e investigação de problemas em ambientes distribuídos;Familiaridade com CI/CD, Infrastructure as Code e práticas modernas de Engenharia de Software;Experiência atuando como referência técnica e contribuindo para decisões arquiteturais e evolução de outros engenheiros.Informações adicionaisSerá considerado um diferencial:Experiência na construção de plataformas de observabilidade para múltiplos times e produtos;Conhecimento de arquiteturas de alta escala para armazenamento e processamento de métricas, logs e traces;Experiência com Grafana Mimir, Tempo, Loki, Prometheus ou tecnologias equivalentes;Experiência com eBPF e ferramentas de observabilidade de infraestrutura e redes;Conhecimento de FinOps aplicado à observabilidade, incluindo controle de cardinalidade, retenção e custos de telemetria;Experiência com plataformas Cloud, SaaS ou ambientes multi-tenant;Experiência com CloudStack, OpenStack, Ceph ou tecnologias equivalentes.

Mais vagas em São Paulo

Todas as vagas em São Paulo/SP →Vagas em São Paulo →