Senior Data Engineer | Databricks & Azure
Distrito
Descrição da vaga
Buscamos um(a) Data Engineer Sênior com sólida experiência em engenharia de dados e pleno domínio da plataforma Databricks e do ecossistema Microsoft Azure, para atuar na construção, evolução e sustentação de plataformas modernas de dados em ambientes corporativos de alta complexidade.
Responsável por definição de arquiteturas, desenvolvimento de pipelines, integração de diferentes fontes, processamento de grandes volumes de dados e implementação de boas práticas de qualidade, governança, segurança, performance e observabilidade.
Principais responsabilidades:
Projetar, desenvolver e evoluir pipelines de dados escaláveis e de alta performance utilizando Databricks e serviços Azure.- Construir soluções de ingestão, transformação e disponibilização de dados em arquiteturas batch e streaming.
- Desenvolver e otimizar workloads utilizando Apache Spark, PySpark e Spark SQL / SQL.
Implementar arquiteturas Lakehouse, Delta Lake e Medallion Architecture — Bronze, Silver e Gold. - Trabalhar com Azure Data Lake Storage Gen2 (ADLS).
- Desenvolver integrações utilizando Azure Data Factory (ADF) e/ou Databricks.
- Implementar pipelines utilizando Databricks Workflows / Jobs, Auto Loader, Change Data Feed (CDF) e CDC.
- Trabalhar com Delta Live Tables / Lakeflow Declarative Pipelines.
- Implementar Data Quality, observabilidade, logging, tratamento de erros e monitoramento.
- Utilizar Unity Catalog para governança, segurança, catálogo, lineage e controle de acesso.
- Realizar otimização e tuning de workloads Spark, performance e custos.
- Trabalhar com CI/CD e Infrastructure as Code.
- Participar das definições de arquitetura e padrões técnicos da plataforma de dados.
- Atuar na resolução de problemas complexos e incidentes relacionados à plataforma.
- Apoiar e orientar profissionais menos experientes.
Requisitos:
- Databricks: Azure Databricks, Apache Spark, PySpark, Spark SQL / SQL, Delta Lake, Databricks SQL, Unity Catalog, Databricks Workflows / Jobs, Auto Loader, CDF, Delta Live Tables / Lakeflow Declarative Pipelines e Medallion Architecture.
- Microsoft Azure: ADLS Gen2, Azure Data Factory (ADF), Azure Key Vault, Microsoft Entra ID, Azure Monitor / Log Analytics, Azure Functions, Event Hubs, Azure DevOps e Azure SQL Database.
Engenharia de Dados: Python, PySpark, SQL avançado, ETL / ELT, processamento distribuído, Data Lake, Data Lakehouse, Batch, Streaming, modelagem de dados, APIs, CDC, Data Quality, Data Observability e Data Governance. - Performance e arquitetura: otimização e tuning de workloads Spark, clusters e compute, performance, escalabilidade e custos.
- DevOps: Git, Azure DevOps, CI/CD, Infrastructure as Code, Terraform, testes automatizados, versionamento de código e gestão de ambientes DEV / QA / HML / PROD.
- Governança e Segurança: Unity Catalog, controle de acesso, lineage, segurança, governança, observabilidade e compliance.
- Alta autonomia técnica, decisões arquiteturais, troubleshooting, code reviews, definição de padrões e boas práticas de engenharia de dados.
- Integração: experiência com Arquitetura, Cloud, Segurança, Governança, Analytics, Data Science e IA.
Diferenciais:
Databricks Certified Data Engineer Professional.
Certificações Microsoft Azure relacionadas a Data Engineering e Cloud.
Experiência com ambientes Databricks de grande escala.
Microsoft Fabric, Synapse Analytics e Purview.
Arquiteturas Event-Driven e Real-Time Streaming.
Kafka / Event Hubs.
Terraform e automação de infraestrutura.
Ambientes de Machine Learning e Generative AI integrados ao Databricks.
MLflow.
Ambientes corporativos com requisitos elevados de segurança, governança e compliance.
