Engenheiro (a) de Dados Sênior (Data Architecture)
Craf Tech
Descrição da vaga
A Craf Tech é uma empresa de tecnologia especializada em conectar talentos a grandes desafios, impulsionando transformação e inovação por meio de pessoas.
Acreditamos que ambientes diversos e colaborativos geram melhores ideias, relações mais saudáveis e resultados mais consistentes. Por isso, valorizamos diferentes trajetórias, experiências e perspectivas, promovendo um espaço respeitoso, inclusivo e acolhedor para todas as pessoas.
Mais do que desenvolver soluções em tecnologia, buscamos criar oportunidades para crescimento, troca de conhecimento e impacto real por meio da inovação.
Se você procura um ambiente para evoluir, contribuir e construir o futuro junto com a gente, queremos conhecer você 💙
Se você se identifica com este desafio, confira as principais responsabilidades da vaga:
Engenharia de dados (execução)
- Projetar, construir e manter pipelines de ingestão e transformação orquestrados em Apache Airflow, com padrões consistentes de retry, idempotência, alerta e SLA.
- Desenvolver e evoluir modelos de transformação em dbt sobre o data warehouse, organizando as camadas (staging → intermediate → marts) com testes e documentação.
- Implementar ingestões de fontes heterogêneas: bancos transacionais, APIs de terceiros (custodiantes, distribuidores, provedores de mercado), arquivos regulatórios e planilhas operacionais.
- Instrumentar observabilidade dos dados: freshness, volumetria, quebras de contrato, reconciliação entre origem e destino.
Arquitetura e modelagem
- Definir e defender o modelo de dados do warehouse (dimensional, Data Vault ou híbrido — com justificativa), incluindo chaves, granularidade, historização (SCD) e tratamento de correções retroativas.
- Estabelecer padrões de distribuição, ordenação e particionamento no MPP (DISTKEY, SORTKEY, compressão em Redshift; equivalentes em outras engines) e garantir que sejam seguidos.
- Fazer o desenho de camadas e contratos de dados entre times: o que é fonte da verdade, quem pode escrever onde, o que é exposto para BI e o que é interno.
- Conduzir tuning de performance e custo: análise de planos, filas/WLM, concorrência, manutenção (VACUUM/ANALYZE ou equivalente), rewrite de queries e materializações.
- Avaliar e recomendar tecnologias (formatos de tabela, lakehouse, streaming, catálogo, ferramentas de qualidade) com análise de trade-off explícita, incluindo custo e custo de saída.
Governança, qualidade e regulatório
- Implementar controles de qualidade automatizados e reconciliações que sustentem números usados em relatórios a clientes e em respostas a reguladores.
- Garantir linhagem e rastreabilidade ponta a ponta: de um número no painel até a origem e a versão do código que o produziu.
- Aplicar controles de acesso, segregação por sensibilidade e conformidade com LGPD e com as normas aplicáveis ao setor (CVM, BACEN, BSM, políticas internas de compliance).
- Documentar decisões arquiteturais (ADRs) e manter o dicionário de dados vivo.
- Ensino superior completo
- SQL avançado de verdade: window functions, CTEs recursivas, leitura de plano de execução, diagnóstico de skew e de spill em disco.
- Python para engenharia de dados: código modular, testável e versionado (não apenas notebooks).
- Familiaridade com pandas/polars, tipagem e testes automatizados.
- Apache Airflow em produção: autoria de DAGs, sensores, backfill, gestão de dependências e de falhas.
- Data warehouse MPP em nuvem — Redshift preferencialmente; Snowflake, BigQuery ou Databricks são aceitos com disposição para se aprofundar em Redshift.
dbt ou ferramenta equivalente de transformação versionada, com testes. - Modelagem dimensional (Kimball) com domínio real: fato vs. dimensão, granularidade, SCD tipos 1/2, tabelas ponte, snapshots.
- Git e cultura de code review; CI/CD aplicado a dados.
- Modelagem e diagnóstico de performance: você sabe explicar por que uma query está lenta e provar a correção com números antes e depois.
- Experiência no mercado financeiro (diferencial)
