Desenvolvedor(a) Sênior de ML & Dados

SND

📍 Barueri/SPhibrido

Descrição da vaga

Estamos montando do zero o time de IA da SND, com duas posições sênior complementares: uma focada em construir as aplicações e agentes, e esta, focada na inteligência e nos dados que sustentam essas aplicações. Você vai trabalhar tanto com modelos preditivos clássicos quanto com a camada de dados que alimenta os sistemas de LLM e vai ser a referência do time para dizer se o que o sistema responde está certo.

 

O que você vai fazer

Explorar dados, formular hipóteses e transformar problema de negócio em problema de modelagem, inclusive dizendo quando ML não é a resposta.
Treinar, avaliar e colocar em produção modelos preditivos (classificação, regressão, ranking, séries temporais, detecção de anomalia), conforme o caso de uso.
Construir e manter os pipelines de dados que sustentam produto e modelos: ingestão, tratamento, feature engineering, versionamento.
Definir métricas de sucesso offline e online, e desenhar experimentos (testes A/B, análise de impacto) para validar o que foi entregue.
Ser dono(a) da qualidade da base de conhecimento que alimenta os sistemas de RAG: definir o que entra e o que fica de fora, como o conteúdo é limpo e estruturado, com que frequência é reindexado e o que acontece quando um documento fica desatualizado.
Definir e validar a estratégia de embeddings, escolha do modelo, tamanho e critério de chunking, uso de metadados comparando alternativas com teste medido, não por preferência.
Medir a qualidade da recuperação com métricas de busca (recall@k, precisão, MRR) e apontar objetivamente se o problema de uma resposta ruim está no dado recuperado ou no prompt.
Construir e versionar os datasets de avaliação usados pelo time: casos reais, casos de borda e casos que já quebraram em produção. É essa base que responde se uma mudança melhorou ou piorou o sistema.
Fazer essa ponte junto com o time de aplicações de IA, com a divisão clara: eles são donos do código que roda em produção, você é dono(a) da resposta para "isso está certo?".
Monitorar modelos em produção, drift, degradação, viés e agir antes que o negócio perceba.
Comunicar resultado para gente não técnica de forma que sustente uma decisão.

Requisitos

6+ anos de experiência com dados/ML, com modelos efetivamente em produção (não apenas notebooks e estudos).
Python avançado e o ecossistema de dados: pandas, numpy, scikit-learn, e ao menos um framework de deep learning (PyTorch ou TensorFlow).
SQL forte de verdade, janelas, CTEs, otimização de query.
Prática em engenharia de dados: orquestração (Airflow, Dagster, Prefect ou similar), modelagem de dados, trabalho com volume.
Rigor estatístico: entender validação, vazamento de dados, desbalanceamento, significância e por que cada um desses derruba um modelo.
Boas práticas de engenharia: Git, testes, code review, Docker. O código precisa sobreviver depois que você sair de férias.


Diferenciais

MLOps: MLflow, DVC, feature store, CI/CD de modelos.
Experiência com NLP e modelos de linguagem (embeddings, fine-tuning, avaliação de saída de LLM).
Expor modelos e consultas de dados como ferramentas para agentes (MCP, APIs de inferência) ou automatizar ingestão via n8n, MuleSoft ou iPaaS equivalente.
Cloud (Azure ML, SageMaker, Vertex AI).
Spark ou processamento distribuído.

Mais vagas em Barueri

Todas as vagas em Barueri/SP →Vagas em São Paulo →