Desenvolvedor(a) Sênior de ML & Dados
SND
Descrição da vaga
Estamos montando do zero o time de IA da SND, com duas posições sênior complementares: uma focada em construir as aplicações e agentes, e esta, focada na inteligência e nos dados que sustentam essas aplicações. Você vai trabalhar tanto com modelos preditivos clássicos quanto com a camada de dados que alimenta os sistemas de LLM e vai ser a referência do time para dizer se o que o sistema responde está certo.
O que você vai fazer
Explorar dados, formular hipóteses e transformar problema de negócio em problema de modelagem, inclusive dizendo quando ML não é a resposta.
Treinar, avaliar e colocar em produção modelos preditivos (classificação, regressão, ranking, séries temporais, detecção de anomalia), conforme o caso de uso.
Construir e manter os pipelines de dados que sustentam produto e modelos: ingestão, tratamento, feature engineering, versionamento.
Definir métricas de sucesso offline e online, e desenhar experimentos (testes A/B, análise de impacto) para validar o que foi entregue.
Ser dono(a) da qualidade da base de conhecimento que alimenta os sistemas de RAG: definir o que entra e o que fica de fora, como o conteúdo é limpo e estruturado, com que frequência é reindexado e o que acontece quando um documento fica desatualizado.
Definir e validar a estratégia de embeddings, escolha do modelo, tamanho e critério de chunking, uso de metadados comparando alternativas com teste medido, não por preferência.
Medir a qualidade da recuperação com métricas de busca (recall@k, precisão, MRR) e apontar objetivamente se o problema de uma resposta ruim está no dado recuperado ou no prompt.
Construir e versionar os datasets de avaliação usados pelo time: casos reais, casos de borda e casos que já quebraram em produção. É essa base que responde se uma mudança melhorou ou piorou o sistema.
Fazer essa ponte junto com o time de aplicações de IA, com a divisão clara: eles são donos do código que roda em produção, você é dono(a) da resposta para "isso está certo?".
Monitorar modelos em produção, drift, degradação, viés e agir antes que o negócio perceba.
Comunicar resultado para gente não técnica de forma que sustente uma decisão.
Requisitos
6+ anos de experiência com dados/ML, com modelos efetivamente em produção (não apenas notebooks e estudos).
Python avançado e o ecossistema de dados: pandas, numpy, scikit-learn, e ao menos um framework de deep learning (PyTorch ou TensorFlow).
SQL forte de verdade, janelas, CTEs, otimização de query.
Prática em engenharia de dados: orquestração (Airflow, Dagster, Prefect ou similar), modelagem de dados, trabalho com volume.
Rigor estatístico: entender validação, vazamento de dados, desbalanceamento, significância e por que cada um desses derruba um modelo.
Boas práticas de engenharia: Git, testes, code review, Docker. O código precisa sobreviver depois que você sair de férias.
Diferenciais
MLOps: MLflow, DVC, feature store, CI/CD de modelos.
Experiência com NLP e modelos de linguagem (embeddings, fine-tuning, avaliação de saída de LLM).
Expor modelos e consultas de dados como ferramentas para agentes (MCP, APIs de inferência) ou automatizar ingestão via n8n, MuleSoft ou iPaaS equivalente.
Cloud (Azure ML, SageMaker, Vertex AI).
Spark ou processamento distribuído.
