-Projetar, desenvolver e manter pipelines de dados para:
-Ingestão de dados de múltiplas fontes.
-Processamento e transformação de dados em larga escala.
-Integração entre sistemas corporativos e plataformas analíticas.
-Disponibilização de dados para consumo por áreas de negócio e tecnologia.
-Desenvolvimento em Databricks e PySpark
-Atuar na construção e manutenção de soluções utilizando: Databricks,Python,PySpark,SQL.
-Garantir performance, qualidade e escalabilidade dos processos de dados.
-Realizar consultas, integrações e manipulação de dados em ambientes relacionais e não relacionais, incluindo: SQL, MongoDB.
-Participar da modelagem, tratamento e disponibilização das informações para diferentes consumidores de dados.
-Monitorar pipelines e processos de dados.
-Identificar e corrigir falhas operacionais.
-Implementar melhorias de performance.
-Apoiar a evolução da arquitetura e dos processos de engenharia de dados.
Requisitos Técnicos:
- Experiência sólida como Engenheiro(a) de Dados, Engenheiro(a) de Dados Sênior ou papel equivalente.
- Forte conhecimento em Python para engenharia de dados, automação, análise de dados e apoio a soluções de IA.
- Sólido conhecimento em SQL e exploração de dados estruturados.
- Sólido conhecimento em MongoDB.
- Experiência com Databricks, PySpark e Spark.
- Experiência na construção, otimização e sustentação de pipelines de dados escaláveis.
- Experiência em ambientes cloud, preferencialmente Azure Databricks.
- Experiência com processamento de dados em tempo quase real, preferencialmente com Kafka.
- Experiência com produtização de modelos de Machine Learning no Databricks e práticas de MLOps.
- Experiência com esteiras de CI/CD, especialmente GitHub e GitHub Actions.
- Domínio de boas práticas de engenharia de dados, versionamento, testes, revisão de código e qualidade de dados.