Pessoa Engenheira de Dados Sênior
Caju
Detalhes da vaga
- Cargo
- Pessoa Engenheira de Dados Sênior
- Vagas
- 1
- Modelo
- Remoto
- Publicada
- 13/08/2026
- Candidaturas até
- 21/08/2026
Descrição da vaga
A Caju é uma empresa brasileira de tecnologia, que busca dar mais sabor à vida profissional, transformando a relação entre empresas e colaboradores por meio de soluções mais inovadoras e seguras como o Cartão Multi Benefícios, Solução em Despesas Corporativas, Premiações e Caju Ciclos.Aqui na Caju, aprendemos sempre, e nos tornamos cada vez melhores em um ambiente colaborativo e divertido!São muito bem-vindas candidaturas de pessoas negras/pretas, mulheres, indígenas, LGBTQIA+, ou outros grupos minorizados.Inscreva-se e conheça mais sobre nosso time 🧡Responsabilidades e atribuições
Integração, Ingestão e Orquestração Multi-Source: Projetar e manter pipelines de integração heterogênea utilizando ferramentas como Apache Airflow, Dagster, Airbyte, AWS DMS, DBT, Kubernetes, APIs REST, SFTP e conectores diversos para ingestão contínua.Otimização de Performance, I/O e Custo (AWS & Databricks): Aplicar técnicas avançadas de particionamento, indexação (Z-Ordering/Liquid Clustering), otimização de layout de arquivos e estratégias de escrita/leitura no Amazon S3, Databricks e dbt, visando eliminar varreduras excessivas (full table scans), diminuir custos de requisições S3 (GET/LIST) e acelerar o consumo de consultas.Arquitetura Event-Driven & Streaming: Projetar e implementar ingestão de dados em tempo real por tópicos e eventos (ex: Apache Kafka, AWS Kinesis, Event Hubs), eliminando a dependência direta de consultas e cargas massivas em bancos relacionais (PostgreSQL, MySQL).Automação de Engenharia com IA: Implementar ferramentas, agentes e pipelines de GenAI/LLMs para automatizar tarefas operacionais da engenharia (ex: geração automática de documentação, pipelines, data quality checks, tradução/refatoração de SQL, análise de causa raiz de falhas, PRs).Pipelines End-to-End e Modelagem: Projetar, construir e manter pipelines robustos, aplicando modelagem dimensional e arquitetura Medallion para entregar dados limpos, agregados e otimizados tanto no processo de ingestão quanto no de consumo.Governança, Segurança e Qualidade: Garantir compliance (LGPD/GDPR), mascaramento de dados sensíveis, lineage, controle de acesso granular e monitoramento proativo de data freshness e data quality.Alinhamento e Documentação: Realizar levantamento de necessidades junto às áreas de negócio, documentar arquiteturas, definir data contracts e assegurar a governança e manutenibilidade dos pipelines.
Requisitos e qualificaçõesTempo de Experiência: Experiência sólida em engenharia de dados, atuando em ambientes de produção de grande volume e alta criticidade.Otimização de I/O, Particionamento e Performance: Domínio prático de estratégias de particionamento, otimização de layouts de dados (Small File Problem, compactação, Z-Ordering) e otimização de consultas para prevenir leituras excessivas no Amazon S3 e garantir baixo tempo de resposta no Databricks e dbt.Orquestração e Ingestão Heterogênea: Experiência prática na integração e orquestração de dados utilizando Airflow, Dagster, Airbyte, AWS DMS, dbt, Kubernetes, APIs REST, SFTP e conectores customizados.Event-Driven & Ingestão por Tópicos: Vivência prática na arquitetura de ingestão baseada em eventos/tópicos (Kafka, Kinesis, Pulsar, RabbitMQ) para substituir a dependência de bancos relacionais.Stack Principal: Domínio avançado de Python, PySpark e SQL otimizado para processamento massivo e distribuído.Plataforma Databricks & Lakehouse: Experiência profunda no ecossistema Databricks (Delta Lake, Auto Loader, Structured Streaming, Jobs/Workflows, Medallion Architecture).Nuvem AWS: Vivência em serviços AWS voltados a dados (S3, IAM, Redshift, DynamoDB, Data Catalog, AWS DMS).Automação com IA: Conhecimento prático ou forte interesse em utilizar ferramentas/LLMs para automação de tarefas de desenvolvimento e engenharia de dados.Engenharia de Software: Vivência com testes automatizados, controle de versão (Git/GitHub), revisão de PRs e pipelines de CI/CD.Modelagem e Governança: Domínio em modelagem de dados (Dimensional, Star/Snowflake) e diretrizes de segurança e privacidade (LGPD/GDPR).Diferenciais:IA/GenAI para Dados: Experiência com pipelines para suporte a IA (ingestão, chunking e embeddings para Vector Search, Feature Stores, governança via Unity Catalog).Governança Avançada & IaC: Experiência com Unity Catalog, Terraform e Databricks Asset Bundles (DAB).Data Contracts & Data Quality: Implementação de contratos de dados na origem e uso de frameworks de qualidade/observabilidade (Great Expectations, Soda, dbt tests, Datadog).FinOps e Observabilidade: Gestão proativa e alertas de anomalias de custos em nuvem/Databricks por tabela e pipeline, alinhada à detecção estatística de data drift.Pipelines Financeiros: Vivência em idempotência, conciliação de saldos e reprocessamento financeiro.Setores Regulados: Experiência prévia em ambientes fintech, meios de pagamento ou saúde, lidando com compliance e auditorias de dados.Informações adicionais💳 Cartão Caju, com mais liberdade para usar seus benefícios (Refeição, Alimentação, Mobilidade, Saúde, Home Office, Cultura e Educação);🏥 Plano de Saúde sem coparticipação (Unimed, Sulamerica ou Alice);🧘🏿♀️ Zenklub, com consultas onlines com terapeutas e coaches para cuidar da sua saúde mental;🏋🏿♀️ Wellhub;🗣️ Aqui também estimulamos o aprendizado de idiomas, com a parceria da Rosetta Stone;💆🏽 Dia de recarregar - day off; 🧑🏿⚕️ Conexa Saúde - consulta médica online;👶🏿 Auxílio Creche;📚 Parceria com Alura;👨🏿💻 Trabalho Remoto, para você trabalhar de onde quiser dentro do Brasil;💻 Oferecemos equipamento de trabalho;🚀 Muitas possibilidades de crescimento - temos muito a crescer e esperamos fortemente que você nos ajude com isso!A Caju é uma empresa brasileira e aceita pessoas de todas as regiões do país.Trabalhamos em um modelo 100% remoto(quem tiver interesse de conhecer ou trabalhar no escritório, localizado em São Paulo, estaremos de portas abertas) Se interessou? #VemSerCaju 🧡
Fonte: gupy