Sobre a oportunidade
Buscamos Engenheiro(a) de Dados / Big Data para atuação especializada na manutenção, monitoramento e sustentação de um ambiente de Data Lake que já se encontra em produção, relacionado ao Projeto GFIS 2 – SEFAZ/MA.
- A atuação terá duração estimada de aproximadamente 30 horas, com foco na estabilidade do ambiente, acompanhamento dos pipelines existentes, identificação e correção de falhas e suporte técnico especializado.
- Principais atividades
- Sustentação do ambiente de Data Lake em produção;
- Monitoramento de pipelines de dados batch e streaming;
- Acompanhamento e análise das execuções de DAGs no Apache Airflow;
- Identificação e correção de falhas nas cargas;
- Análise de logs e troubleshooting;
- Manutenção e ajustes em DAGs existentes;
- Reprocessamento de cargas quando necessário;
- Atuação com scripts em Python/PySpark;
- Execução e otimização de jobs Spark/PySpark;
- Manipulação e acompanhamento de dados em HDFS;
- Atuação nas camadas Bronze, Silver e Gold;
- Monitoramento dos SLAs das cargas;
- Apoio na resolução de incidentes em ambiente produtivo;
- Ajustes voltados à estabilidade, performance e confiabilidade do Data Lake;
- Documentação das intervenções realizadas.
Buscamos um profissional experiente e com autonomia técnica, principalmente em sustentação de ambientes Data Lake/Big Data em produção, capaz de analisar rapidamente incidentes, identificar causas e executar as correções necessárias.
📌 Projeto: GFIS 2 – SEFAZ/MA
💻 Modalidade: 100% remoto
💼 Contratação: PJ / prestação de serviço por hora
💰 Valor: R$ 120,00/hora
⏱️ Estimativa inicial: aproximadamente 30 horas
- Cloudera – CDP / Hadoop Ecosystem
- Apache Airflow
- HDFS
- Spark / PySpark
- Python
- Pipelines de dados
- Ambientes Big Data
- Troubleshooting de pipelines e análise de logs
- Git / versionamento
- Experiência com Cloudera CDP / Hadoop Ecosystem;
- Conhecimento sólido em HDFS, Spark e PySpark;
- Experiência com Apache Airflow, incluindo monitoramento, manutenção e troubleshooting de DAGs;
- Python aplicado à engenharia e processamento de dados;
- Experiência na sustentação de Data Lake em ambiente produtivo;
- Conhecimento de arquitetura de dados em camadas Bronze, Silver e Gold;
- Experiência com pipelines batch e streaming;
- Conhecimento em Kafka;
- Integração de dados com Oracle, APIs e arquivos;
- Análise de logs, falhas de processamento e troubleshooting;
- Monitoramento de cargas, SLAs e observabilidade;
- Experiência com Git e CI/CD;
- Conhecimentos em otimização de performance de jobs e pipelines;
- Vivência em ambientes críticos de produção, com atuação em incidentes e reprocessamento de cargas.