Estamos com uma posição estratégica em nosso time: SRE Pleno. Você vai atuar em um projeto estruturante de observabilidade, construindo em conjunto com a liderança técnica os processos e a maturidade de SRE do time, além de contribuir diretamente para a confiabilidade dos serviços que sustentam nossa operação em produção, hoje rodando em nuvem (AWS) e on-premises, atendendo múltiplos clientes em diversas regiões do mundo.
Buscamos alguém que atue de forma preventiva: que identifique riscos antes que se tornem incidentes, reduza a recorrência de problemas e transforme cada causa raiz em aprendizado para o time.
Responsabilidades:
- Prevenir incidentes em produção, identificando riscos operacionais, pontos de falha e alertas ruidosos antes que se tornem problemas.
- Participar da construção da plataforma de observabilidade (logs, métricas e tracing), contribuindo na definição de processos, SLIs, SLOs e error budgets.
- Conduzir análises de causa raiz e liderar postmortems, documentando aprendizados e acompanhando planos de ação até o fechamento.
- Resolver incidentes críticos, com troubleshooting em ambientes de produção na AWS e on-premises.
- Identificar oportunidades de FinOps e contribuir para a previsibilidade de custos em nuvem.
- Colaborar com o time de develop na melhoria contínua da confiabilidade e do desempenho das aplicações.
- Apoiar demandas de escalabilidade e criação de nova infraestrutura, com foco em automação.
- Contribuir para a evolução da maturidade de SRE do time (práticas, documentação e cultura de incidentes).
Requisitos
- Experiência sólida com troubleshooting em ambientes produtivos e sistemas distribuídos.
- Experiência com AWS em produção (EC2, redes, balanceamento de carga, IAM); vivência com ambientes on-premises é um diferencial.
- Conhecimento em Docker/Docker Compose (containers em produção).
- Vivência com ferramentas de observabilidade e monitoramento (ex: Grafana, Prometheus, Datadog, SigNoz ou similares) e OpenTelemetry (logs, métricas e tracing).
- Compreensão de práticas de SRE: SLI/SLO, error budgets, gestão e resolução de incidentes e postmortem.
- Conhecimentos sólidos em Linux, redes e protocolos (HTTP, TCP/IP, DNS).
- Boa comunicação, autonomia e resiliência para atuar em momentos críticos de incidentes, incluindo eventual interação direta com o cliente.
Diferenciais:
- Experiência com automação (Python, Bash, Terraform, Ansible ou similares).
- Familiaridade com práticas de DevOps: CI/CD e infraestrutura como código (IaC).