Site Reliability Engineer (SRE)

Empresa: Mazzatech

Localização: Remoto

Modalidade: Remoto

Nível: Sênior

Contrato: CLT ou PJ

Skills obrigatórias: python, terraform, aws-auto-scaling, amazon-web-services, microsoft-azure, google-cloud-platform, docker, kubernetes, kafka

Sobre a vaga

Será responsável por garantir a confiabilidade e eficiência operacional dos ambientes através de automação, observabilidade e boas práticas de engenharia.

Automação e Eficiência Operacional

Automatizar processos operacionais, deploys e provisionamento.

Desenvolver scripts e ferramentas internas (Python, Bash, etc.).

Implementar e evoluir pipelines CI/CD.

Reduzir atividades manuais e operacionais repetitivas.

Infraestrutura Cloud e IaC

Provisionar e manter ambientes em nuvem.

Trabalhar com Infrastructure as Code (Terraform, CloudFormation).

Garantir escalabilidade e alta disponibilidade.

Implementar estratégias de auto-scaling e self-healing.

Confiabilidade e Performance

Monitorar sistemas através de métricas, logs e traces.

Definir e acompanhar SLIs, SLOs e SLAs.

Executar capacity planning.

Realizar troubleshooting e otimização de performance.

Gestão de Incidentes

Atuar em incidentes críticos de produção.

Conduzir análises de causa raiz (RCA).

Desenvolver planos de melhoria contínua.

Observabilidade

Implementar ferramentas de monitoramento e alertas.

Criar dashboards operacionais.

Aumentar a visibilidade end-to-end dos sistemas.

Engenharia de Plataforma

Trabalhar em conjunto com times de desenvolvimento.

Apoiar práticas DevOps e SRE.

Melhorar arquitetura, deploys e resiliência das aplicações.

Continuidade de Negócios

Disaster Recovery.

Testes de carga e stress.

Chaos Engineering.

Estratégias de resiliência operacional.

Governança e Boas Práticas

Definir padrões operacionais.

Documentar processos e arquiteturas.

Aplicar práticas de segurança e DevSecOps.

**Requisitos:**

Inglês avançado/fluente.

Bacharelado em Ciência da Computação, Engenharia ou áreas correlatas.

Sólida experiência em Site Reliability Engineering (SRE)

DevOps

Infraestrutura

Cloud Engineering

Experiência prática com AWS, Azure ou GCP

Terraform (preferencial)

Docker

Kubernetes

CI/CD

Python ou Bash

Linux/Unix

Monitoramento e observabilidade

Gestão de incidentes

**Diferencial:**

Experiência em ambientes de grande escala.

Vivência em consultorias.

Experiência com Chaos Engineering.

Experiência com arquiteturas altamente distribuídas.

Forte background em observabilidade.

Conhecimento avançado em Kafka.

Experiência em plataformas financeiras ou ambientes críticos.

**Tempo:** indeterminado

**Local:** hibrida ou remota

Criar conta grátis no TrailWise para ver seu Match Score