Engenheiro Sênior de Confiabilidade de Site (Contratação Global)

Vaga não está no LinkedIn

🕒 Julho 27

🇧🇷 Brasil – Remoto

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

👻 Score fantasma 25%

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Cognativ Inc

Cognativ Inc

51 - 200 funcionários

Fundada em 2016

🤝 B2B

💼 Consultoria

🤖 Inteligência Artificial

B2B • Consulting • Artificial Intelligence

Cognativ é uma agência de desenvolvimento de aplicativos com sede em Melbourne, Austrália. Eles combinam design de experiência do usuário, estratégia de produto e engenharia de software para entregar aplicações móveis e web, sistemas de e-commerce e experiências digitais com marca. Suas especialidades incluem design UX e UI, desenvolvimento de sites e aplicativos (iOS, Android, React Native, React. js, node. js, Python), otimização de conversão e tecnologias emergentes como IA/aprendizado de máquina e AR/VR; posicionam-se como parceiros de serviços de TI e consultoria focados em qualidade.

Descrição

• Ser responsável pelos objetivos de serviço. Definir SLIs e SLOs para os serviços que importam, gerenciar error budgets e usá-los para orientar decisões de priorização e taxa de mudança. Transformar confiabilidade em um número mensurável, não em uma sensação. • Tornar a observabilidade confiável. Ser responsável pela qualidade de alertas de ponta a ponta: alta relação sinal/ruído, alarmes que capturem de forma confiável os incidentes que devem capturar, e disciplina para desativar um alarme enganoso até que seja corrigido adequadamente. Construir dashboards e as métricas personalizadas, exporters e instrumentação (CloudWatch, OpenTelemetry) necessárias para enxergar claramente o sistema. • Liderar a resposta a incidentes. Conduzir incidentes com calma, reduzir o tempo médio para recuperação (MTTR) e produzir postmortems sem culpabilização com itens de ação que realmente sejam fechados. Melhorar e ser responsável pela rotação de on-call e sua saúde. • Planejar capacidade e desempenho. Prever e dimensionar adequadamente compute (especialmente GPU), throughput e particionamento do Kafka/MSK, carga do RDS/TimescaleDB e Redis. Detectar saturação antes que os clientes percebam. • Ser responsável por continuidade de negócios e recuperação de desastres. Backups, replicação, failover e recuperação para RDS, MSK, Redis e a frota de edge. Definir RPO/RTO e comprová-los com game days regulares e testados, não por suposições. • Manter a frota de edge saudável. Diagnóstico remoto e recuperação via AWS IoT, atualização automática de containers via systemd timers, e migração contínua do CentOS 7 para a stack de mídia em containers (Ubuntu 22.04). • Eliminar toil por meio da engenharia. Escrever software real (Python, Golang, Bash) para automatizar trabalho operacional, autocurar falhas comuns e tornar a confiabilidade repetível em vez de algo heroico. • Governar mudanças na produção com segurança. Impor gestão de mudanças colaborativa e revisada; proteger o sistema contra alterações arriscadas e unilaterais (topologia, contagem de instâncias, escalonamento e configuração).

🎯 Requisitos

• Certificação AWS é obrigatória. Preferência forte por AWS Certified DevOps Engineer – Professional ou AWS Certified Solutions Architect – Professional válidas. • 10+ anos em Site Reliability Engineering ou operações de produção em larga escala. Não esperamos domínio de todas as áreas no primeiro dia. Esperamos profundidade real em várias e capacidade de aprendizado rápido nas demais. • Prática demonstrada de SLO/error-budget. Você definiu SLIs e SLOs, trabalhou com error budgets e os usou para tomar decisões reais. • Fortes habilidades em observabilidade de produção. Proficiência em métricas, logs, alarmes e dashboards (CloudWatch, OpenTelemetry e/ou Prometheus/Grafana/Datadog), e capaz de construir a instrumentação quando ela não existir. • Experiência comprovada em comando de incidentes. Você já liderou incidentes, gerenciou uma rotação de on-call e escreveu postmortems que mudaram o comportamento de um sistema. • Experiência em planejamento de capacidade e performance em compute, bancos de dados e sistema de mensageria/streaming (Kafka/MSK ideal). • Responsabilidade por recuperação de desastres: backups, replicação, failover e RPO/RTO testados. • Habilidade em engenharia de software para automação. Confortável escrevendo Python, Golang e Bash para construir ferramentas de confiabilidade, não apenas configurar ferramentas prontas. • Especialista em Terraform (ou IaC equivalente) e forte administração Linux (shell e utilitários GNU), confortável do cloud ao bare-metal/edge. • Experiência em operações de banco de dados com PostgreSQL (time-series é um diferencial). • Mentalidade de confiabilidade: você instrumenta antes de chutar e escreve o runbook. • Diferenciais: • Operação de workloads em GPU e servir modelos de visão computacional ou ML em produção (CUDA, Deep Learning AMIs, escalonamento de inferência). • Operações com Apache MSK / Kafka e streaming-data (Kinesis, Kinesis Video Streams). • AWS IoT Core em escala: provisionamento de dispositivos, certificados, tunelamento seguro. • Gerenciamento de frota de dispositivos edge/on-premise (golden images, atualização remota, systemd). • Operação e modernização de sistemas legados (Java 8, Jetty, CentOS). • Engenharia de caos / prática de game-days, e modelagem de capacidade. • Familiaridade com Bazel em um monorepo; Cloudflare, Cognito/Auth0, API Gateway.

🏖️ Benefícios

• Nenhum benefício informado.

Candidatar-se

Vagas Similares

🕒 Julho 23

Sezzle

201 - 500

💳 Fintech

👥 B2C

🛍️ Comércio Eletrônico

Engenheiro Sênior de Site Reliability na Sezzle gerenciando soluções de infraestrutura escaláveis. Revolucionando experiências de compra com automação baseada em IA e tecnologia moderna.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 21

Sólides

501 - 1000

💼 Consultoria

🏥 Saúde

📣 Marketing

SRE Sênior garantindo disponibilidade e confiabilidade dos sistemas da Sólides, empresa brasileira de tecnologia para gestão integrada de pessoas. Desenvolvendo observabilidade, automação, monitoramento e resposta a incidentes.

🗣️🇧🇷🇵🇹 Português obrigatório

🕒 Julho 21

Sólides

501 - 1000

☁️ SaaS

🤖 Inteligência Artificial

🤝 B2B

SRE Sênior garantindo a observabilidade, a automação e a confiabilidade dos sistemas da Sólides. Atuando com monitoramento, logs, APM, cloud, Kubernetes e resposta a incidentes.

🗣️🇧🇷🇵🇹 Português obrigatório

🕒 Julho 20

Truelogic Software

501 - 1000

☁️ SaaS

🤝 B2B

🏢 Corporativo

Engenheiro(a) DevOps Semi-sênior responsável pelo design e manutenção de infraestrutura AWS para empresa de software. Colabora com equipes para aprimorar eficiência e confiabilidade da plataforma.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 13

Lumini IT Solutions

51 - 200

💼 Consultoria

🏥 Saúde

📦 Logística

Analista de Infraestrutura Cloud | DevOps na Lumini IT, projetando e otimizando infraestrutura de TI com foco em alta disponibilidade e segurança.

🗣️🇧🇷🇵🇹 Português obrigatório