Engenheiro Sênior de Confiabilidade de Site (Contratação Global)

Vaga não está no LinkedIn

🔥 54 minutos atrás

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Cognativ

Cognativ

11 - 50 funcionários

Fundada em 2018

💼 Consultoria

🥽 AR/VR

🤖 Inteligência Artificial

Consulting • AR/VR • Artificial Intelligence

Cognativ é uma agência de desenvolvimento de aplicativos com sede em Melbourne, Austrália. Eles combinam design de experiência do usuário, estratégia de produto e engenharia de software para entregar aplicações móveis e web, sistemas de e-commerce e experiências digitais com marca. Suas especialidades incluem design UX e UI, desenvolvimento de sites e aplicativos (iOS, Android, React Native, React. js, node. js, Python), otimização de conversão e tecnologias emergentes como IA/aprendizado de máquina e AR/VR; posicionam-se como parceiros de serviços de TI e consultoria focados em qualidade.

Descrição

• Ser responsável pelos objetivos de serviço. Definir SLIs e SLOs para os serviços que importam, gerenciar error budgets e usá-los para orientar decisões de priorização e taxa de mudança. Transformar confiabilidade em um número mensurável, não em uma sensação. • Tornar a observabilidade confiável. Ser responsável pela qualidade de alertas de ponta a ponta: alta relação sinal/ruído, alarmes que capturem de forma confiável os incidentes que devem capturar, e disciplina para desativar um alarme enganoso até que seja corrigido adequadamente. Construir dashboards e as métricas personalizadas, exporters e instrumentação (CloudWatch, OpenTelemetry) necessárias para enxergar claramente o sistema. • Liderar a resposta a incidentes. Conduzir incidentes com calma, reduzir o tempo médio para recuperação (MTTR) e produzir postmortems sem culpabilização com itens de ação que realmente sejam fechados. Melhorar e ser responsável pela rotação de on-call e sua saúde. • Planejar capacidade e desempenho. Prever e dimensionar adequadamente compute (especialmente GPU), throughput e particionamento do Kafka/MSK, carga do RDS/TimescaleDB e Redis. Detectar saturação antes que os clientes percebam. • Ser responsável por continuidade de negócios e recuperação de desastres. Backups, replicação, failover e recuperação para RDS, MSK, Redis e a frota de edge. Definir RPO/RTO e comprová-los com game days regulares e testados, não por suposições. • Manter a frota de edge saudável. Diagnóstico remoto e recuperação via AWS IoT, atualização automática de containers via systemd timers, e migração contínua do CentOS 7 para a stack de mídia em containers (Ubuntu 22.04). • Eliminar toil por meio da engenharia. Escrever software real (Python, Golang, Bash) para automatizar trabalho operacional, autocurar falhas comuns e tornar a confiabilidade repetível em vez de algo heroico. • Governar mudanças na produção com segurança. Impor gestão de mudanças colaborativa e revisada; proteger o sistema contra alterações arriscadas e unilaterais (topologia, contagem de instâncias, escalonamento e configuração).

🎯 Requisitos

• Certificação AWS é obrigatória. Preferência forte por AWS Certified DevOps Engineer – Professional ou AWS Certified Solutions Architect – Professional válidas. • 10+ anos em Site Reliability Engineering ou operações de produção em larga escala. Não esperamos domínio de todas as áreas no primeiro dia. Esperamos profundidade real em várias e capacidade de aprendizado rápido nas demais. • Prática demonstrada de SLO/error-budget. Você definiu SLIs e SLOs, trabalhou com error budgets e os usou para tomar decisões reais. • Fortes habilidades em observabilidade de produção. Proficiência em métricas, logs, alarmes e dashboards (CloudWatch, OpenTelemetry e/ou Prometheus/Grafana/Datadog), e capaz de construir a instrumentação quando ela não existir. • Experiência comprovada em comando de incidentes. Você já liderou incidentes, gerenciou uma rotação de on-call e escreveu postmortems que mudaram o comportamento de um sistema. • Experiência em planejamento de capacidade e performance em compute, bancos de dados e sistema de mensageria/streaming (Kafka/MSK ideal). • Responsabilidade por recuperação de desastres: backups, replicação, failover e RPO/RTO testados. • Habilidade em engenharia de software para automação. Confortável escrevendo Python, Golang e Bash para construir ferramentas de confiabilidade, não apenas configurar ferramentas prontas. • Especialista em Terraform (ou IaC equivalente) e forte administração Linux (shell e utilitários GNU), confortável do cloud ao bare-metal/edge. • Experiência em operações de banco de dados com PostgreSQL (time-series é um diferencial). • Mentalidade de confiabilidade: você instrumenta antes de chutar e escreve o runbook. • Diferenciais: • Operação de workloads em GPU e servir modelos de visão computacional ou ML em produção (CUDA, Deep Learning AMIs, escalonamento de inferência). • Operações com Apache MSK / Kafka e streaming-data (Kinesis, Kinesis Video Streams). • AWS IoT Core em escala: provisionamento de dispositivos, certificados, tunelamento seguro. • Gerenciamento de frota de dispositivos edge/on-premise (golden images, atualização remota, systemd). • Operação e modernização de sistemas legados (Java 8, Jetty, CentOS). • Engenharia de caos / prática de game-days, e modelagem de capacidade. • Familiaridade com Bazel em um monorepo; Cloudflare, Cognito/Auth0, API Gateway.

🏖️ Benefícios

• Nenhum benefício informado.

Candidatar-se

Vagas Similares

🔥 1 hora atrás

CI&T

5001 - 10000

💼 Consultoria

🏥 Saúde

📣 Marketing

Engenheiro(a) DevOps para soluções de deploy de IA no Brasil, responsável por CI/CD e gestão AWS. Colaboração com equipes para otimizar infraestrutura e práticas de segurança.

🗣️🇧🇷🇵🇹 Português obrigatório

🔥 1 hora atrás

iFood

5001 - 10000

🍽️ Alimentos e Bebidas

📦 Logística

📣 Marketing

Especialista SRE/DevOps na iFood gerenciando incidentes críticos e desenvolvendo soluções internas com Go e Python. Colaboração com times de engenharia em ambientes AWS e Kubernetes.

🗣️🇧🇷🇵🇹 Português obrigatório

🕒 2 dias atrás

Runtalent

501 - 1000

💼 Consultoria

🏥 Saúde

📦 Logística

Engenheiro de Plataforma em Nuvem projetando e mantendo infraestruturas em Azure para projetos inovadores. Colaborando com equipes para garantir desempenho ideal e suporte aos ambientes em nuvem.

🗣️🇧🇷🇵🇹 Português obrigatório

🕒 2 dias atrás

Applaudo

501 - 1000

💼 Consultoria

📣 Marketing

📦 Logística

Engenheiro Sênior de Site Reliability projetando, automatizando e operando plataformas em nuvem Azure. Garantindo ambientes confiáveis, escaláveis e seguros enquanto orienta outros engenheiros.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 2 dias atrás

Applaudo

501 - 1000

💼 Consultoria

📣 Marketing

📦 Logística

Engenheiro(a) Azure DevOps na Applaudo com foco em infraestrutura de nuvem e práticas de automação. Colabora em soluções Azure, promovendo melhorias contínuas nos processos de implantação e na segurança.

🗣️🇺🇸🇬🇧 Inglês obrigatório