Senior DevOps Engineer

🕒 Fevereiro 2

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Shuru

Shuru

51 - 200 funcionários

Fundada em 2021

🤖 Inteligência Artificial

🤝 B2B

🏢 Corporativo

Artificial Intelligence • B2B • Enterprise

A Shuru é uma empresa de consultoria em produtos, IA e tecnologia que faz parceria com empresas para oferecer consultoria estratégica, desenvolvimento de produtos e softwares personalizados ponta a ponta, além de extensão de equipes de engenharia sob medida. Suas equipes de engenharia nativas em IA constroem aplicações de IA escaláveis, engenharia de dados e análises, cloud/DevOps e integrações de API para modernizar sistemas e acelerar a entrega de produtos. A Shuru opera globalmente com um modelo remoto-primeiro e enfatiza alta responsabilidade, design thinking e resultados mensuráveis para clientes empresariais e startups.

Descrição

• Kubernetes platform engineering (EKS-first) ● Design, build, and operate production-grade Kubernetes clusters (multi-nodegroup, autoscaling, upgrades, cluster add-ons). • Implement intelligent autoscaling using real metrics (queue depth, consumer lag, service latency) via tools like KEDA/Karpenter. • Own AWS environments end-to-end (VPC, IAM, EKS/ECS/EC2, ALB/ELB, S3, Route53, CloudWatch, RDS, SQS, Lambda). • Build reproducible infrastructure using Terraform, with strong review + change management practices. • Implement backup/DR patterns (e.g., snapshots, retention, automation) and safe rollouts. • Design infrastructure for data-intensive workloads: high-throughput ingestion, batch processing, and real-time streaming. • Understand and operate distributed systems at scale — consensus, partitioning, replication, and failure modes. • Build and maintain infrastructure for data pipelines, vector databases. • Design for horizontal scalability, ensuring systems handle growing data volumes and user traffic gracefully. • Build/own monitoring + logging from scratch and make it actionable (Prometheus/Grafana, ELK/EFK, alerting). • Define/partner on SLI/SLOs and incident response practices; improve reliability with data-driven changes. • Establish performance testing and production-like load testing environments. • Continuously reduce AWS spend via right-sizing, Spot strategies, reserved capacity planning, and architecture improvements. • Partner with engineering teams to diagnose bottlenecks (db queries, caching, queueing) and propose scalable solutions. • Optimize infrastructure costs for data-heavy workloads (storage tiering, compute scheduling, GPU utilization). • Improve cloud and cluster security posture (IAM, network policies, secrets management, least privilege). • Support SOC2 readiness/execution (controls, evidence automation, operational hardening). • Implement access management patterns.

🎯 Requisitos

• 7+ years in DevOps / SRE / Cloud Infra roles operating production systems. • Deep hands-on experience with Kubernetes in production. • Strong AWS fundamentals across compute/networking/storage/identity, including VPC, IAM, EC2/EKS, ALB, S3, Route53, CloudWatch, RDS, SQS. • Proven ability to build infra using Terraform (and strong IaC practices). • Production-grade observability experience: Prometheus + Grafana, and centralized logging (ELK/EFK or similar). • Experience scaling product infrastructure — you've grown systems from thousands to millions of requests, and understand capacity planning, bottleneck identification, and scaling patterns. • Solid understanding of distributed systems concepts: CAP theorem, consistency models, partitioning strategies, distributed consensus, and failure handling. • Strong understanding of databases and performance fundamentals. • CI/CD experience building reliable pipelines (Jenkins/Spinnaker/GitHub Actions equivalents), with safe deployment strategies. • Scripting/automation ability in Python and/or Bash (Go is a plus).

🏖️ Benefícios

• Competitive salary and benefits package. • Opportunity to work with a team of experienced product and tech leaders. • A flexible work environment with remote working options. • Continuous learning and development opportunities. • Chance to make a significant impact on diverse and innovative projects.

Candidatar-se

Vagas Similares

🕒 Janeiro 27

Sardine

51 - 200

🔒 Cibersegurança

📋 Conformidade

💳 Fintech

DevOps Engineer at Sardine evolving infrastructure and platform tooling for fraud prevention. Collaborating cross-functionally to enhance reliability, scalability, and cost efficiency.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $160.000 - $200.000 / ano

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Dezembro 25, 2025

Chainlink Labs

201 - 500

💸 Finanças

💳 Fintech

🌐 Web 3

Senior Site Reliability Engineer at Chainlink focusing on observability and reliability in decentralized finance solutions. Supporting engineering teams and enhancing self-service capabilities for development.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Dezembro 16, 2025

Cyera

201 - 500

🏥 Saúde

💼 Consultoria

📦 Logística

DevOps Engineer at Cyera designing and optimizing data security infrastructure. Collaborating with cross-functional teams to ensure secure, scalable, and automated environments.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Dezembro 15, 2025

Stand Together

5001 - 10000

🏥 Saúde

💼 Consultoria

⚖️ Jurídico

Senior DevSecOps Engineer at Stand Together designing and securing cloud infrastructure solutions for a philanthropic organization. Collaborating with teams to enhance security in software delivery pipelines.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Dezembro 5, 2025

VELAIO

51 - 200

💼 Consultoria

DevOps Engineer designing and managing Azure cloud solutions in a dynamic environment. Collaborating with development teams and automating software delivery pipelines using Azure DevOps tools.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇪🇸 Espanhol obrigatório