Lead Site Reliability Engineer

🕒 Julho 7

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $114.000 - $165.300 / ano

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🦅 Patrocina Visto H1B

info

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Empower

Empower

10.000+ funcionários

💸 Finanças

💳 Fintech

👥 B2C

Finance • Fintech • B2C

A Empower é uma fornecedora líder de serviços financeiros focada em ajudar indivíduos e organizações a alcançar a liberdade financeira através do planejamento de aposentadoria e da gestão de investimentos. Atendendo a mais de 19 milhões de americanos, a Empower oferece um conjunto abrangente de serviços relacionados a finanças, incluindo planejamento inteligente e aconselhamento de investimento, além de ferramentas como o Empower Personal Dashboard™ para uma visão financeira completa. A empresa é renomada como uma das principais provedoras de planos de aposentadoria e trabalha de perto com investidores pessoais, poupadores de planos no local de trabalho, patrocinadores de planos e profissionais financeiros. A Empower também é reconhecida por suas iniciativas em Diversidade, Equidade, Inclusão e tem um compromisso social que fortalece o impacto na comunidade.

Descrição

• Lead cross-functional reliability initiatives across multiple value streams and coordinate execution across teams. • Define and evolve SRE best practices, tools, and methodologies across the organization. • Architect enterprise-scale, multi-region AWS infrastructure that balances reliability, cost, performance, and security. • Establish and operate SLOs, SLIs, and error budgets for critical services, using them to drive prioritization decisions. • Serve as incident commander for major incidents and drive postmortems that produce completed action items and organizational learning. • Lead disaster recovery planning for critical financial services infrastructure. • Build shared Infrastructure as Code foundations in Terraform (reusable modules, standards, and patterns adopted across teams). • Design and implement production-scale Kubernetes patterns, including multi-tenancy, security policies, and advanced scheduling. • Establish observability standards and strategies using Datadog and Splunk (metrics, logging, tracing, dashboards, and alerting). • Set CI/CD standards and patterns, including pipeline-as-code and progressive delivery at scale. • Lead chaos engineering, game days, and systematic reliability testing initiatives. • Drive FinOps initiatives to optimize cloud spend while maintaining reliability targets. • Lead a functional team of SREs (without direct reports) on projects and operational initiatives. • Mentor SREs at multiple levels through coaching, design reviews, code reviews, and training sessions. • Partner with Engineering, Product, and Security leadership to align reliability work with business priorities, zero-trust architecture, and compliance controls.

🎯 Requisitos

• Bachelor’s degree in Computer Science, Information Technology, or related field (or equivalent practical experience) • 7 to 10 years of Site Reliability Engineering experience (or equivalent), with demonstrated technical leadership • Proven ability to lead technical teams and drive complex projects to completion • Expert AWS knowledge, including designing large-scale, multi-region architectures • Deep Kubernetes expertise, including advanced features, security, and production-scale operations • Mastery of Infrastructure as Code using Terraform, including building shared platforms and frameworks • Strong software engineering background with production experience in Python and/or Go • Extensive experience with observability platforms (Datadog, Splunk) and implementing monitoring at scale • Deep understanding of CI/CD principles and experience implementing enterprise-grade pipelines • Proven track record leading major incidents and conducting effective postmortems • Strong understanding of security, networking, and infrastructure design patterns • Strong communication skills with ability to explain complex technical concepts to diverse audiences • Experience mentoring engineers and building technical capabilities in teams.

🏖️ Benefícios

• Medical, dental, vision and life insurance • Retirement savings – 401(k) plan with generous company matching contributions (up to 6%), financial advisory services, potential company discretionary contribution, and a broad investment lineup • Tuition reimbursement up to $5,250/year • Business-casual environment that includes the option to wear jeans • Generous paid time off upon hire – including a paid time off program plus ten paid company holidays and three floating holidays each calendar year • Paid volunteer time — 16 hours per calendar year • Leave of absence programs – including paid parental leave, paid short- and long-term disability, and Family and Medical Leave (FMLA) • Business Resource Groups (BRGs) – BRGs facilitate inclusion and collaboration across our business internally and throughout the communities where we live, work and play. BRGs are open to all.

Candidatar-se

Vagas Similares

🕒 Julho 6

Infarsight

51 - 200

🤖 Inteligência Artificial

✈️ Turismo

📦 Logística

Senior DevOps & Cloud Infrastructure Engineer optimizing AWS environments for automation and product innovation. Leading deployment strategies and resource management across AWS, Vercel, and RackSpace.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 6

Waymark

11 - 50

📣 Marketing

🤖 Inteligência Artificial

Senior DevOps Engineer maintaining and improving AWS infrastructure at Waymark for Medicaid healthcare technology. Collaborating on system reliability and mentoring junior engineers.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $109.000 - $194.000 / ano

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 6

Vytalize Health

201 - 500

🏥 Saúde

☁️ SaaS

⚕️ Seguro de Saúde

DevSecOps Engineer responsible for implementing secure development and cloud security practices. Leading vulnerability management and integrating security within engineering and IT workflows.

🇺🇸 Estados Unidos – Remoto (EUA)

💰 $100.000.000 Series C - Vytalize Health em 2023-02

⏰ Tempo Integral

🟠 Sênior

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🦅 Patrocina Visto H1B

info

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 5

NVIDIA

10.000+ funcionários

🏥 Saúde

🏭 Manufatura

🤖 Inteligência Artificial

Senior Software Engineer at NVIDIA focusing on NVLink systems stability and reliability. Collaborating with multiple teams on innovative AI infrastructure solutions.

🗣️🇺🇸🇬🇧 Inglês obrigatório

Distributed Systems

Python

Shell Scripting

Switching

TCP/IP

🕒 Julho 5

Prominent Edge

11 - 50

💼 Consultoria

🎖️ Defesa

📦 Logística

Lead DevOps engineer working at Prominent Edge on scalable solutions using AWS technologies. Engage in diverse projects, automate deployments, and enjoy a supportive work environment.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório