Senior Cloud Operations Reliability Engineer – SRE

Vaga não está no LinkedIn

🕒 Julho 20

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🦅 Patrocina Visto H1B

info

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of NextGen Healthcare

NextGen Healthcare

1001 - 5000 funcionários

Fundada em 1998

🏥 Saúde

💼 Consultoria

⚕️ Seguro de Saúde

💰 Venture Round em 2015-02

Healthcare • Consulting • Healthcare Insurance

A NextGen Healthcare é uma empresa que fornece soluções integradas de TI para a saúde em práticas ambulatoriais. Seus serviços incluem registros eletrônicos de saúde (EHR), gerenciamento de práticas, interoperabilidade, engajamento de pacientes e soluções de telessaúde. Eles visam aprimorar a experiência de pacientes e provedores por meio de tecnologias inovadoras, como fluxos de trabalho impulsionados por IA e soluções móveis. A NextGen Healthcare também oferece soluções personalizadas para várias especialidades e foca na melhoria dos resultados clínicos e financeiros para seus clientes. Eles apoiam práticas de todos os tamanhos, desde pequenos consultórios até grandes empresas, e enfatizam a importância da interoperabilidade e do intercâmbio de dados para melhorar a prestação de cuidados de saúde.

Descrição

• The Senior Cloud Operations Reliability Engineer is responsible for driving operational excellence and strengthening the reliability posture of cloud-based services and supported platforms. • This role owns critical reliability initiatives, establishes observability and service health practices, and leads incident response coordination to improve service availability, resiliency, and recovery. • Own service reliability and operational health—establish and maintain SLOs/SLIs, design monitoring and alerting strategies, and drive improvements that enhance service availability and performance across cloud platforms. • Lead incident response coordination and post-incident processes, including troubleshooting complex production issues, conducting root cause analysis, and driving remediation activities with accountability for timeline and resolution quality. • Design and implement reliability-focused automation, operational tooling, and runbooks to reduce manual toil, improve response consistency, and strengthen production readiness and resilience; apply Infrastructure as Code practices where appropriate to support recovery, reliability, and operational consistency. • Build observability solutions through comprehensive monitoring, logging, and alerting strategies; establish event correlation and escalation procedures to ensure rapid problem detection and response. • Conduct performance and capacity analysis, evaluate utilization trends, identify bottlenecks; provide recommendations for reliability-focused scaling, performance improvement, capacity planning, and operational readiness of cloud-based services. • Partner with development and engineering teams to evaluate deployment readiness, support deployment reliability improvements, and implement operational best practices that strengthen service reliability, rollback readiness, and production supportability. • Contribute to disaster recovery and business continuity planning, conduct operational readiness exercises, and ensure recovery procedures and documentation reflect current production state and evolving business requirements. • Mentor team members and establish reliability standards and practices within Cloud Operations and supported service areas; create and maintain operational documentation, standard operating procedures, and knowledge base materials. • Support operational adherence to cloud governance, compliance, and security initiatives; including access control, tagging, logging, and audit readiness, and reliability-related documentation. • Perform other duties that support the overall objective of the position.

🎯 Requisitos

• 10+ years of professional experience in Cloud Operations, Site Reliability Engineering, DevOps, Infrastructure Operations, or a related discipline with demonstrated ownership of production systems. • Extensive hands-on experience supporting production cloud environments using Google Cloud Platform (GCP), AWS, or equivalent cloud service providers. • Proven expertise in monitoring, observability platforms, alerting strategies, incident response, root cause analysis, and production support in distributed or cloud-native architectures. • Demonstrated experience with Infrastructure as Code (Terraform, Deployment Manager, CloudFormation, etc.) and version control best practices. • Strong background in incident management and post-incident review processes; experience driving corrective actions and establishing reliability improvements. • Experience with Kubernetes operations, containerization, and orchestration platforms. • Experience with application performance monitoring (APM) and distributed tracing. • Experience mentoring junior engineers or leading operational improvements initiatives.

🏖️ Benefícios

• Health insurance • 401(k) matching • Paid time off • Remote work options • Professional development opportunities

Candidatar-se

Vagas Similares

🕒 Julho 20

Wolters Kluwer

10.000+ funcionários

🏥 Saúde

⚖️ Jurídico

💼 Consultoria

Lead DevOps Engineer implementing CI/CD pipelines and cloud infrastructure at Wolters Kluwer. Mentoring a team and improving system reliability through continuous development practices.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 20

Akamai Technologies

5001 - 10000

🔒 Cibersegurança

Lead reliability workstreams for Akamai's serverless inference platform. Design SRE tooling and automation while mentoring other SREs in cross-team initiatives.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $146.400 - $263.600 / ano

💰 Post-IPO Equity em 2001-07

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🦅 Patrocina Visto H1B

info

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 19

KITC, LLC (8(a) SDB)

11 - 50

🔒 Cibersegurança

🏛️ Governo

💼 Consultoria

Cloud DevSecOps Engineer III responsible for AWS cloud infrastructure and security automation. Collaborating on federal cybersecurity initiatives in a fully remote role.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 18

Envision Healthcare

10.000+ funcionários

🏥 Saúde

👥 B2C

🤝 B2B

DevOps Engineer IV for Envision's Engineering team. Collaborating on implementing advanced CI/CD pipelines and infrastructure as code.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 18

DraftKings Inc.

1001 - 5000

📣 Marketing

💼 Consultoria

📦 Logística

Senior Lead Database Reliability Engineer ensuring database reliability and operational excellence for a sports betting platform. Leading technical roadmap and optimizing performance across various systems.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $168.000 - $210.000 / ano

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório