Senior Site Reliability Engineer

🕒 2 dias atrás

🇦🇷 Argentina – Remoto

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

👻 Score fantasma 10%

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Teladoc Health

Teladoc Health

5001 - 10000 funcionários

🏥 Saúde

👥 B2C

☁️ SaaS

💰 $80.000.000 Post-IPO Debt - Teladoc Health em 2016-07

Healthcare • B2C • SaaS

A Teladoc Health é uma empresa de telessaúde que conecta pacientes a prestadores de cuidados por meio de uma plataforma de atendimento virtual que oferece atendimento urgente 24/7, atendimento primário, saúde mental (terapia e psiquiatria), gestão de condições crônicas (diabetes, hipertensão, gerenciamento de peso), consultas especializadas e serviços de bem-estar. Ela atende indivíduos diretamente e faz parcerias com empregadores, planos de saúde, hospitais e sistemas de saúde para fornecer soluções de cuidados virtuais integradas e tecnologia em larga escala.

Descrição

• Define, implement, and improve SLIs, SLOs, and error budgets for critical applications and platform services • Partner with application teams to improve reliability, fault tolerance, scalability, and operational readiness • Identify and eliminate recurring reliability issues through root cause analysis, automation, and architectural improvements • Design resilient systems for Azure region, zone, network, dependency, and deployment failures • Participate in production readiness reviews for services, releases, and infrastructure changes • Build observability across applications, infrastructure, networks, and cloud services • Implement monitoring for latency, traffic, errors, and saturation • Develop dashboards, alerts, logs, traces, and metrics using observability and APM platforms • Create service health dashboards for engineering, operations, and leadership • Analyze performance, bottlenecks, saturation trends, and capacity risks • Improve backup, disaster recovery, failover, and business continuity practices • Implement resiliency patterns including retries, circuit breakers, bulkheads, graceful degradation, and queue-based decoupling • Support and improve production workloads running on Microsoft Azure • Collaborate on secure, scalable Azure architecture • Enforce Azure operational standards for tagging, monitoring, backup, recovery, identity, security, and cost awareness • Conduct blameless post-incident reviews and document root causes, contributing factors, corrective actions, and prevention plans • Improve incident response processes and runbooks with Incident Management, NOC, Help Desk, and application teams • Support cloud security and compliance controls for identity, access, encryption, secrets management, vulnerability remediation, logging, and auditability • Partner with software engineering, product, security, and operations leadership • Mentor the SRE team and serve as technical authority for observability and reliability across mission-critical healthcare workloads

🎯 Requisitos

• 7+ years in site reliability, including hands-on ownership of mission-critical services, through a combination of applicable work experience, training, military experience, or education • Deep Microsoft Azure experience, including Azure Monitor, Application Insights, AKS, and cloud-native operations across hybrid infrastructure • Proven experience designing and rolling out an SLO program with SLIs, SLOs, and error budget policy in production environments • Hands-on experience with enterprise observability platforms such as Datadog, Dynatrace, Elastic, Grafana, Prometheus, or LogicMonitor • Hands-on experience implementing and configuring Datadog for monitoring, observability, and alerting • Identity and credential verification, live or video interviews, and fraud or misrepresentation screening • Preferred: experience establishing or anchoring an SRE practice across multiple engineering teams • Preferred: strong incident command experience and blameless postmortems • Preferred: healthcare IT experience and familiarity with HIPAA, HITRUST, or equivalent compliance frameworks • Preferred: multi-cloud reliability experience with AWS in addition to Azure • Preferred: chaos engineering and resiliency testing experience • Preferred: Infrastructure as Code expertise with Terraform, Bicep, or Ansible • Preferred: scripting and programming proficiency in Python, PowerShell, or Go • Preferred: experience with security controls, vulnerability management, compliance audits, and cloud governance • Preferred: recognized industry certifications such as Azure Solutions Architect, Google SRE certificate, or CKA

🏖️ Benefícios

• Inclusive benefits program centered around employees and their families • Tailored programs addressing employees' unique needs • Meaningful career growth, leadership, and development opportunities • Inclusive workplace and innovative culture • Candidate resources and recruiter support

Candidatar-se

Vagas Similares

🕒 3 dias atrás

Wizeline

1001 - 5000

💼 Consultoria

🏥 Saúde

📣 Marketing

Site Reliability Engineer securing multi-cloud infrastructure and automating cloud-risk remediation. Wizeline develops AI-powered digital products and platforms for global clients.

🇦🇷 Argentina – Remoto

💰 $43.000.000 Series B em 2018-03

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 4 dias atrás

Commit

501 - 1000

🔒 Cibersegurança

Senior DevOps Engineer modernizing AWS infrastructure and migrating the company’s codebase to GitHub Actions. Strengthening production support, infrastructure automation, observability, security, and cost optimization.

🇦🇷 Argentina – Remoto

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 25

Helpware

1001 - 5000

📦 Logística

📣 Marketing

💼 Consultoria

Engenheiro(a) DevOps Sênior responsável pela infraestrutura de Azure, AKS, Terraform e CI/CD. Atuará apoiando operações seguras em cloud, observabilidade, alta disponibilidade e migrações entre Azure e Google Cloud.

🇦🇷 Argentina – Remoto

💰 Seed Round em 2016-01

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 19

Helpware

1001 - 5000

📦 Logística

📣 Marketing

💼 Consultoria

Engenheiro(a) Sênior DevSecOps protegendo infraestrutura em nuvem, plataformas Kubernetes e pipelines de CI/CD. Automatiza guardrails de segurança e controles da cadeia de suprimentos de software na Argentina, Brasil e México.

🇦🇷 Argentina – Remoto

💰 Seed Round em 2016-01

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 13

Azumo

51 - 200

💼 Consultoria

🏥 Saúde

📦 Logística

Engenheiro(a) DevSecOps protegendo a infraestrutura financeira impulsionada por AI da Azumo na América Latina. Endurecimento de sistemas em nuvem, gerenciamento de vulnerabilidades e proteção de agentes de AI, além de suporte à conformidade e diligência de segurança para clientes.

🇦🇷 Argentina – Remoto

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório