Staff Site Reliability Engineer

🕒 5 dias atrás

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $199.750 - $270.000 / ano

⏰ Tempo Integral

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

👻 Score fantasma 20%

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Horizon3.ai

Horizon3.ai

51 - 200 funcionários

Fundada em 2019

🔒 Cibersegurança

🤖 Inteligência Artificial

☁️ SaaS

Cybersecurity • Artificial Intelligence • SaaS

A plataforma NodeZero™ capacita sua organização a continuamente encontrar, corrigir e verificar sua superfície de ataque explorável. Reduza seu risco de segurança ao encontrar autonomamente fraquezas em sua rede, sabendo como priorizá-las e corrigi-las, e verificando imediatamente se suas correções funcionam. O NodeZero oferece pentests autônomos seguros para produção e outras operações de avaliação chave que escalam através de seus maiores ambientes internos, externos, em nuvem e em nuvem híbrida. Sem necessidade de agentes, sem código para escrever e sem consultores para contratar. Somos uma fusão de ex-operadores cibernéticos das Operações Especiais dos EUA, engenheiros de startups e praticantes de cibersegurança anteriormente frustrados. Estamos comprometidos em ajudar a resolver nossos problemas comuns de segurança: ferramentas de segurança ineficazes, falsos positivos resultando em fadiga de alerta, pontos cegos, cultura de segurança "para cumprir tabela", escassez de habilidades em cibersegurança e o longo tempo e custo de contratar consultores externos.

Descrição

• Own and evolve the engineering-wide SRE strategy, operating model, and reliability standards • Align reliability standards with customer impact, business priorities, and risk • Lead cross-functional alignment across Infrastructure, product, service, security, and business stakeholders • Improve reliability, observability, incident response, and operational readiness across multiple teams • Establish organization-wide service ownership, meaningful SLIs and SLOs, and error budgets for critical customer paths and services • Define and drive adoption of observability standards across pipelines and platform components • Set standards for dashboards, actionable alerting, runbooks, and escalation paths • Drive complex cross-functional reliability initiatives end to end • Raise engineering standards for incident management, incident command, on-call health, post-incident learning, and recovery readiness • Shape the technical direction, operating model, and growth path of the SRE function • Participate in a 24/7 on-call rotation • Help design a sustainable, appropriately staffed, and continuously improved on-call model

🎯 Requisitos

• Experience designing, operating, and troubleshooting large-scale distributed systems in production environments • Deep knowledge of reliability engineering, observability, incident management, and production operations • Demonstrated ability to turn reliability knowledge into standards and practices adopted by others • Experience establishing SLIs, SLOs, actionable alerts, observability, and service ownership • Backend experience building systems and automation that reduce operational toil, strengthen safeguards, and improve operational efficiency • Experience leading high-severity incidents and improving incident response programs • Excellent written and verbal communication skills, including technical designs, runbooks, postmortems, and operational documentation • Experience with Python and Terraform, or equivalent automation and infrastructure-as-code tools • Experience with observability tools such as Datadog, New Relic, Grafana, or equivalent platforms • Experience operating production services in AWS and Kubernetes • Experience with CI/CD pipelines such as GitLab CI, ArgoCD, or GitOps workflows • Participation in a 24/7 on-call rotation • Legally authorized to work in the United States • Must answer whether employment visa sponsorship is required

🏖️ Benefícios

• Equity package in the form of stock options for all full-time roles • Health insurance for you and your family • Vision insurance for you and your family • Dental insurance for you and your family • Flexible vacation policy • Generous parental leave • Career development opportunities • Inclusive culture • Collaborative environment encouraging creativity and out-of-the-box thinking • Fully remote work model • Team off-sites and in-person project kick-offs

Candidatar-se

Vagas Similares

🕒 5 dias atrás

CACI International Inc

10.000+ funcionários

🎖️ Defesa

🏛️ Governo

🔒 Cibersegurança

Operating System Deployment Engineer managing secure Windows and Windows Server images for CACI’s DoD enterprise IT services. Automating deployments and supporting physical and virtual infrastructure across 187 bases.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $75.200 - $158.100 / ano

🔥 Investimento no último ano

💰 $500.000.000 Post-IPO Debt em 2026-02

⏰ Tempo Integral

🟠 Sênior

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 5 dias atrás

PingWind Inc. (SDVOSB)

51 - 200

💼 Consultoria

📦 Logística

🏥 Saúde

DevSecOps Engineer securing cloud-native software delivery for PingWind, a federal government services provider. Building CI/CD security, automating controls, and supporting vulnerability remediation.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 6 dias atrás

BAE Systems, Inc.

10.000+ funcionários

🎖️ Defesa

🚀 Aeroespacial

🔐 Segurança

Principal SRE deploying and monitoring automated cloud infrastructure for BAE Systems’ defense, aerospace, and security systems. Supporting large-scale distributed applications and continuous service delivery.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $118.095 - $200.762 / ano

⏰ Tempo Integral

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Setembro 24

BlackSky

201 - 500

📦 Logística

💼 Consultoria

🎖️ Defesa

Principal DevSecOps Architect securing BlackSky’s real-time satellite intelligence platform and ground segment. Driving cybersecurity architecture, compliance, and DevSecOps controls across cloud and on-premises systems.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $190.000 - $215.000 / ano

⏰ Tempo Integral

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Setembro 23

GitLab

1001 - 5000

💼 Consultoria

📣 Marketing

🤖 Inteligência Artificial

Principal SRE shaping GitLab Dedicated, GitLab’s managed single-tenant DevSecOps platform. Driving scalable architecture, reliability, automation, and cross-team technical leadership.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $223.200 - $380.400 / ano

💰 Secondary Market em 2020-11

⏰ Tempo Integral

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório