Senior Staff Platform, Data Reliability Engineer

🕒 Agosto 12

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $180.000 - $270.000 / ano

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

👻 Score fantasma 3%

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

Cloud

Unity

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Shield AI

Shield AI

501 - 1000 funcionários

Fundada em 2015

🤖 Inteligência Artificial

🚀 Aeroespacial

🎖️ Defesa

Artificial Intelligence • Aerospace • Defense

A Shield AI é uma das principais desenvolvedoras de soluções militares impulsionadas por IA, focada em aprimorar a autonomia das missões e a consciência situacional no campo de batalha. Sua plataforma, Hivemind, permite a rápida implantação de sistemas inteligentes para diversas aplicações de defesa, incluindo operação de drones e vigilância. Com um compromisso em utilizar tecnologia avançada, a Shield AI visa proteger membros do serviço e civis, revolucionando tecnologias de defesa por meio de sistemas autônomos.

Descrição

• Own operational excellence for the Databricks platform, including monitoring, alerting, observability, incident response support, and production runbook patterns • Define and maintain CI/CD and promotion standards for Databricks assets and environments from development to production • Design and maintain standards for job orchestration, cluster and compute policies, service principal usage, environment isolation, and reliable production execution • Establish reusable operational templates and enablement patterns for onboarding new domains to Databricks • Partner with the Senior Data Engineer on observable, recoverable, cost-aware, and secure ingestion and medallion patterns • Align Databricks configuration and usage with enterprise cloud standards across commercial and future government-hosted environments • Enforce technical controls for data segregation, access boundaries, and operational compliance • Track and improve platform health metrics, including job success rates, incident trends, pipeline reliability, cost efficiency, and environment drift • Document platform standards, operational expectations, and support models • Mentor internal engineers developing platform responsibilities • Own the Databricks operational layer covering reliability, observability, deployment standards, compute and job policies, and platform enablement

🎯 Requisitos

• 12+ years of relevant experience in data platform engineering, platform operations, site reliability engineering, or modern cloud data infrastructure • Hands-on production experience with Databricks or a closely related cloud data platform • Experience designing or operating CI/CD, environment promotion, version control, and deployment automation for data platforms and pipelines • Strong understanding of observability, monitoring, alerting, incident management, and reliability engineering • Experience with compute policy design, workload isolation, service principals, and secure production execution patterns on cloud data platforms • Ability to work in regulated or security-sensitive environments with access control, auditability, and operational discipline • Collaboration with cloud/infrastructure, security, data engineering, and analytics stakeholders • Preferred: Databricks certification and/or expertise with Delta Lake, Unity Catalog, Workflows, and Databricks Asset Bundles • Preferred: Infrastructure-as-code and platform automation experience • Preferred: Experience supporting commercial and government or segregated environments • Preferred: Experience in defense, aerospace, federal, or another regulated industry

🏖️ Benefícios

• Bonus • Benefits for full-time regular employees • Equity • Temporary benefits package applicable after 60 days of employment for temporary employees • Benefits eligibility excluded for military fellows and part-time employees • Equal employment opportunity and disability or special-needs accommodation

Candidatar-se

Vagas Similares

🕒 Agosto 12

MeridianLink

501 - 1000

💳 Fintech

🏦 Bancário

☁️ SaaS

Senior Site Reliability Engineer operating MeridianLink’s serverless AWS platform. Managing production reliability, databases, backups, monitoring, incident response, and infrastructure automation.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $104.148 - $140.000 / ano

💰 $485.000.000 Post-IPO Debt em 2021-11

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🦅 Patrocina Visto H1B

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 11

VetsEZ

201 - 500

🏥 Saúde

💼 Consultoria

📦 Logística

Senior Backend DevOps Engineer operating AWS containerized microservices for the VA’s JLV clinical data viewer. Building CI/CD, observability, security, and disaster recovery capabilities.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 11

Group 1001

501 - 1000

💼 Consultoria

🏥 Saúde

💸 Finanças

Senior Network Reliability Engineer automating insurance company network platforms at Group 1001. Applying SRE, cloud, Kubernetes, security, and observability practices to improve reliability and reduce operational toil.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 11

Hexion Inc.

1001 - 5000

🚘 Automotivo

🏗️ Construção

🏭 Manufatura

Reliability Engineer improving asset performance across Hexion’s North American manufacturing plants. Leading failure elimination, maintenance optimization, and cross-site reliability standardization.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 11

Vontier

5001 - 10000

🚘 Automotivo

⚡ Energia

🔧 Hardware

Hardware Reliability Engineer leading reliability planning, validation, and failure analysis for Gilbarco Veeder-Root fueling equipment. Improving durability, serviceability, and field performance across complex electromechanical products.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

Ray