Staff DevOps Engineer

🕒 Agosto 27

🏄 California – Remoto

infoinfo

⏰ Tempo Integral

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

👻 Score fantasma 37%

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Nexxa.ai

Nexxa.ai

11 - 50 funcionários

Fundada em 2024

🏗️ Construção

🏭 Manufatura

📦 Logística

Construction • Manufacturing • Logistics

Nexxa. ai é uma empresa de IA industrial que desenvolve automação inteligente para operações industriais. Sua plataforma aprende com engenheiros e colaboradores para assumir fluxos de trabalho complexos e repetitivos, definindo autonomamente metas e critérios de execução para aumentar a produtividade e a resiliência. Entregue como uma solução integrada que funciona com stacks tecnológicos existentes, a Nexxa. ai se posiciona como uma ferramenta empresarial semelhante a SaaS que gera retorno imediato sobre o investimento para as equipes de operações.

Descrição

• Own and evolve core infrastructure across compute, networking, storage, and deployment systems • Design and operate CI/CD pipelines for AI, data, and product engineering teams • Build and maintain infrastructure-as-code for reproducible, auditable cloud and on-prem/edge environments • Architect and manage Kubernetes platforms for training, inference, and application workloads, including GPU scheduling and autoscaling • Support data warehouses, lakehouse architectures, feature stores, embedding indices, retrieval pipelines, and model training, evaluation, and serving infrastructure • Define and drive observability practices across distributed systems, including metrics, logging, tracing, and alerting • Establish reliability practices including SLOs/SLIs, incident response, postmortems, and on-call rotations • Design security and compliance for cloud infrastructure, secrets management, access control, and industrial or legacy-environment integrations • Make tradeoffs across cost, latency, reliability, and developer velocity • Collaborate with engineering leadership on infrastructure roadmap and platform strategy • Mentor engineers and raise operational excellence across the organization • Own ambiguous, high-stakes infrastructure problems end-to-end and design systems for future scale

🎯 Requisitos

• 6+ years of experience in DevOps, Site Reliability Engineering, Platform Engineering, or infrastructure-focused software engineering roles • Deep hands-on experience with AWS, GCP, or Azure at production scale • Kubernetes production experience, including GPU workload scheduling • Infrastructure-as-code tooling such as Terraform, Pulumi, or equivalent • CI/CD systems such as GitHub Actions, GitLab CI, CircleCI, Jenkins, or ArgoCD • Experience designing and operating observability stacks such as Prometheus, Grafana, Datadog, or OpenTelemetry • Experience supporting ML/AI infrastructure is a strong plus • Excellent scripting/programming skills in Python, Go, or Bash • Proven ability to independently scope and lead infrastructure projects from design through production rollout • Strong incident management instincts and ability to lead outage response and root-cause analysis • Preferred: experience bridging cloud and edge/on-prem environments, especially industrial or manufacturing contexts • Preferred: familiarity with Snowflake, BigQuery, Redshift, or Databricks • Preferred: service mesh, zero-trust networking, or industrial compliance frameworks such as SOC 2 or IEC 62443 • Preferred: building internal developer platforms or self-service infrastructure tooling • Preferred: scaling infrastructure teams or setting technical direction at Staff level

🏖️ Benefícios

• Comprehensive salary and equity package • Significant opportunities for career development and advancement • Innovative environment focused on transforming heavy industries through AI and automation • Collaborative culture valuing innovation, discipline, and continuous improvement

Candidatar-se

Vagas Similares

🕒 Agosto 26

Ninety

51 - 200

☁️ SaaS

🤝 B2B

⚡ Produtividade

SRE Delivery Manager leading SRE and Delivery teams for Ninety’s EOS business-management software. Improving AWS infrastructure, deployments, observability, security, and incident response.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $200.000 - $220.000 / ano

💰 $35.000.000 Series B - Ninety em 2023-11

⏰ Tempo Integral

🟠 Sênior

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 24

PingWind Inc. (SDVOSB)

51 - 200

💼 Consultoria

📦 Logística

🏥 Saúde

DevSecOps Engineer building and deploying secure cloud-based IAM systems for federal government clients. Maintaining highly available architectures, automated delivery, compliance, and infrastructure upgrades.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $93.000 - $128.000 / ano

⏰ Tempo Integral

🟠 Sênior

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 21

Reveleer

51 - 200

🏥 Saúde

⚕️ Seguro de Saúde

☁️ SaaS

Director of DevOps scaling cloud infrastructure, CI/CD, and reliability for Reveleer’s healthcare data platform. Leading DevOps teams and improving delivery performance, security, and cloud cost efficiency.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 21

DecisionPoint Corporation

51 - 200

🎖️ Defesa

💼 Consultoria

📦 Logística

DevSecOps Engineer automating secure CI/CD, containers, and IaC in AWS GovCloud. Supporting DecisionPoint’s DoD case management solutions and RMF authorization.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $110.000 - $115.000 / ano

⏰ Tempo Integral

🟠 Sênior

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🦅 Patrocina Visto H1B

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 20

Ford Motor Company

10.000+ funcionários

📦 Logística

💼 Consultoria

📣 Marketing

Director leading Ford Motor Company’s cloud SRE and observability strategy across GCP, data centers, manufacturing, and enterprise platforms. Building vendor-agnostic tooling and federating reliability practices.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $141.700 - $268.300 / ano

💰 Post-IPO Debt em 2023-08

⏰ Tempo Integral

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🦅 Patrocina Visto H1B

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório