Senior DevOps Engineer – AI Cloud

🕒 Agosto 12

🏄 California, Texas – Remoto

infoinfo

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

👻 Score fantasma 18%

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Bitdeer Group

Bitdeer Group

201 - 500 funcionários

💼 Consultoria

📦 Logística

🏗️ Construção

💰 Post-IPO Equity em 2023-05

Consulting • Logistics • Construction

A Bitdeer Technologies Group (Nasdaq: BTDR) é uma líder na indústria de blockchain e computação de alto desempenho. É uma das maiores detentoras mundiais de hash rate proprietário e fornecedoras de hash rate. A Bitdeer está comprometida em fornecer soluções de computação abrangentes para seus clientes.

Descrição

• Design, implement, and maintain end-to-end CI/CD pipelines for software applications and machine learning models • Automate build, testing, deployment, and rollback processes • Build, optimize, and scale cloud-native infrastructure using Kubernetes and Docker • Manage and provision specialized computing resources, including GPU clusters, for AI workloads and model inferencing • Own high-availability design in production environments • Implement disaster recovery, self-healing mechanisms, capacity planning, and performance tuning • Champion Infrastructure as Code practices using Terraform, Ansible, and Helm • Architect and refine monitoring, logging, and alerting systems • Collaborate with R&D, Data Science, Security, and Business teams on workflow optimization and Platform Engineering initiatives • Establish and enforce system stability and security standards, release workflows, Zero Trust access controls, secrets management, and compliance • Lead troubleshooting during complex anomalies and major incidents, conduct root cause analysis, and implement preventative remediation plans

🎯 Requisitos

• Bachelor's degree or above in Computer Science, Engineering, or a related technical field • 5+ years of hands-on experience in DevOps, Site Reliability Engineering, or Cloud Infrastructure roles • Expert-level knowledge of Linux operating systems and core networking principles, including TCP/IP, DNS, HTTP, load balancing, and VPCs • Deep mastery of Docker and Kubernetes orchestration, cluster management, and production best practices • Proficiency designing and managing infrastructure on major public or hybrid cloud platforms, including AWS, GCP, Azure, or Alibaba Cloud • Experience with multi-cloud and hybrid-cloud strategies • Strong coding and scripting capabilities in at least one major language, such as Go, Python, or Shell • Practical understanding of CI/CD, Infrastructure as Code, observability, and Site Reliability Engineering principles • Exceptional problem-solving abilities, technical judgment, and cross-team communication skills • a• Preferred: familiarity with MLOps, model serving/inferencing frameworks, GPU clusters, large-scale distributed systems, Internal Developer Platforms, Zero Trust, DevSecOps, SOC2, ISO27001, and technical leadership

Candidatar-se

Vagas Similares

🕒 Agosto 12

Shield AI

501 - 1000

🤖 Inteligência Artificial

🚀 Aeroespacial

🎖️ Defesa

Sr. Staff Engineer operationalizing Databricks for Shield AI, a defense-tech company building autonomous aircraft and intelligent systems. Ensuring secure, scalable, observable production data infrastructure.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $180.000 - $270.000 / ano

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

Cloud

Unity

🕒 Agosto 12

MeridianLink

501 - 1000

💳 Fintech

🏦 Bancário

☁️ SaaS

Senior Site Reliability Engineer operating MeridianLink’s serverless AWS platform. Managing production reliability, databases, backups, monitoring, incident response, and infrastructure automation.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $104.148 - $140.000 / ano

💰 $485.000.000 Post-IPO Debt em 2021-11

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🦅 Patrocina Visto H1B

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 11

VetsEZ

201 - 500

🏥 Saúde

💼 Consultoria

📦 Logística

Senior Backend DevOps Engineer operating AWS containerized microservices for the VA’s JLV clinical data viewer. Building CI/CD, observability, security, and disaster recovery capabilities.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 11

Group 1001

501 - 1000

💼 Consultoria

🏥 Saúde

💸 Finanças

Senior Network Reliability Engineer automating insurance company network platforms at Group 1001. Applying SRE, cloud, Kubernetes, security, and observability practices to improve reliability and reduce operational toil.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 11

Hexion Inc.

1001 - 5000

🚘 Automotivo

🏗️ Construção

🏭 Manufatura

Reliability Engineer improving asset performance across Hexion’s North American manufacturing plants. Leading failure elimination, maintenance optimization, and cross-site reliability standardization.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório