
11 - 50 funcionários
🏥 Saúde
💼 Consultoria
🏨 Hospitalidade
🔥 Investimento no último ano
💰 $15.142.238 Series A - Andromeda Robotics em 2025-09
Healthcare • Consulting • Hospitality
A Andromeda é um serviço de computação com GPU e um marketplace que oferece acesso instantâneo a grandes clusters de aceleradores H100, H200 e B200 para experimentos, treinamentos em larga escala e inferência. Suporta orquestração com Slurm, Kubernetes ou SSH direto, oferece uso flexível sem duração mínima e preços competitivos, inclui expertise em DevOps, armazenamento local NAS ou transmitido sem taxas de entrada/saída, e suporte 24/7 com SLAs do setor. A empresa também opera um marketplace de GPUs de terceiros em gpulist. ai.
🕒 Abril 9
🏄 California – Remoto
⏰ Tempo Integral
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🦅 Patrocina Visto H1B
🗣️🇺🇸🇬🇧 Inglês obrigatório
Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

11 - 50 funcionários
🏥 Saúde
💼 Consultoria
🏨 Hospitalidade
🔥 Investimento no último ano
💰 $15.142.238 Series A - Andromeda Robotics em 2025-09
Healthcare • Consulting • Hospitality
A Andromeda é um serviço de computação com GPU e um marketplace que oferece acesso instantâneo a grandes clusters de aceleradores H100, H200 e B200 para experimentos, treinamentos em larga escala e inferência. Suporta orquestração com Slurm, Kubernetes ou SSH direto, oferece uso flexível sem duração mínima e preços competitivos, inclui expertise em DevOps, armazenamento local NAS ou transmitido sem taxas de entrada/saída, e suporte 24/7 com SLAs do setor. A empresa também opera um marketplace de GPUs de terceiros em gpulist. ai.
• Design and evolve multi-provider, multi-region GPU compute clusters optimized for large-scale training • Serve as the primary technical point of contact for customers running large-scale training workloads • Define SLOs and error budgets that account for the unique failure modes of GPU infrastructure • Ensure the health and performance of high-speed interconnects • Build deep visibility into GPU utilization, memory pressure, interconnect throughput • Build production-grade automation for cluster provisioning, GPU health checks, job scheduling • Lead incident response for complex failures spanning hardware, networking, orchestration
• Deep, hands-on experience operating large-scale GPU clusters (NVIDIA A100/H100/B200 or equivalent) • Production experience with InfiniBand, RoCE, or NVLink fabrics in the context of distributed training • Working knowledge of NCCL, CUDA, PyTorch distributed, DeepSpeed, Megatron, FSDP, or similar • Expert-level Linux knowledge • Strong experience running Kubernetes in production with GPU workloads • Strong engineering skills in Python, Go, or Bash • Hands-on experience building monitoring and alerting for GPU infrastructure • Proven track record leading incident response for complex distributed systems
• Health insurance • Retirement plans • Paid time off • Flexible work arrangements • Professional development
Candidatar-se🕒 Abril 9
Senior Infrastructure Engineer/SRE responsible for building core infrastructure at AI-driven contact center company. Designing tools for developers and ensuring reliability across cloud platforms.
🇺🇸 Estados Unidos – Remoto (EUA)
💵 $205.000 - $270.000 / ano
⏰ Tempo Integral
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🦅 Patrocina Visto H1B
🗣️🇺🇸🇬🇧 Inglês obrigatório
🕒 Abril 8
DevOps Architect leading platform engineering standards across a multi-cloud, hybrid environment at Eitacies Inc. Focus on automation, infrastructure, and cloud architecture.
🇺🇸 Estados Unidos – Remoto (EUA)
💵 $60 / hora
⏰ Tempo Integral
🟠 Sênior
🔴 Especialista
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório
🕒 Abril 8
Manager II, Site Reliability Engineering at Flywire driving reliability and performance in our cloud infrastructure. Lead SRE teams, collaborate across functions, and ensure production excellence.
🇺🇸 Estados Unidos – Remoto (EUA)
💵 $160.000 - $200.000 / ano
💰 $60.000.000 Series F em 2021-03
⏰ Tempo Integral
🟡 Pleno
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🦅 Patrocina Visto H1B
🗣️🇺🇸🇬🇧 Inglês obrigatório
🕒 Abril 3
DevOps Engineer for Avive Solutions, building cloud infrastructure to revolutionize cardiac arrest responses. Collaborate cross-functionally to optimize systems for high-impact healthcare technology.
🇺🇸 Estados Unidos – Remoto (EUA)
💵 $140.000 - $180.000 / ano
⏰ Tempo Integral
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório
🕒 Abril 3
Site Reliability Engineer ensuring performance and scalability of Runlayer’s AI infrastructure. Collaborating with founders and engineers in a fast-paced environment to support cloud and on-prem setups.
🇺🇸 Estados Unidos – Remoto (EUA)
⏰ Tempo Integral
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório