Senior Software Engineer – NVLink Rack Scale Stability and Reliability

🕒 Julho 5

🗣️🇺🇸🇬🇧 Inglês obrigatório

Distributed Systems

Python

Shell Scripting

Switching

TCP/IP

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of NVIDIA

NVIDIA

10.000+ funcionários

Fundada em 1993

🏥 Saúde

🏭 Manufatura

🤖 Inteligência Artificial

Healthcare • Manufacturing • Artificial Intelligence

A NVIDIA é uma empresa de tecnologia líder, especializada em computação acelerada e inteligência artificial. A companhia é pioneira em avanços em unidades de processamento gráfico (GPUs), computação em nuvem, data centers e realidade virtual, com foco nos setores de games, automotivo, saúde e robótica. As inovações da empresa, como o NVIDIA Omniverse, transformam processos digitais tradicionais ao viabilizar simulações de alta fidelidade e tarefas de renderização. Suas aplicações abrangem diversos setores, desde veículos autônomos com o NVIDIA DRIVE até soluções de saúde com o NVIDIA Clara, além de análises e fluxos de trabalho impulsionados por IA.

Descrição

• Drive platform bringup, feature enablement, end-to-end software validation, and debug for next-generation NVLink-based GPU and rack-scale systems. • Develop tools, diagnostics, automation, and infrastructure for system validation, regression testing, and fleet support. • Lead reliability and MTBI validation through stress testing, telemetry analysis, failure injection, and issue resolution. • Triage complex software, firmware, networking, and platform issues across validation, deployment, and production environments. • Collaborate with architecture, hardware, firmware, software, and Customer engagement teams to improve system quality and reliability. • Build and maintain SRE-style validation infrastructure, including provisioning, monitoring, and operational readiness. • Create automation, dashboards, runbooks, and debug workflows that improve root-cause analysis and operational efficiency.

🎯 Requisitos

• BS or MS in Computer Science, Computer Engineering, Electrical Engineering, or related field, or equivalent experience. • 5+ years of experience in system software, firmware, networking, platform enablement, data center infrastructure, or distributed systems. • Strong programming skills in C/C++ and Python; Bash/Shell scripting experience is a plus. • Strong system-level debugging across software, firmware, hardware, and networking layers. • Solid networking fundamentals, including TCP/IP, Ethernet and/or InfiniBand, RDMA/RoCE, routing, switching, and fabric performance analysis. • Experience with large-scale AI systems, including platform bringup, validation, reliability engineering, stress testing, telemetry analysis, and root-cause debugging. • Ability to triage complex multi-domain issues using logs, telemetry, experiments, and structured debugging methods. • Strong communication and collaboration skills across engineering, customer, and operations teams. • Passion for building reliable next-generation AI infrastructure and solving complex system-level challenges at scale.

🏖️ Benefícios

• Equity • Benefits

Candidatar-se

Vagas Similares

🕒 Julho 5

Prominent Edge

11 - 50

💼 Consultoria

🎖️ Defesa

📦 Logística

Lead DevOps engineer working at Prominent Edge on scalable solutions using AWS technologies. Engage in diverse projects, automate deployments, and enjoy a supportive work environment.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 4

Planned Systems International

1001 - 5000

💼 Consultoria

🎖️ Defesa

📦 Logística

Site Reliability Engineer for PSI ensuring reliability, security, and performance in Federal Government IT solutions. Collaborating with teams to enhance DevOps practices and system health.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 3

EITACIES Inc.

51 - 200

💼 Consultoria

🏥 Saúde

🏭 Manufatura

Linux Site Reliability Engineer supporting large-scale hybrid infrastructure environments across cloud and private data centers. Requires deep Linux administration and automation skills.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $58 - $64 / hora

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 3

EITACIES Inc.

51 - 200

💼 Consultoria

🏥 Saúde

🏭 Manufatura

Site Reliability Engineer responsible for building reliable Kubernetes infrastructure. Focused on automation and support for enterprise cloud environments using AWS and Terraform.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $60 - $64 / hora

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 3

ARA

1001 - 5000

🏭 Manufatura

💼 Consultoria

🏥 Saúde

Senior Site Reliability Engineer partnering with software developers and IT staff to enhance system design and operational readiness. Reporting on improvements in platform stability and availability.

🇺🇸 Estados Unidos – Remoto (EUA)

💰 $12.000.000 Grant em 2023-04

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório