
10.000+ funcionários
Fundada em 1993
🏥 Saúde
🏭 Manufatura
🤖 Inteligência Artificial
Healthcare • Manufacturing • Artificial Intelligence
A NVIDIA é uma empresa de tecnologia líder, especializada em computação acelerada e inteligência artificial. A companhia é pioneira em avanços em unidades de processamento gráfico (GPUs), computação em nuvem, data centers e realidade virtual, com foco nos setores de games, automotivo, saúde e robótica. As inovações da empresa, como o NVIDIA Omniverse, transformam processos digitais tradicionais ao viabilizar simulações de alta fidelidade e tarefas de renderização. Suas aplicações abrangem diversos setores, desde veículos autônomos com o NVIDIA DRIVE até soluções de saúde com o NVIDIA Clara, além de análises e fluxos de trabalho impulsionados por IA.
🕒 Julho 5
🌵 Arizona, California, +2 estados a mais – Remoto
💵 $152.000 - $241.500 / ano
⏰ Tempo Integral
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🦅 Patrocina Visto H1B
🗣️🇺🇸🇬🇧 Inglês obrigatório
Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

10.000+ funcionários
Fundada em 1993
🏥 Saúde
🏭 Manufatura
🤖 Inteligência Artificial
Healthcare • Manufacturing • Artificial Intelligence
A NVIDIA é uma empresa de tecnologia líder, especializada em computação acelerada e inteligência artificial. A companhia é pioneira em avanços em unidades de processamento gráfico (GPUs), computação em nuvem, data centers e realidade virtual, com foco nos setores de games, automotivo, saúde e robótica. As inovações da empresa, como o NVIDIA Omniverse, transformam processos digitais tradicionais ao viabilizar simulações de alta fidelidade e tarefas de renderização. Suas aplicações abrangem diversos setores, desde veículos autônomos com o NVIDIA DRIVE até soluções de saúde com o NVIDIA Clara, além de análises e fluxos de trabalho impulsionados por IA.
• Drive platform bringup, feature enablement, end-to-end software validation, and debug for next-generation NVLink-based GPU and rack-scale systems. • Develop tools, diagnostics, automation, and infrastructure for system validation, regression testing, and fleet support. • Lead reliability and MTBI validation through stress testing, telemetry analysis, failure injection, and issue resolution. • Triage complex software, firmware, networking, and platform issues across validation, deployment, and production environments. • Collaborate with architecture, hardware, firmware, software, and Customer engagement teams to improve system quality and reliability. • Build and maintain SRE-style validation infrastructure, including provisioning, monitoring, and operational readiness. • Create automation, dashboards, runbooks, and debug workflows that improve root-cause analysis and operational efficiency.
• BS or MS in Computer Science, Computer Engineering, Electrical Engineering, or related field, or equivalent experience. • 5+ years of experience in system software, firmware, networking, platform enablement, data center infrastructure, or distributed systems. • Strong programming skills in C/C++ and Python; Bash/Shell scripting experience is a plus. • Strong system-level debugging across software, firmware, hardware, and networking layers. • Solid networking fundamentals, including TCP/IP, Ethernet and/or InfiniBand, RDMA/RoCE, routing, switching, and fabric performance analysis. • Experience with large-scale AI systems, including platform bringup, validation, reliability engineering, stress testing, telemetry analysis, and root-cause debugging. • Ability to triage complex multi-domain issues using logs, telemetry, experiments, and structured debugging methods. • Strong communication and collaboration skills across engineering, customer, and operations teams. • Passion for building reliable next-generation AI infrastructure and solving complex system-level challenges at scale.
• Equity • Benefits
Candidatar-se🕒 Julho 5
Lead DevOps engineer working at Prominent Edge on scalable solutions using AWS technologies. Engage in diverse projects, automate deployments, and enjoy a supportive work environment.
🇺🇸 Estados Unidos – Remoto (EUA)
⏰ Tempo Integral
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório
Ansible
AWS
Azure
Chef
EC2
Google Cloud Platform
Groovy
JavaScript
Jenkins
Kubernetes
Linux
Logstash
Puppet
Python
Go
🕒 Julho 4
Site Reliability Engineer for PSI ensuring reliability, security, and performance in Federal Government IT solutions. Collaborating with teams to enhance DevOps practices and system health.
🇺🇸 Estados Unidos – Remoto (EUA)
⏰ Tempo Integral
🟡 Pleno
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório
🕒 Julho 3
Linux Site Reliability Engineer supporting large-scale hybrid infrastructure environments across cloud and private data centers. Requires deep Linux administration and automation skills.
🇺🇸 Estados Unidos – Remoto (EUA)
💵 $58 - $64 / hora
⏰ Tempo Integral
🟡 Pleno
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório
🕒 Julho 3
Site Reliability Engineer responsible for building reliable Kubernetes infrastructure. Focused on automation and support for enterprise cloud environments using AWS and Terraform.
🇺🇸 Estados Unidos – Remoto (EUA)
💵 $60 - $64 / hora
⏰ Tempo Integral
🟡 Pleno
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório
🕒 Julho 3
Senior Site Reliability Engineer partnering with software developers and IT staff to enhance system design and operational readiness. Reporting on improvements in platform stability and availability.
🇺🇸 Estados Unidos – Remoto (EUA)
💰 $12.000.000 Grant em 2023-04
⏰ Tempo Integral
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório