
10.000+ Mitarbeiter
Gegründet 1993
🏥 Gesundheitswesen
🏭 Fertigung
🤖 Künstliche Intelligenz
Healthcare • Manufacturing • Artificial Intelligence
NVIDIA ist ein führendes Technologieunternehmen mit Spezialisierung auf beschleunigtes Computing und Künstliche Intelligenz (AI). NVIDIA treibt Fortschritte bei Grafikprozessoren (GPUs), Cloud Computing, Rechenzentren und Virtual Reality voran und fokussiert dabei Branchen wie Gaming, Automotive, Gesundheitswesen und Robotik. Innovationen des Unternehmens wie NVIDIA Omniverse transformieren traditionelle digitale Prozesse, indem sie hochrealistische Simulationen und Rendering-Aufgaben ermöglichen. Die Anwendungen erstrecken sich über zahlreiche Branchen – von autonomen Fahrzeugen mit NVIDIA DRIVE über Gesundheitslösungen mit NVIDIA Clara bis hin zu AI-gestützten Analysen und Workflows.
🔥 vor 1 Stunde
🌐 Frankreich, Vereinigtes Königreich, +2 weitere Länder – Remote
⏰ Vollzeit
🟠 Senior
💻 Lösungsingenieur
👻 Geisterscore 11%
🗣️🇺🇸🇬🇧 Englisch erforderlich
Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

10.000+ Mitarbeiter
Gegründet 1993
🏥 Gesundheitswesen
🏭 Fertigung
🤖 Künstliche Intelligenz
Healthcare • Manufacturing • Artificial Intelligence
NVIDIA ist ein führendes Technologieunternehmen mit Spezialisierung auf beschleunigtes Computing und Künstliche Intelligenz (AI). NVIDIA treibt Fortschritte bei Grafikprozessoren (GPUs), Cloud Computing, Rechenzentren und Virtual Reality voran und fokussiert dabei Branchen wie Gaming, Automotive, Gesundheitswesen und Robotik. Innovationen des Unternehmens wie NVIDIA Omniverse transformieren traditionelle digitale Prozesse, indem sie hochrealistische Simulationen und Rendering-Aufgaben ermöglichen. Die Anwendungen erstrecken sich über zahlreiche Branchen – von autonomen Fahrzeugen mit NVIDIA DRIVE über Gesundheitslösungen mit NVIDIA Clara bis hin zu AI-gestützten Analysen und Workflows.
• Verantwortlich für die Validierung vollständiger Lösungen auf den Software-Stacks von Partnern, einschließlich clusterweiter Stabilitätstests, der Abnahme realer Trainings-Workloads sowie mehrtägiger Burn-in-Tests über mehrere Racks hinweg • Minimierung der Zeitspanne zwischen der Übergabe eines Clusters und der Ausführung des ersten Produktions-Workloads durch Koordination der Hardware-Inbetriebnahme, der Aufnahme in Managed Services und der Teams des Partnerbetriebs • Verantwortung für die Stabilität des Produktionsbetriebs ab Tag 2 im gesamten Bestand, einschließlich Monitoring, Logging, Workload-Orchestrierung, Fehlererkennung und -behebung, vorbeugender Wartung sowie Kampagnen zur Verteilung von Firmware- und Field Notices • Bewertung von Kundenumgebungen und Betrieb heterogener offener Plattformen einschließlich Kubernetes, KubeVirt, Slurm und GPU-bewusster Scheduler • Integration von Enterprise-Netzwerk- und Speicherlösungen sowie Ermöglichung von Workloads von Drittanbieter-ISVs • Beratung und praxisnahe Fehlerbehebung in den Bereichen Bare Metal, Betriebssysteme, Software-Stacks, Containerplattformen, Netzwerke und Speicher • Unterstützung von Forschung und Entwicklung, Proofs of Concept sowie Proofs of Value zur Validierung neuer Funktionen, Architekturen und Upgrade-Ansätze • Technische Leitung für zugewiesene Kundenkonten • Durchführung strukturierter Wissenstransfers und Enablement-Maßnahmen • Erstellung von Runbooks, Onboarding-Materialien und Best-Practice-Leitfäden für Partnerteams
• Bachelor-, Master- oder Promotionsabschluss in Informatik, Elektrotechnik/Computer Engineering, Physik, Mathematik oder einem verwandten Fachgebiet bzw. gleichwertige Berufserfahrung • Mindestens 8 Jahre Erfahrung im Betrieb skalierbarer Cloud-Umgebungen und in Positionen im Bereich Automatisierungs-Engineering • Nachweislich fundierte Kenntnisse der Netzwerkgrundlagen und von Rechenzentrumsarchitekturen • Praktische Erfahrung im Betrieb von HPC-/KI-Clustern und NVIDIA-GPU-beschleunigter Infrastruktur, einschließlich Bereitstellung, Verwaltung von Treibern und CUDA-Toolkit, Optimierung, Workload-Profiling und Fehlerbehebung • Umfassende Kubernetes-Erfahrung für Container-Orchestrierung, Ressourcenplanung und Skalierung in GPU-beschleunigten sowie HPC-Umgebungen • Erfahrung mit Scheduler-internen Abläufen, Batch-Schedulern wie Slurm sowie gemischten mandantenfähigen Umgebungen aus Bare Metal und Virtualisierung wie KubeVirt • Tiefgehende Kenntnisse in Linux, einschließlich Red Hat und Ubuntu, der Sicherheit auf Betriebssystemebene und von Protokollen • Erfahrung mit Speicherlösungen wie Lustre, GPFS, ZFS, XFS und Kubernetes-Speichertechnologien • Sehr gute Kenntnisse in Python- und Bash-Scripting • Erfahrung mit Configuration-Management- und Infrastructure-as-Code-Tools wie Ansible und Terraform • Erfahrung mit GitOps-basiertem Cluster-Lifecycle- und Upgrade-Management für große Bestände • Erfahrung mit Observability-Stacks wie Grafana, Loki und Prometheus • Fähigkeit, MTBI und Job-Goodput auf großen GPU-Clustern zu messen und zu verbessern • Erfahrung mit Workflows zur Fehlererkennung, zum Drain und zur Behebung, mit der Definition von SLOs und Error Budgets sowie mit Post-Incident-Reviews • Ausgeprägter Beratungshintergrund mit der Leitung von Architekturprüfungen und Präsentationen für Stakeholder auf Führungsebene • Kenntnisse von CI/CD-Pipelines und containerbasierten Microservices-Architekturen • Erfahrung mit NVIDIA GPU Operator, NVIDIA Network Operator und NVIDIA Base Command Manager • Vertrautheit mit DCGM, XID-Diagnose, Health Agents auf Node-Ebene und Reliability Intelligence für gesamte Bestände • Expertise in KI-nativen Scheduling- und Inference-Frameworks auf Kubernetes, beispielsweise KAI, Grove, Dynamo und NVIDIA Cloud Functions • Erfahrung mit RDMA-basierten Fabric-Technologien wie InfiniBand oder RoCE • Kenntnisse in Cumulus Linux, SONiC, Spectrum-X-Fabrics, DPU-/DOCA-Infrastrukturdiensten sowie der Partitionierung und dem Betrieb von NVLink/NVSwitch sind von großem Vorteil
• Arbeit mit NVIDIA-Produkten und an KI-/HPC-Systemen der nächsten Generation • Einblicke in Infrastrukturprojekte im großen Maßstab sowie fortschrittliche GPU-/HPC-Technologien • Zusammenarbeit mit Kunden, Partnern und funktionsübergreifenden Teams • Möglichkeiten zur technischen Führung, zum Wissenstransfer und zum Enablement
Jetzt Bewerben🕒 vor 14 Tagen
Ingénieur intégration maintenant un ERP critique chez Capgemini, partenaire de la transformation business et technologique. Déploiement applicatif, incidents techniques et modernisation des plateformes.
🗣️🇫🇷 Französisch erforderlich
🕒 vor 22 Tagen
Solution Engineer turning customer data into churn scoring, dashboards, and automation for AssessFirst’s global HR Tech platform. Influencing product, marketing, and business strategy through actionable insights.
🗣️🇫🇷 Französisch erforderlich
🕒 vor 28 Tagen
Senior Solutions Architect designing AWS solutions for Automat-it’s startup customers in Paris. Leading pre-sales architecture, cloud optimization, and customer-facing AWS engagements.
🗣️🇫🇷 Französisch erforderlich
🗣️🇺🇸🇬🇧 Englisch erforderlich
🕒 vor 1 Monat
Solution Architect designing cloud, data, and software architectures for European Dynamics. Developing architecture models and customized artefacts while advising on modelling-tool governance for major European clients.
🗣️🇺🇸🇬🇧 Englisch erforderlich
🕒 vor 1 Monat
Partner Solutions Engineer enabling Cribl’s Southern European cloud and SaaS partners. Delivering technical presales, architecture, training, and proof-of-value engagements.
🗣️🇫🇷 Französisch erforderlich
🗣️🇪🇸 Spanisch erforderlich
🗣️🇺🇸🇬🇧 Englisch erforderlich