Architecte principal de solutions Cloud, Infrastructure et DevOps

🔥 il y a 23 minutes

🌐 France, Royaume-Uni, +2 autres pays – Distant

infoinfo

⏰ Temps Plein

🟠 Senior

💻 Ingénieur Solutions

👻 Score fantôme 11%

infoinfo

🗣️🇺🇸🇬🇧 Anglais requis

Postuler Maintenant
Trouver des Emplois à Distance Similaires

📊 Vérifiez votre score de CV pour ce poste

Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

Logo of NVIDIA

NVIDIA

10 000+ employés

Fondée en 1993

🏥 Santé

🏭 Fabrication

🤖 Intelligence artificielle

Healthcare • Manufacturing • Artificial Intelligence

NVIDIA est une entreprise technologique de premier plan, spécialisée dans le calcul accéléré et l’intelligence artificielle (IA). NVIDIA est à l’avant‑garde des avancées en GPU (processeurs graphiques), cloud computing, centres de données et réalité virtuelle, avec un accent particulier sur les secteurs du gaming, de l’automobile, de la santé et de la robotique. Ses innovations, telles que NVIDIA Omniverse, transforment les processus numériques traditionnels en permettant des simulations haute fidélité et des tâches de rendu de pointe. Ses applications couvrent de nombreux secteurs, des véhicules autonomes avec NVIDIA DRIVE aux solutions de santé avec NVIDIA Clara, ainsi que des analyses et workflows pilotés par l’IA.

Description

• Piloter la validation complète des solutions sur les stacks logicielles des partenaires, notamment les tests de stabilité à l’échelle du cluster, la validation sur de véritables charges d’entraînement et les tests d’endurance de plusieurs jours sur plusieurs racks • Réduire au minimum le délai entre la remise du cluster et l’exécution de la première charge de production en coordonnant la mise en service du matériel, l’intégration aux services managés et les équipes d’exploitation des partenaires • Garantir la stabilité de la production en phase d’exploitation à l’échelle de la flotte, notamment la supervision, la journalisation, l’orchestration des charges, la détection et la correction des incidents, la maintenance préventive ainsi que les campagnes de déploiement des firmwares et des avis techniques • Évaluer les environnements clients et exploiter des plateformes ouvertes hétérogènes, notamment Kubernetes, KubeVirt, Slurm et des ordonnanceurs prenant en compte les GPU • Intégrer des solutions réseau et de stockage de niveau entreprise et permettre l’exécution de charges de travail d’ISV tiers • Fournir des conseils spécialisés et assurer le dépannage pratique sur les serveurs bare metal, les systèmes d’exploitation, les stacks logicielles, les plateformes de conteneurs, les réseaux et le stockage • Accompagner la R&D, les proofs of concept et les proofs of value afin de valider de nouvelles fonctionnalités, architectures et stratégies de mise à niveau • Assumer le rôle de référent technique pour les comptes attribués • Organiser le transfert structuré des connaissances et la montée en compétences • Rédiger des runbooks, des supports d’intégration et des guides de bonnes pratiques à destination des équipes partenaires

🎯 Exigences

• Diplôme de niveau bachelor, master ou doctorat en informatique, génie électrique ou informatique, physique, mathématiques ou domaine connexe, ou expérience équivalente • Au moins 8 ans d’expérience dans la gestion d’environnements Cloud évolutifs et dans des fonctions d’ingénierie de l’automatisation • Maîtrise avérée des fondamentaux des réseaux et des architectures de datacenters • Expérience pratique de la gestion de clusters HPC/IA et d’infrastructures accélérées par des GPU NVIDIA, notamment le déploiement, la gestion des pilotes et de la boîte à outils CUDA, l’optimisation, le profiling des charges et le dépannage • Solide expérience de Kubernetes pour l’orchestration des conteneurs, l’ordonnancement des ressources et la mise à l’échelle dans des environnements accélérés par GPU et HPC • Expérience des mécanismes internes des ordonnanceurs, des ordonnanceurs batch tels que Slurm et des environnements mutualisés mixtes bare metal/virtualisés tels que KubeVirt • Excellente maîtrise de Linux, notamment Red Hat et Ubuntu, de la sécurité au niveau du système d’exploitation et des protocoles • Expérience des solutions de stockage telles que Lustre, GPFS, ZFS, XFS et des technologies de stockage Kubernetes • Maîtrise des scripts Python et Bash • Expérience des outils de gestion de configuration et d’Infrastructure as Code tels qu’Ansible et Terraform • Expérience de la gestion du cycle de vie et des mises à niveau de clusters basée sur GitOps pour de grandes flottes • Expérience des stacks d’observabilité telles que Grafana, Loki et Prometheus • Capacité à mesurer et à améliorer le MTBI et le goodput des jobs sur de grands clusters GPU • Expérience de la détection des incidents, des workflows de mise en drainage et de remédiation, de la définition des SLO et des budgets d’erreur ainsi que des revues post-incident • Solide expérience du conseil, avec pilotage de revues d’architecture et présentation auprès de parties prenantes dirigeantes • Connaissance des pipelines CI/CD et des architectures de microservices basées sur des conteneurs • Expérience des GPU et Network Operators NVIDIA ainsi que de NVIDIA Base Command Manager • Connaissance de DCGM, des diagnostics XID, des agents de supervision de l’état des nœuds et des solutions d’analyse de la fiabilité à l’échelle d’une flotte • Expertise des frameworks d’ordonnancement et d’inférence nativement conçus pour l’IA sur Kubernetes, tels que KAI, Grove, Dynamo et NVIDIA Cloud Functions • Expérience des fabrics basées sur RDMA, telles qu’InfiniBand ou RoCE • Une connaissance de Cumulus Linux, SONiC, des fabrics Spectrum-X, des services d’infrastructure DPU/DOCA et des opérations de partitionnement NVLink/NVSwitch constitue un atout majeur

🏖️ Avantages

• Produits NVIDIA et participation au développement de systèmes IA/HPC de nouvelle génération • Découverte de projets d’infrastructure à grande échelle et de technologies GPU/HPC avancées • Collaboration avec les clients, les partenaires et des équipes transverses • Opportunités de leadership technique, de transfert de connaissances et de montée en compétences

Postuler Maintenant

Emplois Similaires

🕒 il y a 14 jours

Capgemini

10 000+ employés

💼 Conseil

🏥 Santé

📦 Logistique

Ingénieur intégration chargé de maintenir un ERP critique chez Capgemini, partenaire de la transformation métier et technologique. Déploiement applicatif, gestion des incidents techniques et modernisation des plateformes.

🕒 il y a 22 jours

AssessFirst 🦄

51 - 200

👥 RH Tech

🤖 Intelligence artificielle

☁️ SaaS

Ingénieur solutions transformant les données clients en scoring du churn, tableaux de bord et automatisations pour la plateforme HR Tech internationale d’AssessFirst. Vous influencez la stratégie produit, marketing et business grâce à des insights directement exploitables.

🇫🇷 France – Télétravail

💵 €60 000 - €70 000 / an

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

💻 Ingénieur Solutions

🕒 il y a 27 jours

Automat-it

51 - 200

💼 Conseil

📦 Logistique

📣 Marketing

Architecte de solutions senior chargé de concevoir des solutions AWS pour les start-up clientes d’Automat-it à Paris. Pilotage de l’architecture avant-vente, de l’optimisation cloud et des missions AWS en contact direct avec les clients.

🗣️🇺🇸🇬🇧 Anglais requis

🕒 il y a 1 mois

EUROPEAN DYNAMICS

501 - 1000

💼 Conseil

📦 Logistique

📣 Marketing

Architecte de solutions concevant des architectures cloud, données et logicielles pour European Dynamics. Élaboration de modèles d'architecture et d'artefacts personnalisés tout en conseillant sur la gouvernance des outils de modélisation pour des clients européens majeurs.

🗣️🇺🇸🇬🇧 Anglais requis

🕒 il y a 1 mois

Cribl

501 - 1000

☁️ SaaS

Ingénieur Solutions Partenaires accompagnant les partenaires cloud et SaaS de Cribl pour l’Europe du Sud. Réalisation d’activités de présales techniques, d’architecture, de formation et de proof-of-value.

🇫🇷 France – Télétravail

💵 €97 400 - €122 000 / an

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

💻 Ingénieur Solutions

🗣️🇪🇸 Espagnol requis

🗣️🇺🇸🇬🇧 Anglais requis