Responsable technique – Infrastructure GPU (100 % télétravail – monde entier)

Emploi pas sur LinkedIn

🔥 il y a 2 minutes

🌏 N'importe où dans le monde

⏰ Temps Plein

🟠 Senior

🧑‍💻 Développeur Full-Stack

👻 Score fantôme 25%

infoinfo

🗣️🇺🇸🇬🇧 Anglais requis

Postuler Maintenant
Trouver des Emplois à Distance Similaires

📊 Vérifiez votre score de CV pour ce poste

Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

Logo of Tether.to

Tether.to

11 - 50 employés

Fondée en 2014

₿ Crypto

💳 Fintech

💸 Finance

Crypto • Fintech • Finance

Tether. to est une entreprise leader dans le domaine des actifs numériques qui est pionnière dans l'utilisation des stablecoins dans l'univers de la blockchain. En tant que stablecoin le plus adopté au monde, les tokens Tether sont conçus pour être indexés à 1 pour 1 avec les monnaies fiduciaires, offrant ainsi une option d'actif numérique stable pour les utilisateurs. La plateforme facilite ces transactions de tokens à travers plusieurs blockchains, améliorant les transactions transfrontalières tout en maintenant la transparence grâce à des relevés quotidiens des actifs et réserves totaux. Les initiatives de Tether incluent des programmes éducatifs promouvant l'utilisation des actifs numériques, ciblant particulièrement des régions comme le Moyen-Orient, la Turquie et les Philippines. Ainsi, Tether se positionne comme un perturbateur du système financier traditionnel en permettant une méthode stable et efficace de gestion des transactions dans le monde de la monnaie numérique.

Description

• Assurer la responsabilité de bout en bout de l’architecture de la plateforme au moyen de propositions d’architecture, de conceptions haut et bas niveau, de revues et de la maintenance de la configuration de référence • Diriger et encadrer hiérarchiquement une équipe distribuée d’environ douze ingénieurs couvrant le backend, le frontend, le DevOps, la QA et la documentation • Définir les standards d’ingénierie, mener les revues de code et de conception, gérer les gates de mise en production, organiser les entretiens individuels et contribuer au développement et à l’évaluation des performances • Concevoir, développer et exploiter un service Slurm managé pour les utilisateurs de la recherche • Prendre en charge le contrôleur et la comptabilisation, les partitions et les nœuds de connexion, l’intégration des nœuds, les configurations de référence et les mises à niveau des drivers et de CUDA, la détection des jobs bloqués et de l’état de santé des nœuds, le drain et l’auto-réparation, la visibilité sur le stockage, la gestion des identités et l’isolation • Prendre en charge l’amorçage et le cycle de vie de clusters Kubernetes sur du bare metal fourni par des partenaires • Mettre en œuvre NVIDIA GPU Operator et Network Operator, l’isolation de GPU par machine virtuelle avec KubeVirt et VFIO, les mises à niveau, la sauvegarde et la restauration, ainsi que le remplacement des nœuds • Prendre en charge l’architecture d’inférence managée, notamment le serving, le parallélisme multi-GPU et multinœud, l’autoscaling, le routage des requêtes, la fiabilité des endpoints et des capacités compatibles avec le confidential computing • Définir les métriques, la journalisation, les alertes et les SLO sur le control plane, le parc de GPU et les couches applicatives • Diriger la réponse aux incidents, les revues post-incident et la mise en place d’un modèle d’astreinte durable • Être l’interlocuteur technique principal des partenaires d’infrastructure et des fournisseurs • Traduire les besoins en spécifications écrites et en tests d’acceptation, gérer les escalades et contribuer à la planification des capacités et à l’approvisionnement en matériel • Collaborer avec les équipes de recherche, d’entraînement des modèles et produit afin de traduire les workloads en exigences de plateforme et d’allouer les capacités • Compléter l’équipe plateforme et définir le niveau d’exigence technique attendu des nouveaux ingénieurs

🎯 Exigences

• Au moins huit ans d’expérience pratique en ingénierie • Au moins trois ans d’expérience dans la direction d’équipes qui développent et exploitent des plateformes d’infrastructure dont dépendent d’autres équipes • Diplôme de niveau licence ou master en informatique ou en ingénierie, ou expérience pratique équivalente • Expérience pratique de l’exploitation de Slurm à grande échelle, notamment slurmctld, slurmdbd, les partitions, la QoS, la priorité, la comptabilisation, les prologues et épilogues, les scripts de contrôle de l’état des nœuds et les mises à niveau avec des jobs en cours sur le système • Une expérience de l’exploitation d’un cluster HPC ou GPU d’entraînement pour une population de chercheurs est fortement souhaitée • Expérience de l’exploitation de parcs de GPU NVIDIA sur bare metal, notamment du cycle de vie des drivers NVIDIA et de CUDA, de Fabric Manager, de NVSwitch, de DCGM, de MIG, du burn-in et de la recette des nœuds • Expérience d’InfiniBand, de la configuration des subnets, de RDMA, de SR-IOV et du diagnostic des problèmes de performances de NCCL sur plusieurs nœuds • Solides connaissances des systèmes Linux, notamment des modules du kernel, des drivers, du PCIe passthrough, de vfio-pci, des cgroups, des namespaces et de l’optimisation des performances • Expérience de l’exploitation de Kubernetes en production, notamment du control plane, des mises à niveau, du CNI, du CSI, des operators, des contrôleurs personnalisés et de la conception de la mutualisation • Expérience du stockage HPC et du déplacement de données, notamment avec VAST, Lustre, NFS, la mise en cache sur NVMe local aux nœuds et la distribution de poids de modèles et de datasets volumineux • Expérience de Prometheus, Grafana, Loki ou équivalents, des SLO, de la réponse aux incidents et des revues post-incident • Maîtrise opérationnelle de JavaScript et de Node.js permettant de relire des services de control plane, de CLI et de workers, et de prendre des décisions d’architecture • Expérience de la mise en production d’une plateforme utilisée par de vrais utilisateurs, par exemple une solution IaaS/PaaS mutualisée ou un service de calcul pour la recherche • Management d’équipes réparties sur plusieurs fuseaux horaires, revues transverses, formalisation des décisions d’architecture et communication avec des partenaires et des cadres dirigeants • Excellente maîtrise de l’anglais, à l’écrit comme à l’oral • Résider dans un fuseau horaire compris entre UTC et UTC+5 h 30 • Souhaitable : operators Slurm sur Kubernetes ou ordonnanceurs natifs Kubernetes • Souhaitable : stacks modernes de serving telles que vLLM, SGLang et TensorRT-LLM • Souhaitable : isolation des machines virtuelles et des conteneurs, confidential computing, Cluster API, kubeadm, Cilium, infrastructure as code, GitOps, expérience du cloud GPU, du HPC ou de laboratoires d’IA, systèmes distribués et expérience de partenariats avec des fournisseurs de matériel

🏖️ Avantages

• Télétravail intégral • Déplacements occasionnels sur les sites des partenaires et participation aux événements d’équipe

Postuler Maintenant

Emplois Similaires

🕒 il y a 7 jours

Safety Wing

51 - 200

🏥 Santé

💼 Conseil

📦 Logistique

Ingénieur produit chargé de concevoir les produits mondiaux de SafetyWing en matière de santé, d’assurance et de retraite. Développement de systèmes backend évolutifs et collaboration avec les équipes Product et Technology.

🌏 N'importe où dans le monde

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🧑‍💻 Développeur Full-Stack

🗣️🇺🇸🇬🇧 Anglais requis

🕒 il y a 9 jours

Supabase

51 - 200

☁️ SaaS

🔌 API

🤖 Intelligence artificielle

Ingénieur logiciel chargé de développer la plateforme de branching et d’orchestration CI/CD de Supabase. Conception de systèmes distribués sécurisés pour exécuter des pipelines à grande échelle et fluidifier les workflows des développeurs.

🌏 N'importe où dans le monde

💰 €80 000 000 Series B en 2022-05

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🧑‍💻 Développeur Full-Stack

🗣️🇺🇸🇬🇧 Anglais requis

🕒 il y a 9 jours

Alpaca

201 - 500

🔌 API

💳 Fintech

₿ Crypto

Ingénieur logiciel senior chargé de développer des systèmes de grand livre évolutifs pour l’infrastructure mondiale de courtage d’Alpaca. Conception de services backend garantissant l’exactitude des enregistrements financiers de millions d’utilisateurs actifs sur les marchés.

🌏 N'importe où dans le monde

⏰ Temps Plein

🟠 Senior

🧑‍💻 Développeur Full-Stack

🗣️🇺🇸🇬🇧 Anglais requis

🕒 il y a 14 jours

ScholarshipOwl

11 - 50

💼 Conseil

📣 Marketing

📚 Éducation

Développeur Full Stack senior chargé de développer les produits Laravel et Nuxt/Vue de la marketplace de bourses alimentée par l’IA de ScholarshipOwl. Développement de widgets, d’API, d’intégrations et de fonctionnalités de financement de l’éducation pilotées par des LLM.

🌏 N'importe où dans le monde

💰 €470 000 Convertible Note en 2014-10

⏰ Temps Plein

🟠 Senior

🧑‍💻 Développeur Full-Stack

🗣️🇺🇸🇬🇧 Anglais requis

🕒 il y a 24 jours

Miratech

501 - 1000

🤝 B2B

💼 Conseil

☁️ SaaS

Architecte logiciel définissant des solutions cloud-native évolutives et distribuées pour Miratech, société mondiale de services et de conseil en informatique. Pilote la stratégie technologique, les décisions d'architecture, la modernisation et les bonnes pratiques d'ingénierie à l'échelle des produits d'entreprise.

🌏 N'importe où dans le monde

💰 Private Equity Round en 2022-04

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🧑‍💻 Développeur Full-Stack

🗣️🇺🇸🇬🇧 Anglais requis