Technische Leitung – GPU-Infrastruktur (100 % remote – weltweit)

Stelle nicht auf LinkedIn

🔥 vor 9 Minuten

🌏 Überall auf der Welt

⏰ Vollzeit

🟠 Senior

🧑‍💻 Full-Stack-Entwickler

👻 Geisterscore 25%

infoinfo

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of Tether.to

Tether.to

11 - 50 Mitarbeiter

Gegründet 2014

₿ Crypto

💳 Fintech

💸 Finanzen

Crypto • Fintech • Finance

Tether. to ist ein führendes Unternehmen für digitale Vermögenswerte, das die Nutzung von Stablecoins im Blockchain-Bereich vorantreibt. Als der am weitesten verbreitete Stablecoin sind Tether-Token darauf ausgelegt, im Verhältnis 1:1 an Fiatwährungen gekoppelt zu sein, und bieten Nutzern eine stabile digitale Vermögensoption. Die Plattform erleichtert diese Token-Transaktionen über mehrere Blockchains hinweg und fördert grenzüberschreitende Transaktionen, während durch tägliche Aufzeichnungen der Gesamtvermögenswerte und Reserven Transparenz gewahrt wird. Zu den Initiativen von Tether gehören Bildungsprogramme zur Förderung der Nutzung digitaler Vermögenswerte, insbesondere in Regionen wie dem Nahen Osten, der Türkei und den Philippinen. Tether positioniert sich somit als Disruptor des traditionellen Finanzsystems, indem es eine stabile, effiziente Methode für Transaktionen in der digitalen Währungswelt ermöglicht.

Beschreibung

• Verantwortung für die End-to-End-Plattformarchitektur durch Architekturvorschläge, High-Level- und Low-Level-Designs, Reviews sowie die Pflege der Baseline • Leitung und disziplinarische Führung eines verteilten Teams aus rund zwölf Engineers in den Bereichen Backend, Frontend, DevOps, QA und Dokumentation • Etablierung von Engineering-Standards, Durchführung von Code- und Design-Reviews, Verwaltung von Release-Gates, regelmäßige Mitarbeitergespräche sowie Beiträge zu Entwicklung und Leistungsbeurteilung • Konzeption, Aufbau und Betrieb eines Managed-Slurm-Service für Forschungsteams • Verantwortung für Controller und Accounting, Partitionen und Login-Nodes, Node-Onboarding, Treiber- und CUDA-Baselines sowie Upgrades, Erkennung blockierter Jobs und fehlerhafter Nodes, Drain und Auto-Healing, Storage-Transparenz, Identität und Isolation • Verantwortung für das Bootstrapping und den Lebenszyklus von Kubernetes-Clustern auf von Partnern bereitgestellter Bare-Metal-Infrastruktur • Implementierung des NVIDIA GPU Operator und Network Operator, VM-basierter GPU-Isolation mit KubeVirt und VFIO, Upgrades, Backup und Recovery sowie Austausch von Nodes • Verantwortung für die Architektur des Managed Inference-Betriebs, einschließlich Serving, Parallelisierung über mehrere GPUs und Nodes, Autoscaling, Request-Routing, Endpoint-Zuverlässigkeit und Kapazitäten für Confidential Computing • Etablierung von Metriken, Logging, Alerting und SLOs über Control Plane, GPU-Flotte und Anwendungsebenen hinweg • Leitung der Incident Response, Durchführung von Post-Incident-Reviews und Entwicklung eines nachhaltigen On-Call-Modells • Primäre technische Schnittstelle zu Infrastrukturpartnern und Anbietern • Überführung von Anforderungen in schriftliche Spezifikationen und Abnahmetests, Steuerung von Eskalationen sowie Mitwirkung an Kapazitätsplanung und Hardwarebeschaffung • Zusammenarbeit mit Forschungs-, Model-Training- und Produktteams, um Workloads in Plattformanforderungen zu übersetzen und Kapazitäten zu vermitteln • Vervollständigung des Plattformteams und Definition des technischen Anspruchsniveaus für neue Engineers

🎯 Anforderungen

• Mindestens acht Jahre praktische Engineering-Erfahrung • Mindestens drei Jahre Erfahrung in der Führung von Teams, die Infrastrukturplattformen entwickeln und betreiben, auf die andere Teams angewiesen sind • Bachelor- oder Masterabschluss in Informatik oder Ingenieurwesen oder gleichwertige praktische Erfahrung • Praktische Erfahrung im Betrieb von Slurm im großen Maßstab, einschließlich slurmctld, slurmdbd, Partitionen, QoS, Priorisierung, Accounting, Prolog und Epilog, Scripting zur Node-Überwachung sowie Upgrades bei laufendem Systembetrieb • Erfahrung im Betrieb eines HPC- oder GPU-Trainingsclusters für Forschungsteams wünschenswert • Erfahrung im Betrieb von NVIDIA-GPU-Flotten auf Bare Metal, einschließlich Lebenszyklusmanagement von NVIDIA-Treibern und CUDA, Fabric Manager, NVSwitch, DCGM, MIG, Node-Burn-in und Abnahme • Erfahrung mit InfiniBand, Subnet-Konfiguration, RDMA, SR-IOV sowie der Diagnose von NCCL-Performanceproblemen über mehrere Nodes hinweg • Tiefgehende Linux-Systemkenntnisse, einschließlich Kernelmodulen, Treibern, PCIe-Passthrough, vfio-pci, cgroups, Namespaces und Performance-Tuning • Erfahrung im produktiven Kubernetes-Betrieb, einschließlich Control Plane, Upgrades, CNI, CSI, Operatoren, Custom Controllern und Multi-Tenancy-Design • Erfahrung mit HPC-Storage und Datenbewegung, einschließlich VAST, Lustre, NFS, Node-lokalem NVMe-Caching sowie der Verteilung großer Model-Weights und Datensätze • Erfahrung mit Prometheus, Grafana, Loki oder vergleichbaren Lösungen, SLOs, Incident Response und Post-Incident-Reviews • Sicherer Umgang mit JavaScript und Node.js, ausreichend zur Prüfung von Control-Plane-, CLI- und Worker-Services sowie zur Entscheidungsfindung bei Architekturfragen • Erfahrung bei der Bereitstellung einer Plattform mit tatsächlichen Nutzern, beispielsweise eines mandantenfähigen IaaS-/PaaS- oder Research-Computing-Service • Führung von Mitarbeitenden über mehrere Zeitzonen hinweg, bereichsübergreifende Reviews, schriftliche Architekturentscheidungen sowie Kommunikation mit Partnern und Führungskräften • Sehr gute schriftliche und mündliche Englischkenntnisse • Wohnsitz in einer Zeitzone zwischen UTC und UTC+5:30 • Wünschenswert: Slurm-Operatoren auf Kubernetes oder Kubernetes-native Scheduler • Wünschenswert: moderne Serving-Stacks wie vLLM, SGLang und TensorRT-LLM • Wünschenswert: VM-/Container-Isolation, Confidential Computing, Cluster API, kubeadm, Cilium, Infrastructure as Code, GitOps, Erfahrung mit GPU-Clouds, HPC oder AI-Labs, verteilten Systemen sowie der Zusammenarbeit mit Hardwareanbietern

🏖️ Vorteile

• Vollständig remote möglich • Gelegentliche Reisen zu Partnerstandorten und Teamevents

Jetzt Bewerben

Ähnliche Jobs

🕒 vor 7 Tagen

Safety Wing

51 - 200

🏥 Gesundheitswesen

💼 Beratung

📦 Logistik

Product Engineer für die Entwicklung der globalen Produkte von SafetyWing in den Bereichen Gesundheit, Versicherung und Altersvorsorge. Entwicklung skalierbarer Backend-Systeme und enge Zusammenarbeit mit den Produkt- und Technologieteams.

🌏 Überall auf der Welt

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🧑‍💻 Full-Stack-Entwickler

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 9 Tagen

Supabase

51 - 200

☁️ SaaS

🔌 API

🤖 Künstliche Intelligenz

Softwareentwickler (m/w/d) für die CI/CD-Branching- und Orchestrierungsplattform von Supabase. Sie entwickeln sichere verteilte Systeme für die skalierbare Pipeline-Ausführung und effiziente Entwickler-Workflows.

🌏 Überall auf der Welt

💰 €80.000.000 Series B im 2022-05

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🧑‍💻 Full-Stack-Entwickler

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 9 Tagen

Alpaca

201 - 500

🔌 API

💳 Fintech

₿ Crypto

Senior Software Engineer für die Entwicklung skalierbarer Ledger-Systeme für die globale Brokerage-Infrastruktur von Alpaca. Entwicklung von Backend-Services, die genaue Finanzaufzeichnungen für Millionen von Trading-Nutzern gewährleisten.

🌏 Überall auf der Welt

⏰ Vollzeit

🟠 Senior

🧑‍💻 Full-Stack-Entwickler

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 14 Tagen

ScholarshipOwl

11 - 50

💼 Beratung

📣 Marketing

📚 Bildung

Senior Full-Stack-Entwickler (m/w/d) für die Entwicklung von Laravel- und Nuxt/Vue-Produkten für den KI-gestützten Stipendien-Marktplatz von ScholarshipOwl. Entwicklung von Widgets, APIs, Integrationen und LLM-basierten Funktionen zur Bildungsfinanzierung.

🌏 Überall auf der Welt

💰 €470.000 Convertible Note im 2014-10

⏰ Vollzeit

🟠 Senior

🧑‍💻 Full-Stack-Entwickler

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 24 Tagen

Miratech

501 - 1000

🤝 B2B

💼 Beratung

☁️ SaaS

Software-Architekt, der skalierbare cloud-native und verteilte Lösungen für Miratech, ein globales IT-Services- und Beratungsunternehmen, definiert. Steuert Technologiestrategie, Architekturentscheidungen, Modernisierung und Engineering-Best-Practices über Enterprise-Produkte hinweg.

🌏 Überall auf der Welt

💰 Private Equity Round im 2022-04

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🧑‍💻 Full-Stack-Entwickler

🗣️🇺🇸🇬🇧 Englisch erforderlich