Wissenschaftliche Mitarbeiterin / Wissenschaftlicher Mitarbeiter bzw. Ingenieurin / Ingenieur – Trainingsinfrastruktur

🔥 vor 12 Stunden

🇪🇺 Europa – Remote

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🧬 Forschungswissenschaftler

👻 Geisterscore 12%

infoinfo

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of Luma AI

Luma AI

2 - 10 Mitarbeiter

🤖 Künstliche Intelligenz

☁️ SaaS

📱 Medien

💰 €90.000.000 Series B im 2025-01

Artificial Intelligence • SaaS • Media

Luma AI ist ein in Palo Alto ansässiges Unternehmen, das multimodale generative KI-Modelle und kreative Workflow-Tools entwickelt, die sich auf die Produktion von Video, Bild, Audio und Text konzentrieren. Luma bietet Modelle und Produkte wie Ray (Videogenerierung), UNI-1/Uni-1. 1 (Markenintelligenzmodelle) und eine API/Unternehmenslösungen, die es kreativen Teams ermöglichen, cineastische Qualitätsassets mit Markenanpassung zu erzeugen, zu bearbeiten und zu steuern. Sie legen Wert auf Pionierforschung (Open Physical AI Lab), interne Modellentwicklung und Produkte für kreative Teams, Agenturen und Produktionsservices. Luma bietet zudem APIs, Unternehmenspläne, ein kreatives Partnerprogramm und Lernressourcen an.

Beschreibung

• Entwurf, Implementierung und Optimierung effizienter verteilter Trainingssysteme für Modelle auf Tausenden von GPUs • Erforschung und Implementierung fortschrittlicher Parallelisierungsverfahren, darunter FSDP, Tensor Parallelism, Pipeline Parallelism und Expert Parallelism • Entwicklung von Monitoring-, Visualisierungs- und Debugging-Tools für groß angelegte Trainingsläufe • Optimierung von Trainingsstabilität, Konvergenz und Ressourcennutzung in umfangreichen Clustern • Einarbeitung in den aktuellen Trainings-Stack sowie Diagnose von Stabilitäts- und Auslastungsproblemen im großen Maßstab • Umsetzung einer Parallelisierungs- oder Stabilitätsverbesserung, die einen realen Trainingslauf messbar verbessert • Entwicklung von Monitoring- und Tooling-Lösungen, um große Trainingsläufe zuverlässig und effizient zu halten

🎯 Anforderungen

• Umfassende Erfahrung mit verteiltem PyTorch-Training und Parallelisierungsverfahren beim Training von Foundation Models • Tiefgehendes Verständnis von GPU-Clustern, Netzwerken und Speichersystemen • Vertrautheit mit Kommunikationsbibliotheken (NCCL, MPI) und der Optimierung verteilter Systeme • Gute Kenntnisse in der Linux-Systemadministration und Skripterstellung (von Vorteil) • Erfahrung mit der Verwaltung von Trainingsläufen auf mehr als 100 GPUs (von Vorteil) • Erfahrung mit Containerisierung, Orchestrierung und Cloud-Infrastrukturen (von Vorteil) • Erfahrung auf dem Niveau von FSDP und Multi-Node-Training • Möglichkeit, remote innerhalb der EU zu arbeiten

🏖️ Vorteile

• Arbeitgeber der Chancengleichheit • Die Teilnahme an der freiwilligen Umfrage zu Vielfalt und Inklusion ist optional; eine Nichtteilnahme hat keinen Einfluss auf die Bewerbung • Möglichkeit zur Remote-Arbeit

Jetzt Bewerben

Ähnliche Jobs

🕒 vor 2 Tagen

Synthesia

501 - 1000

📣 Marketing

💼 Beratung

📦 Logistik

Research Scientist zur Entwicklung von Diffusionsmodellen für natürliche, interaktive Avatare in Echtzeit. Synthesia entwickelt KI-Videotechnologie für die geschäftliche Kommunikation und die betriebliche Kompetenzentwicklung.

🇪🇺 Europa – Remote

🔥 Finanzierung im letzten Jahr

💰 €200.000.000 Series E - Synthesia im 2025-10

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🧬 Forschungswissenschaftler

🗣️🇺🇸🇬🇧 Englisch erforderlich