Wissenschaftliche Mitarbeiterin / Wissenschaftlicher Mitarbeiter oder Ingenieurin / Ingenieur – Infrastruktur für Reinforcement Learning

🔥 vor 12 Stunden

🇪🇺 Europa – Remote

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🧬 Forschungswissenschaftler

👻 Geisterscore 12%

infoinfo

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of Luma AI

Luma AI

2 - 10 Mitarbeiter

🤖 Künstliche Intelligenz

☁️ SaaS

📱 Medien

💰 €90.000.000 Series B im 2025-01

Artificial Intelligence • SaaS • Media

Luma AI ist ein in Palo Alto ansässiges Unternehmen, das multimodale generative KI-Modelle und kreative Workflow-Tools entwickelt, die sich auf die Produktion von Video, Bild, Audio und Text konzentrieren. Luma bietet Modelle und Produkte wie Ray (Videogenerierung), UNI-1/Uni-1. 1 (Markenintelligenzmodelle) und eine API/Unternehmenslösungen, die es kreativen Teams ermöglichen, cineastische Qualitätsassets mit Markenanpassung zu erzeugen, zu bearbeiten und zu steuern. Sie legen Wert auf Pionierforschung (Open Physical AI Lab), interne Modellentwicklung und Produkte für kreative Teams, Agenturen und Produktionsservices. Luma bietet zudem APIs, Unternehmenspläne, ein kreatives Partnerprogramm und Lernressourcen an.

Beschreibung

• Entwicklung, Aufbau und Skalierung verteilter RL-Post-Training-Systeme über Tausende von GPUs hinweg • Aufbau von Rollout-Generierung mit hohem Durchsatz unter Integration von vLLM, SGLang, Gewichtssynchronisierung sowie asynchronen und Off-Policy-Verfahren • Entwicklung skalierbarer RL-Umgebungen für agentenbasierte, mehrstufige Aufgaben einschließlich sandboxed Codeausführung, Tool-Nutzung, Computernutzung und multimodaler Interaktion • Aufbau einer Reward-Infrastruktur einschließlich verifizierbarer und programmatischer Rewards, Bereitstellung von Reward-Modellen, LLM-as-a-Judge-Pipelines und Schutzmaßnahmen gegen Reward Hacking • Entwicklung von Tools für Evaluation, Monitoring und Debugging stabiler RL-Läufe im großen Maßstab • Verbesserung von Trainingseffizienz und -stabilität sowie gemeinsame Überführung von Post-Training-Ideen mit Forschenden in produktive Trainingsläufe • Einarbeitung in den aktuellen RL-Stack, Diagnose von Engpässen, Entwicklung und Validierung von Verbesserungen sowie Absicherung des gesamten Prozesses über Tausende von GPUs hinweg

🎯 Anforderungen

• Praktische Erfahrung beim Post-Training von LLMs mit RL (PPO-/GRPO-Familie, RLHF, RLVR) in relevantem Maßstab • Umfassende Erfahrung mit verteiltem PyTorch-Training und Parallelisierungsverfahren (FSDP, Tensor-, Pipeline- und Expert-Parallelism) für Foundation Models • Erfahrung beim Aufbau von RL-Umgebungen, Reward-Funktionen, Verifikatoren oder Evaluations-Frameworks für LLM-Agenten, einschließlich sandboxed Ausführung und mehrstufiger Tool-Nutzung • Fundierte Kenntnisse von RL-Post-Training-Frameworks (veRL, OpenRLHF, TRL, Ray-Orchestrierung) und Rollout-Inferenz-Engines (vLLM, SGLang) • Ausgeprägtes Verständnis von GPU-Clustern, Netzwerken und Kommunikationsbibliotheken (NCCL, MPI) bei gemischten Trainings- und Inferenz-Workloads • Erfahrung mit Containerisierung und Orchestrierung (Kubernetes, Ray) für große Flotten von Umgebungen und sandboxed Workloads • Forschungsbeiträge im Bereich RL für LLMs oder Open-Source-Beiträge zu RL-Trainings-Frameworks

🏖️ Vorteile

• Arbeitgeber der Chancengleichheit • Flexible Möglichkeit zur Remote-Arbeit innerhalb der EU

Jetzt Bewerben

Ähnliche Jobs

🕒 vor 2 Tagen

Synthesia

501 - 1000

📣 Marketing

💼 Beratung

📦 Logistik

Research Scientist zur Entwicklung von Diffusionsmodellen für natürliche, interaktive Avatare in Echtzeit. Synthesia entwickelt KI-Videotechnologie für die geschäftliche Kommunikation und die betriebliche Kompetenzentwicklung.

🇪🇺 Europa – Remote

🔥 Finanzierung im letzten Jahr

💰 €200.000.000 Series E - Synthesia im 2025-10

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🧬 Forschungswissenschaftler

🗣️🇺🇸🇬🇧 Englisch erforderlich