Senior Machine-Learning-Engineer (m/w/d) – Optimierung der LLM-Inferenz

Stelle nicht auf LinkedIn

🔥 vor 21 Stunden

🇪🇺 Europa – Remote

⏰ Vollzeit

🟠 Senior

🗣️ LLM-Entwickler

👻 Geisterscore 25%

infoinfo

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of Nebius Group

Nebius Group

1001 - 5000 Mitarbeiter

🤖 Künstliche Intelligenz

🏢 Unternehmen

☁️ SaaS

Artificial Intelligence • Enterprise • SaaS

Die Nebius Group baut eines der weltweit führenden Unternehmen für KI-Infrastruktur auf und konzentriert sich darauf, die notwendige Rechenleistung, Speicherkapazität und Tools für Entwickler im KI-Bereich bereitzustellen. Mit Sitz in Europa und an der Nasdaq notiert verfügt Nebius über eine globale Präsenz mit F&E-Zentren in Europa, Nordamerika und Israel. Das zentrale Angebot des Unternehmens ist eine KI-zentrierte Cloud-Plattform, die für rechenintensive KI-Workloads ausgelegt ist, ergänzt durch verschiedene weitere Geschäftsbereiche in den Bereichen Generative KI, Edtech und autonome Technologien.

Beschreibung

• Verantwortung für die Optimierung bestimmter Modellfamilien, Kundenendpunkte oder Serving-Backends • Vergleich von Engines und Empfehlung praxisnaher Serving-Konfigurationen für spezifische Workloads • Analyse und Behebung von Regressionen bei Modellqualität oder Performance während Produktiv-Rollouts • Optimierung von LLM- und VLM-Endpunkten hinsichtlich Latenz, Durchsatz, Speichereffizienz, GPU-Auslastung, Qualität und Kosten pro Token • Bereitstellung, Konfiguration, Benchmarking und Erweiterung von Inference-Engines wie vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo oder vergleichbaren Systemen • Entwicklung und Überführung von Workflows zur Modellkomprimierung in den Produktivbetrieb, einschließlich Quantisierung, quantisierungsbewusstem Training, Distillation, Low-Bit-Serving und Wiederherstellung der Modellgenauigkeit • Implementierung oder Integration von Speculative Decoding, Draft-Model-Ansätzen, KV-Cache-Optimierung, Prefix-Caching, Chunked Prefill, Continuous Batching und entkoppeltem Prefill-/Decode-Serving • Entwicklung reproduzierbarer Benchmark-Harnesses für TTFT, TPOT, Tokens pro Sekunde je GPU, p95-/p99-Latenz, GPU-Speicher, Zuverlässigkeit und Kosten pro Token • Zusammenarbeit mit GPU-Kernel- und Platform-Engineers zur Diagnose von Engpässen über Modellcode-, Kernel-, Runtime-, Scheduler-, Gateway- und Clusterebenen hinweg • Verfassen klarer Design-Dokumente, Performance-Berichte, Rollout-Pläne und technischer Erläuterungen für Kunden

🎯 Anforderungen

• Sehr gute Kenntnisse in Python und PyTorch • Praktische Erfahrung mit der Bereitstellung oder Optimierung von LLM-, VLM- oder hochdurchsatzfähigen Transformer-Inferenzsystemen • Praxiskenntnisse in mindestens einem modernen Inference-Stack wie vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe oder vergleichbaren internen Systemen • Ausgeprägtes Verständnis der Engpässe bei der Transformer-Inferenz, einschließlich KV-Cache, Attention, Speicherbandbreite, Batching, Parallelisierung und Serving langer Kontexte • Fähigkeit, Latenz, Durchsatz, Qualität, Auslastung und Kosten sowie deren Zielkonflikte quantitativ zu bewerten • Sehr gute Kommunikationsfähigkeiten und Freude an der Zusammenarbeit mit Research-, Kernel-, Infrastruktur-, Produkt- und Kundenteams • Erfahrung mit quantisierungsbewusstem Training, Post-Training-Quantisierung, FP8, INT8, INT4, NVFP4, MXFP4, AWQ, GPTQ, SmoothQuant oder verwandten Techniken • Erfahrung mit Distillation, Speculative Decoding, EAGLE, Medusa, Multi-Token-Prediction oder anderen Methoden zur Inferenzbeschleunigung • Erfahrung mit agentischen Workloads, einschließlich Tool Calling, strukturierten Ausgaben, Streaming-APIs, hoher Nebenläufigkeit und mehrstufiger Orchestrierung • Kenntnisse in CUDA oder Triton • Beiträge zu Open-Source-Projekten wie vLLM, SGLang, TensorRT-LLM, FlashInfer, LMCache, PyTorch, Triton, Ray, KServe oder verwandten Projekten

🏖️ Vorteile

• Attraktive Vergütung • Möglichkeiten zur beruflichen Weiterentwicklung und zum Lernen • Flexibilität und eigener Gestaltungsspielraum • Kollegiale und innovative Unternehmenskultur • Möglichkeit, an wirkungsvollen KI-Projekten zu arbeiten • Internationales Umfeld und talentierte Teams

Jetzt Bewerben

Ähnliche Jobs

🕒 vor 2 Monaten

CrackenAGI

11 - 50

🔒 Cybersecurity

🤖 Künstliche Intelligenz

☁️ SaaS

Fullstack Engineer mit Schwerpunkt Generative AI, der eine proaktive Cyber-Plattform entwickelt. Zusammenarbeit mit erstklassigen Expert:innen in einem vollständig remote organisierten Umfeld.

🇪🇺 Europa – Remote

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🗣️ LLM-Entwickler

🗣️🇺🇸🇬🇧 Englisch erforderlich

Cyber Security

Python