
1001 - 5000 Mitarbeiter
🤖 Künstliche Intelligenz
🏢 Unternehmen
☁️ SaaS
Artificial Intelligence • Enterprise • SaaS
Die Nebius Group baut eines der weltweit führenden Unternehmen für KI-Infrastruktur auf und konzentriert sich darauf, die notwendige Rechenleistung, Speicherkapazität und Tools für Entwickler im KI-Bereich bereitzustellen. Mit Sitz in Europa und an der Nasdaq notiert verfügt Nebius über eine globale Präsenz mit F&E-Zentren in Europa, Nordamerika und Israel. Das zentrale Angebot des Unternehmens ist eine KI-zentrierte Cloud-Plattform, die für rechenintensive KI-Workloads ausgelegt ist, ergänzt durch verschiedene weitere Geschäftsbereiche in den Bereichen Generative KI, Edtech und autonome Technologien.
🔥 vor 21 Stunden
🗣️🇺🇸🇬🇧 Englisch erforderlich
Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

1001 - 5000 Mitarbeiter
🤖 Künstliche Intelligenz
🏢 Unternehmen
☁️ SaaS
Artificial Intelligence • Enterprise • SaaS
Die Nebius Group baut eines der weltweit führenden Unternehmen für KI-Infrastruktur auf und konzentriert sich darauf, die notwendige Rechenleistung, Speicherkapazität und Tools für Entwickler im KI-Bereich bereitzustellen. Mit Sitz in Europa und an der Nasdaq notiert verfügt Nebius über eine globale Präsenz mit F&E-Zentren in Europa, Nordamerika und Israel. Das zentrale Angebot des Unternehmens ist eine KI-zentrierte Cloud-Plattform, die für rechenintensive KI-Workloads ausgelegt ist, ergänzt durch verschiedene weitere Geschäftsbereiche in den Bereichen Generative KI, Edtech und autonome Technologien.
• Verantwortung für die Optimierung bestimmter Modellfamilien, Kundenendpunkte oder Serving-Backends • Vergleich von Engines und Empfehlung praxisnaher Serving-Konfigurationen für spezifische Workloads • Analyse und Behebung von Regressionen bei Modellqualität oder Performance während Produktiv-Rollouts • Optimierung von LLM- und VLM-Endpunkten hinsichtlich Latenz, Durchsatz, Speichereffizienz, GPU-Auslastung, Qualität und Kosten pro Token • Bereitstellung, Konfiguration, Benchmarking und Erweiterung von Inference-Engines wie vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo oder vergleichbaren Systemen • Entwicklung und Überführung von Workflows zur Modellkomprimierung in den Produktivbetrieb, einschließlich Quantisierung, quantisierungsbewusstem Training, Distillation, Low-Bit-Serving und Wiederherstellung der Modellgenauigkeit • Implementierung oder Integration von Speculative Decoding, Draft-Model-Ansätzen, KV-Cache-Optimierung, Prefix-Caching, Chunked Prefill, Continuous Batching und entkoppeltem Prefill-/Decode-Serving • Entwicklung reproduzierbarer Benchmark-Harnesses für TTFT, TPOT, Tokens pro Sekunde je GPU, p95-/p99-Latenz, GPU-Speicher, Zuverlässigkeit und Kosten pro Token • Zusammenarbeit mit GPU-Kernel- und Platform-Engineers zur Diagnose von Engpässen über Modellcode-, Kernel-, Runtime-, Scheduler-, Gateway- und Clusterebenen hinweg • Verfassen klarer Design-Dokumente, Performance-Berichte, Rollout-Pläne und technischer Erläuterungen für Kunden
• Sehr gute Kenntnisse in Python und PyTorch • Praktische Erfahrung mit der Bereitstellung oder Optimierung von LLM-, VLM- oder hochdurchsatzfähigen Transformer-Inferenzsystemen • Praxiskenntnisse in mindestens einem modernen Inference-Stack wie vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe oder vergleichbaren internen Systemen • Ausgeprägtes Verständnis der Engpässe bei der Transformer-Inferenz, einschließlich KV-Cache, Attention, Speicherbandbreite, Batching, Parallelisierung und Serving langer Kontexte • Fähigkeit, Latenz, Durchsatz, Qualität, Auslastung und Kosten sowie deren Zielkonflikte quantitativ zu bewerten • Sehr gute Kommunikationsfähigkeiten und Freude an der Zusammenarbeit mit Research-, Kernel-, Infrastruktur-, Produkt- und Kundenteams • Erfahrung mit quantisierungsbewusstem Training, Post-Training-Quantisierung, FP8, INT8, INT4, NVFP4, MXFP4, AWQ, GPTQ, SmoothQuant oder verwandten Techniken • Erfahrung mit Distillation, Speculative Decoding, EAGLE, Medusa, Multi-Token-Prediction oder anderen Methoden zur Inferenzbeschleunigung • Erfahrung mit agentischen Workloads, einschließlich Tool Calling, strukturierten Ausgaben, Streaming-APIs, hoher Nebenläufigkeit und mehrstufiger Orchestrierung • Kenntnisse in CUDA oder Triton • Beiträge zu Open-Source-Projekten wie vLLM, SGLang, TensorRT-LLM, FlashInfer, LMCache, PyTorch, Triton, Ray, KServe oder verwandten Projekten
• Attraktive Vergütung • Möglichkeiten zur beruflichen Weiterentwicklung und zum Lernen • Flexibilität und eigener Gestaltungsspielraum • Kollegiale und innovative Unternehmenskultur • Möglichkeit, an wirkungsvollen KI-Projekten zu arbeiten • Internationales Umfeld und talentierte Teams
Jetzt Bewerben🕒 vor 2 Monaten
Fullstack Engineer mit Schwerpunkt Generative AI, der eine proaktive Cyber-Plattform entwickelt. Zusammenarbeit mit erstklassigen Expert:innen in einem vollständig remote organisierten Umfeld.
🗣️🇺🇸🇬🇧 Englisch erforderlich
Cyber Security
Python