Wissenschaftliche Fachkraft / Engineer – Performance-Optimierung

Stelle nicht auf LinkedIn

🔥 vor 2 Stunden

🇪🇺 Europa – Remote

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🧬 Forschungswissenschaftler

👻 Geisterscore 12%

infoinfo

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of Luma AI

Luma AI

2 - 10 Mitarbeiter

🤖 Künstliche Intelligenz

☁️ SaaS

📱 Medien

💰 €90.000.000 Series B im 2025-01

Artificial Intelligence • SaaS • Media

Luma AI ist ein in Palo Alto ansässiges Unternehmen, das multimodale generative KI-Modelle und kreative Workflow-Tools entwickelt, die sich auf die Produktion von Video, Bild, Audio und Text konzentrieren. Luma bietet Modelle und Produkte wie Ray (Videogenerierung), UNI-1/Uni-1. 1 (Markenintelligenzmodelle) und eine API/Unternehmenslösungen, die es kreativen Teams ermöglichen, cineastische Qualitätsassets mit Markenanpassung zu erzeugen, zu bearbeiten und zu steuern. Sie legen Wert auf Pionierforschung (Open Physical AI Lab), interne Modellentwicklung und Produkte für kreative Teams, Agenturen und Produktionsservices. Luma bietet zudem APIs, Unternehmenspläne, ein kreatives Partnerprogramm und Lernressourcen an.

Beschreibung

• GPU-, CPU- und Accelerator-Code profilieren und optimieren, um eine maximale Auslastung und minimale Latenz zu erreichen • Hochperformanten Code mit PyTorch, Triton und CUDA schreiben, bei Bedarf einschließlich eigener Operationen • Fused Kernels entwickeln sowie Tensor Cores und moderne Hardwarefunktionen plattformübergreifend nutzen • Modellarchitekturen und Implementierungen für die verteilte Produktion auf mehreren Knoten optimieren • Tools und Automatisierungen zur Performance-Überwachung und -Analyse entwickeln • Modernste Optimierungstechniken für Transformer-Modelle erforschen und implementieren • In den ersten 30 Tagen die aktuellen Trainings- und Inferenzpfade profilieren • Zwischen dem 30. und 60. Tag eine Kernel- oder Architekturoptimierung produktiv bereitstellen und validieren • Zwischen dem 60. und 90. Tag Monitoring und Automatisierung zur Vermeidung von Performance-Regressionen entwickeln

🎯 Anforderungen

• Expertenkenntnisse in der Programmierung mit Triton/CUDA und der GPU-Optimierung • Sehr gute Kenntnisse in PyTorch, einschließlich Kernel-Entwicklung und eigener Operationen • Sicherer Umgang mit Profiling-Tools, einschließlich NVIDIA Nsight, Torch Profiler und eigener Tools • Tiefgreifendes Verständnis von Transformer-Architekturen und Attention-Mechanismen • Erfahrung mit Compilern und Exportern wie torch.compile, TensorRT, ONNX oder XLA (von Vorteil) • Erfahrung mit der Optimierung von Inferenz-Workloads hinsichtlich Latenz und Durchsatz (von Vorteil) • Kenntnisse des Triton-Compilers und von Techniken zur Kernel-Fusion (von Vorteil) • Kenntnisse von Warp-Level-Intrinsics und fortgeschrittener CUDA-Optimierung (von Vorteil)

🏖️ Vorteile

• Arbeitgeber der Chancengleichheit • Die Teilnahme an einer freiwilligen Umfrage zu Vielfalt und Inklusion ist möglich; eine Nichtteilnahme hat keinen Einfluss auf die Bewerbung

Jetzt Bewerben

Ähnliche Jobs

🕒 vor 2 Tagen

Synthesia

501 - 1000

📣 Marketing

💼 Beratung

📦 Logistik

Research Scientist zur Entwicklung von Diffusionsmodellen für natürliche, interaktive Avatare in Echtzeit. Synthesia entwickelt KI-Videotechnologie für die geschäftliche Kommunikation und die betriebliche Kompetenzentwicklung.

🇪🇺 Europa – Remote

🔥 Finanzierung im letzten Jahr

💰 €200.000.000 Series E - Synthesia im 2025-10

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🧬 Forschungswissenschaftler

🗣️🇺🇸🇬🇧 Englisch erforderlich