Machine-Learning-Ingenieur – Inferenzoptimierung

Stelle nicht auf LinkedIn

🕒 vor 6 Monaten

🌏 Überall auf der Welt

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🤖 Machine-Learning-Entwickler

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of Featherless AI

Featherless AI

1 - 10 Mitarbeiter

Gegründet 2023

🤖 Künstliche Intelligenz

☁️ SaaS

🔌 API

Artificial Intelligence • SaaS • API

Featherless AI ist ein Anbieter von serverlosen KI-Inferenz- und Modell-Hosting-Diensten, der API-Zugriff auf einen umfangreichen und wachsenden Katalog von Open-Weight-Modellen (12. 200+) bietet. Dadurch können Entwickler und Unternehmen Modelle in großem Maßstab einsetzen, anpassen und betreiben, ohne Server verwalten zu müssen. Das Unternehmen bietet eine pauschale Abonnementgebühr mit unbegrenzten Token, GPU-Orchestrierung, private/anonyme Nutzung (keine Protokolle) und Optionen für das unternehmensinterne Hosting oder Scale-Einheiten für hohe Parallelität. Featherless AI agiert auch als Forschungslabor für KI mit Fokus auf Open-Source- und Post-Transformer-Modellforschung und beansprucht signifikante Kosten- und Leistungsverbesserungen für große Modelle und KI-Agenten.

Beschreibung

• Optimierung von Inferenz-Latenz, Durchsatz und Kosten für großskalige ML-Modelle in Produktion • Profiling und Engpassanalyse von GPU-/CPU-Inferenz-Pipelines (Speicher, Kernel, Batching, I/O) • Implementierung und Feinabstimmung von Techniken wie: • Quantisierung (fp16, bf16, int8, fp8) • KV-Cache-Optimierung und Wiederverwendung • Spekulative Decodierung, Batching und Streaming • Modell-Pruning oder architektonische Vereinfachungen für die Inferenz • Zusammenarbeit mit Research Engineers, um neue Modellarchitekturen produktiv zu machen • Aufbau und Wartung von Inferenz-Serving-Systemen (z. B. Triton, eigene Runtimes oder maßgeschneiderte Stacks) • Performance-Benchmarking über verschiedene Hardware (NVIDIA/AMD GPUs, CPUs) und Cloud-Konfigurationen • Verbesserung von Systemzuverlässigkeit, Observability und Kosteneffizienz unter realen Workloads

🎯 Anforderungen

• Fundierte Erfahrung in der Optimierung von ML-Inferenz oder in hochperformanten ML-Systemen • Solides Verständnis von Deep-Learning-Interna (Attention, Speicher-Layout, Rechengraphen) • Praktische Erfahrung mit PyTorch (oder ähnlichen Frameworks) und dem Deployment von Modellen • Vertrautheit mit GPU-Performance-Tuning (CUDA, ROCm, Triton oder kernelnahe Optimierungen) • Erfahrung bei der Skalierung von Inferenz für reale Nutzer (nicht nur Forschungsbenchmarks) • Sicheres Arbeiten in schnelllebigen Startup-Umgebungen mit hoher Eigenverantwortung und Umgang mit Unklarheiten • Erfahrung mit LLM- oder Langkontext-Modell-Inferenz • Kenntnisse von Inferenz-Frameworks (TensorRT, ONNX Runtime, vLLM, Triton) • Erfahrung in der Optimierung über verschiedene Hardware-Anbieter hinweg • Beiträge zu Open-Source-Projekten im Bereich ML-Systeme oder Inferenz-Tooling • Hintergrund in verteilten Systemen oder latenzkritischen Services

🏖️ Vorteile

• Wettbewerbsfähige Vergütung und nennenswerte Equity bei Series A

Jetzt Bewerben

Ähnliche Jobs

🕒 vor 11 Monaten

GoML

51 - 200

🤖 Künstliche Intelligenz

🤝 B2B

💊 Pharmazie

Technischer Architekt, spezialisiert auf AWS- und AI-Lösungen für Kundenprojekte von Neuralgo Software. Leitung von Architekturdesign und funktionsübergreifender Zusammenarbeit zur Umsetzung skalierbarer, cloudbasierter Systeme.

🌏 Überall auf der Welt

⏰ Vollzeit

🟠 Senior

🔴 Experte

🤖 Machine-Learning-Entwickler

🗣️🇺🇸🇬🇧 Englisch erforderlich