Ingénieur Machine Learning — Optimisation de l'inférence

Emploi pas sur LinkedIn

🕒 il y a 7 mois

🌏 N'importe où dans le monde

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🤖 Ingénieur Machine Learning

👻 Score fantôme 55%

infoinfo

🗣️🇺🇸🇬🇧 Anglais requis

Postuler Maintenant
Trouver des Emplois à Distance Similaires

📊 Vérifiez votre score de CV pour ce poste

Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

Logo of Featherless AI

Featherless AI

1 - 10 employés

Fondée en 2023

🤖 Intelligence artificielle

☁️ SaaS

🔌 API

Artificial Intelligence • SaaS • API

Featherless AI est un fournisseur de services d'inférence AI sans serveur et d'hébergement de modèles qui offre un accès API à un vaste catalogue de modèles à poids ouvert (plus de 12 200), permettant aux développeurs et aux entreprises de déployer, ajuster et exécuter des modèles à grande échelle sans gérer de serveurs. La société propose un tarif d'abonnement forfaitaire avec des jetons illimités, l'orchestration GPU, une utilisation privée/anonyme (sans journaux) et des options de self-hosting pour les entreprises ou des unités de mise à l'échelle pour une haute simultanéité. Featherless AI fonctionne également comme un laboratoire de recherche en intelligence artificielle axé sur la recherche open-source et post-transformateur, revendiquant des améliorations significatives en termes de coûts et de performance pour les grands modèles et agents IA.

Description

• Optimiser la latence, le débit et le coût d’inférence pour des modèles ML à grande échelle en production • Profiler et identifier les goulots d’étranglement des pipelines d’inférence GPU/CPU (mémoire, kernels, batching, IO) • Implémenter et ajuster des techniques telles que : • Quantization (fp16, bf16, int8, fp8) • Optimisation et réutilisation du cache KV • Décodage spéculatif, batching et streaming • Élagage de modèle (pruning) ou simplifications architecturales pour l’inférence • Collaborer avec les ingénieurs recherche pour industrialiser de nouvelles architectures de modèles • Concevoir et maintenir des systèmes de serving d’inférence (ex. Triton, runtimes personnalisés ou stacks sur-mesure) • Benchmarking des performances sur différents matériels (GPU NVIDIA / AMD, CPU) et configurations cloud • Améliorer la fiabilité du système, l’observabilité et l’efficacité des coûts sous charge réelle

🎯 Exigences

• Solide expérience en optimisation d’inférence ML ou en systèmes ML haute performance • Bonne compréhension des mécanismes internes du deep learning (attention, organisation de la mémoire, graphes de calcul) • Expérience pratique avec PyTorch (ou équivalent) et déploiement de modèles • Maîtrise de l’optimisation des performances GPU (CUDA, ROCm, Triton ou optimisations au niveau kernel) • Expérience de mise à l’échelle de l’inférence pour de vrais utilisateurs (au-delà des benchmarks de recherche) • À l’aise dans un environnement startup rapide, capable de prendre des responsabilités et de gérer l’ambiguïté • Expérience d’inférence de LLM ou de modèles à contexte long • Connaissance des frameworks d’inférence (TensorRT, ONNX Runtime, vLLM, Triton) • Expérience d’optimisation sur différents vendeurs de matériel • Contributions open source dans les systèmes ML ou les outils d’inférence • Expérience en systèmes distribués ou services à faible latence

🏖️ Avantages

• Rémunération compétitive + participation significative au capital (equity) pour une société en Series A

Postuler Maintenant