Ingénieur Machine Learning — Optimisation de l'inférence

Emploi pas sur LinkedIn

🕒 il y a 6 mois

🌏 N'importe où dans le monde

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🤖 Ingénieur Machine Learning

🗣️🇺🇸🇬🇧 Anglais requis

Postuler Maintenant
Trouver des Emplois à Distance Similaires

📊 Vérifiez votre score de CV pour ce poste

Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

Logo of Featherless AI

Featherless AI

1 - 10 employés

Fondée en 2023

🤖 Intelligence artificielle

☁️ SaaS

🔌 API

Artificial Intelligence • SaaS • API

Featherless AI est un fournisseur de services d'inférence AI sans serveur et d'hébergement de modèles qui offre un accès API à un vaste catalogue de modèles à poids ouvert (plus de 12 200), permettant aux développeurs et aux entreprises de déployer, ajuster et exécuter des modèles à grande échelle sans gérer de serveurs. La société propose un tarif d'abonnement forfaitaire avec des jetons illimités, l'orchestration GPU, une utilisation privée/anonyme (sans journaux) et des options de self-hosting pour les entreprises ou des unités de mise à l'échelle pour une haute simultanéité. Featherless AI fonctionne également comme un laboratoire de recherche en intelligence artificielle axé sur la recherche open-source et post-transformateur, revendiquant des améliorations significatives en termes de coûts et de performance pour les grands modèles et agents IA.

Description

• Optimiser la latence, le débit et le coût d’inférence pour des modèles ML à grande échelle en production • Profiler et identifier les goulots d’étranglement des pipelines d’inférence GPU/CPU (mémoire, kernels, batching, IO) • Implémenter et ajuster des techniques telles que : • Quantization (fp16, bf16, int8, fp8) • Optimisation et réutilisation du cache KV • Décodage spéculatif, batching et streaming • Élagage de modèle (pruning) ou simplifications architecturales pour l’inférence • Collaborer avec les ingénieurs recherche pour industrialiser de nouvelles architectures de modèles • Concevoir et maintenir des systèmes de serving d’inférence (ex. Triton, runtimes personnalisés ou stacks sur-mesure) • Benchmarking des performances sur différents matériels (GPU NVIDIA / AMD, CPU) et configurations cloud • Améliorer la fiabilité du système, l’observabilité et l’efficacité des coûts sous charge réelle

🎯 Exigences

• Solide expérience en optimisation d’inférence ML ou en systèmes ML haute performance • Bonne compréhension des mécanismes internes du deep learning (attention, organisation de la mémoire, graphes de calcul) • Expérience pratique avec PyTorch (ou équivalent) et déploiement de modèles • Maîtrise de l’optimisation des performances GPU (CUDA, ROCm, Triton ou optimisations au niveau kernel) • Expérience de mise à l’échelle de l’inférence pour de vrais utilisateurs (au-delà des benchmarks de recherche) • À l’aise dans un environnement startup rapide, capable de prendre des responsabilités et de gérer l’ambiguïté • Expérience d’inférence de LLM ou de modèles à contexte long • Connaissance des frameworks d’inférence (TensorRT, ONNX Runtime, vLLM, Triton) • Expérience d’optimisation sur différents vendeurs de matériel • Contributions open source dans les systèmes ML ou les outils d’inférence • Expérience en systèmes distribués ou services à faible latence

🏖️ Avantages

• Rémunération compétitive + participation significative au capital (equity) pour une société en Series A

Postuler Maintenant

Emplois Similaires

🕒 il y a 11 mois

GoML

51 - 200

🤖 Intelligence artificielle

🤝 B2B

💊 Pharmaceutique

Architecte technique spécialisé dans les solutions AWS et AI pour les missions clients de Neuralgo Software. Responsable de la conception d'architectures et de la collaboration transversale pour des systèmes cloud évolutifs.

🌏 N'importe où dans le monde

⏰ Temps Plein

🟠 Senior

🔴 Expert

🤖 Ingénieur Machine Learning

🗣️🇺🇸🇬🇧 Anglais requis