Chercheur en IA — Optimisation de l'inférence

Emploi pas sur LinkedIn

🕒 il y a 5 mois

🌏 N'importe où dans le monde

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🧠 Chercheur en IA

🗣️🇺🇸🇬🇧 Anglais requis

Postuler Maintenant
Trouver des Emplois à Distance Similaires

📊 Vérifiez votre score de CV pour ce poste

Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

Logo of Featherless AI

Featherless AI

1 - 10 employés

Fondée en 2023

🤖 Intelligence artificielle

☁️ SaaS

🔌 API

Artificial Intelligence • SaaS • API

Featherless AI est un fournisseur de services d'inférence AI sans serveur et d'hébergement de modèles qui offre un accès API à un vaste catalogue de modèles à poids ouvert (plus de 12 200), permettant aux développeurs et aux entreprises de déployer, ajuster et exécuter des modèles à grande échelle sans gérer de serveurs. La société propose un tarif d'abonnement forfaitaire avec des jetons illimités, l'orchestration GPU, une utilisation privée/anonyme (sans journaux) et des options de self-hosting pour les entreprises ou des unités de mise à l'échelle pour une haute simultanéité. Featherless AI fonctionne également comme un laboratoire de recherche en intelligence artificielle axé sur la recherche open-source et post-transformateur, revendiquant des améliorations significatives en termes de coûts et de performance pour les grands modèles et agents IA.

Description

• Rechercher et développer des techniques pour optimiser les performances d'inférence des grands réseaux neuronaux. • Améliorer la latence, le débit (throughput), l'efficacité mémoire et le coût par inférence. • Concevoir et évaluer des optimisations au niveau modèle (quantization, pruning, optimisation du KV-cache, simplifications adaptées à l'architecture). • Implémenter des optimisations au niveau système (dynamic batching, kernel fusion, inférence multi-GPU, optimisation prefill vs decode). • Réaliser des benchmarks des charges d'inférence sur différents accélérateurs matériels. • Collaborer avec les équipes d'ingénierie pour déployer des pipelines d'inférence optimisés. • Traduire les résultats de la recherche en améliorations prêtes pour la production.

🎯 Exigences

• Solide expérience en machine learning, deep learning ou systèmes d'IA. • Expérience pratique de l'optimisation de l'inférence pour des modèles à grande échelle. • Maîtrise de Python et des frameworks ML modernes (ex. PyTorch). • Expérience des outils d'inférence (ex. Triton, TensorRT, vLLM, ONNX Runtime). • Capacité à concevoir des expériences et à communiquer clairement les résultats.

🏖️ Avantages

• Assurance santé • Modalités de travail flexibles (télétravail possible) • Opportunités de développement professionnel

Postuler Maintenant