
1 - 10 employés
Fondée en 2023
🤖 Intelligence artificielle
☁️ SaaS
🔌 API
Artificial Intelligence • SaaS • API
Featherless AI est un fournisseur de services d'inférence AI sans serveur et d'hébergement de modèles qui offre un accès API à un vaste catalogue de modèles à poids ouvert (plus de 12 200), permettant aux développeurs et aux entreprises de déployer, ajuster et exécuter des modèles à grande échelle sans gérer de serveurs. La société propose un tarif d'abonnement forfaitaire avec des jetons illimités, l'orchestration GPU, une utilisation privée/anonyme (sans journaux) et des options de self-hosting pour les entreprises ou des unités de mise à l'échelle pour une haute simultanéité. Featherless AI fonctionne également comme un laboratoire de recherche en intelligence artificielle axé sur la recherche open-source et post-transformateur, revendiquant des améliorations significatives en termes de coûts et de performance pour les grands modèles et agents IA.
🕒 il y a 5 mois
🗣️🇺🇸🇬🇧 Anglais requis
Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

1 - 10 employés
Fondée en 2023
🤖 Intelligence artificielle
☁️ SaaS
🔌 API
Artificial Intelligence • SaaS • API
Featherless AI est un fournisseur de services d'inférence AI sans serveur et d'hébergement de modèles qui offre un accès API à un vaste catalogue de modèles à poids ouvert (plus de 12 200), permettant aux développeurs et aux entreprises de déployer, ajuster et exécuter des modèles à grande échelle sans gérer de serveurs. La société propose un tarif d'abonnement forfaitaire avec des jetons illimités, l'orchestration GPU, une utilisation privée/anonyme (sans journaux) et des options de self-hosting pour les entreprises ou des unités de mise à l'échelle pour une haute simultanéité. Featherless AI fonctionne également comme un laboratoire de recherche en intelligence artificielle axé sur la recherche open-source et post-transformateur, revendiquant des améliorations significatives en termes de coûts et de performance pour les grands modèles et agents IA.
• Rechercher et développer des techniques pour optimiser les performances d'inférence des grands réseaux neuronaux. • Améliorer la latence, le débit (throughput), l'efficacité mémoire et le coût par inférence. • Concevoir et évaluer des optimisations au niveau modèle (quantization, pruning, optimisation du KV-cache, simplifications adaptées à l'architecture). • Implémenter des optimisations au niveau système (dynamic batching, kernel fusion, inférence multi-GPU, optimisation prefill vs decode). • Réaliser des benchmarks des charges d'inférence sur différents accélérateurs matériels. • Collaborer avec les équipes d'ingénierie pour déployer des pipelines d'inférence optimisés. • Traduire les résultats de la recherche en améliorations prêtes pour la production.
• Solide expérience en machine learning, deep learning ou systèmes d'IA. • Expérience pratique de l'optimisation de l'inférence pour des modèles à grande échelle. • Maîtrise de Python et des frameworks ML modernes (ex. PyTorch). • Expérience des outils d'inférence (ex. Triton, TensorRT, vLLM, ONNX Runtime). • Capacité à concevoir des expériences et à communiquer clairement les résultats.
• Assurance santé • Modalités de travail flexibles (télétravail possible) • Opportunités de développement professionnel
Postuler Maintenant