
11 - 50 employés
Fondée en 2025
🤖 Intelligence artificielle
🤝 B2B
🏢 Entreprise
Artificial Intelligence • B2B • Enterprise
Inferact est une startup fondée par les créateurs et principaux mainteneurs de vLLM, le moteur d'inférence LLM open-source le plus avancé. L'entreprise vise à accélérer le progrès de l'IA en rendant l'inférence des modèles moins coûteuse et plus rapide, en augmentant les performances de vLLM et en soutenant les nouvelles architectures et les matériels accélérateurs. Inferact combine une expertise approfondie à l'intersection des modèles et du matériel pour fournir une infrastructure d'inférence utilisée par des laboratoires de recherche, des hyperscalers et des startups, tout en continuant à développer et à contribuer des optimisations à la communauté open-source.
🔥 il y a quelques secondes
🗣️🇺🇸🇬🇧 Anglais requis
Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

11 - 50 employés
Fondée en 2025
🤖 Intelligence artificielle
🤝 B2B
🏢 Entreprise
Artificial Intelligence • B2B • Enterprise
Inferact est une startup fondée par les créateurs et principaux mainteneurs de vLLM, le moteur d'inférence LLM open-source le plus avancé. L'entreprise vise à accélérer le progrès de l'IA en rendant l'inférence des modèles moins coûteuse et plus rapide, en augmentant les performances de vLLM et en soutenant les nouvelles architectures et les matériels accélérateurs. Inferact combine une expertise approfondie à l'intersection des modèles et du matériel pour fournir une infrastructure d'inférence utilisée par des laboratoires de recherche, des hyperscalers et des startups, tout en continuant à développer et à contribuer des optimisations à la communauté open-source.
• Repousser les limites du serving des LLM et des modèles de diffusion • Travailler au cœur de vLLM afin d’optimiser l’exécution des modèles sur des matériels et des architectures variés • Développer des innovations liées aux runtimes d’inférence pour les architectures mixture-of-experts, multimodales et agentiques • Implémenter des techniques d’inférence et des architectures de modèles issues d’articles de recherche • Contribuer à un code performant et maintenable • Déboguer des codebases complexes de machine learning • Améliorer directement l’exécution de l’inférence des modèles d’IA en la rendant moins coûteuse et plus rapide
• Diplôme de niveau licence (Bac+3) ou expérience équivalente en informatique, ingénierie ou domaine similaire • Compréhension approfondie des architectures Transformer et de leurs variantes • Solides compétences en programmation Python et expérience des composants internes de PyTorch • Expérience des systèmes d’inférence de LLM tels que vLLM, TensorRT-LLM, SGLang ou TGI • Capacité à lire et à implémenter des architectures de modèles et des techniques d’inférence présentées dans des articles de recherche • Capacité à contribuer à un code performant et maintenable et à déboguer des codebases ML complexes • Atout : compréhension approfondie de la gestion mémoire du KV-cache, du prefix caching et du serving hybride des modèles • Atout : connaissance des frameworks et algorithmes de RL pour les LLM • Atout : expérience de l’inférence multimodale couvrant l’audio, l’image, la vidéo et le texte • Les contributions à des projets open source de ML ou d’infrastructure système sont appréciées • Bonus : implémentation de fonctionnalités essentielles dans vLLM ou d’autres projets de moteurs d’inférence • Bonus : contributions à des intégrations de vLLM telles que verl, OpenRLHF, Unsloth ou LlamaFactory • Bonus : blogs techniques largement partagés ou projets personnels consacrés à vLLM ou à l’inférence des LLM • Éléments requis pour candidater : CV, identifiant GitHub et lien vers un projet personnel pertinent, une contribution open source ou un article de blog technique
• Package d’avantages compétitif, adapté à votre lieu de résidence, incluant une couverture santé lorsque celle-ci est applicable • Participation au capital • Prise en charge des démarches de visa au cas par cas • Poste entièrement en télétravail • Horaires flexibles selon le fuseau horaire, avec des plages de chevauchement régulières avec l’heure du Pacifique pour les réunions de synchronisation essentielles
Postuler Maintenant🕒 il y a 15 jours
Responsable de la livraison améliorant la prévisibilité, la qualité et la visibilité des équipes d'ingénierie externes. Progress Partners conçoit des plateformes SaaS et mobiles utilisées dans le monde entier.
🗣️🇺🇸🇬🇧 Anglais requis
🕒 il y a 1 mois
Ingénieur en productivité des développeurs chez Supabase : amélioration des workflows de développement local et optimisation des processus d'ingénierie. Mise en avant de la productivité des développeurs via des outils assistés par IA et des systèmes CI.
🌏 N'importe où dans le monde
💰 €80 000 000 Series B en 2022-05
⏰ Temps Plein
🟠 Senior
🔴 Expert
🖥 Ingénieur Logiciel
🗣️🇺🇸🇬🇧 Anglais requis
🕒 il y a 3 mois
Ingénieur en charge de l'évolution d'OrioleDB et de la collaboration avec la communauté PostgreSQL chez Supabase. Concevoir et implémenter de nouvelles fonctionnalités de base de données et garantir la fiabilité du système.
🌏 N'importe où dans le monde
💰 €80 000 000 Series B en 2022-05
⏰ Temps Plein
🟠 Senior
🔴 Expert
🖥 Ingénieur Logiciel
🗣️🇺🇸🇬🇧 Anglais requis
🕒 il y a 5 mois
VP Engineering responsable de la vision technologique et de la stratégie chez ClosedWon, entreprise de coaching commercial par IA. Collaborer avec la direction pour conduire et mettre en œuvre des solutions innovantes.
🗣️🇺🇸🇬🇧 Anglais requis