Membre du personnel technique — Généraliste d'exception (Télétravail mondial)

🕒 il y a 4 mois

🌏 N'importe où dans le monde

⏰ Temps Plein

🔴 Expert

🖥 Ingénieur Logiciel

🗣️🇺🇸🇬🇧 Anglais requis

Postuler Maintenant
Trouver des Emplois à Distance Similaires

📊 Vérifiez votre score de CV pour ce poste

Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

Logo of Inferact

Inferact

11 - 50 employés

Fondée en 2025

🤖 Intelligence artificielle

🤝 B2B

🏢 Entreprise

Artificial Intelligence • B2B • Enterprise

Inferact est une startup fondée par les créateurs et principaux mainteneurs de vLLM, le moteur d'inférence LLM open-source le plus avancé. L'entreprise vise à accélérer le progrès de l'IA en rendant l'inférence des modèles moins coûteuse et plus rapide, en augmentant les performances de vLLM et en soutenant les nouvelles architectures et les matériels accélérateurs. Inferact combine une expertise approfondie à l'intersection des modèles et du matériel pour fournir une infrastructure d'inférence utilisée par des laboratoires de recherche, des hyperscalers et des startups, tout en continuant à développer et à contribuer des optimisations à la communauté open-source.

Description

• Poste entièrement en télétravail à l’échelle mondiale. • Nous recherchons des ingénieurs généralistes d’exception capables d’intervenir sur l’ensemble de la pile vLLM : des kernels bas niveau pour GPU jusqu’aux systèmes distribués de haut niveau. • Ce poste s’adresse à des personnes autonomes et autodirigées, capables d’identifier les problèmes à fort levier et de les résoudre de bout en bout sans supervision constante. • Vous travaillerez de manière asynchrone avec notre siège social à San Francisco tout en gardant la pleine responsabilité d’infrastructures critiques. • Une semaine vous pourrez optimiser des kernels CUDA, la suivante concevoir des systèmes d’orchestration distribuée, puis implémenter de nouvelles architectures de modèles. • Le travail que vous ferez influera directement sur la manière dont le monde exécute l’inférence IA. • Domaines d’intervention possibles : • - Inference Runtime : Repousser les limites du serving pour les LLM et les modèles de diffusion. • - Kernel Engineering : Développer les kernels bas niveau et leurs optimisations. • - Performance & Scalabilité : Concevoir des systèmes distribués qui alimentent l’inférence à l’échelle mondiale. • - Cloud Orchestration : Construire l’ossature opérationnelle pour la gestion de clusters, l’automatisation des déploiements et le monitoring en production.

🎯 Exigences

• Diplôme de niveau licence (Bachelor) ou expérience équivalente en informatique, ingénierie ou discipline similaire. • Capacité démontrée à travailler de manière autonome et à mener des projets à terme sans supervision rapprochée. • Excellentes compétences en communication asynchrone et aptitude à collaborer efficacement à travers différents fuseaux horaires. • Solide expérience de livraison de travaux à fort impact dans des environnements techniques complexes. • Expertise approfondie dans au moins un des domaines suivants : programmation système, programmation GPU/accélérateurs, systèmes distribués ou infrastructure ML. • Profondeur technique (compétences solides dans au moins deux des domaines suivants) : • - Kernels CUDA ou équivalents (Triton, TileLang, Pallas) avec compréhension approfondie de l’architecture GPU. • - Systèmes distribués haute performance en Rust, Go ou C++. • - Python avec connaissance des internals de PyTorch et des systèmes d’inférence pour LLM (vLLM, TensorRT-LLM, SGLang). • - Kubernetes, orchestration de conteneurs et infrastructure-as-code à grande échelle. • - Architectures Transformer, gestion de la mémoire KV-cache et serving de modèles. • Qualifications préférées : • - Contributions à vLLM ou à d’autres projets open source majeurs en ML/systèmes. • - Expérience avec plusieurs plateformes d’accélérateurs (NVIDIA, AMD, TPU, Intel). • - Connaissance des techniques de quantification, d’optimisation de kernels spécifiques au ML ou des technologies de compilateur. • - Antécédents d’amélioration de la fiabilité et des performances système à grande échelle. • - Production de blogs techniques largement diffusés ou projets annexes impactants dans le domaine de l’infrastructure ML.

🏖️ Avantages

• Inferact propose des avantages compétitifs adaptés à votre localisation, incluant une couverture santé lorsque cela s’applique.

Postuler Maintenant