
1001 - 5000 employés
🤖 Intelligence artificielle
🏢 Entreprise
☁️ SaaS
Artificial Intelligence • Enterprise • SaaS
Le groupe Nebius construit l’une des principales entreprises d’infrastructure AI au monde, en se concentrant sur la fourniture de la puissance de calcul, du stockage et des outils nécessaires aux développeurs dans le domaine de l’AI. Basée en Europe et cotée au Nasdaq, Nebius dispose d’une présence mondiale avec des centres de R&D en Europe, en Amérique du Nord et en Israël. L’offre principale de l’entreprise est une plateforme cloud centrée sur l’AI, conçue pour des workloads AI intensifs, complétée par diverses autres activités impliquées dans le développement de l’AI générative, l’edtech et les technologies autonomes.
🔥 il y a 23 heures
🗣️🇺🇸🇬🇧 Anglais requis
Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

1001 - 5000 employés
🤖 Intelligence artificielle
🏢 Entreprise
☁️ SaaS
Artificial Intelligence • Enterprise • SaaS
Le groupe Nebius construit l’une des principales entreprises d’infrastructure AI au monde, en se concentrant sur la fourniture de la puissance de calcul, du stockage et des outils nécessaires aux développeurs dans le domaine de l’AI. Basée en Europe et cotée au Nasdaq, Nebius dispose d’une présence mondiale avec des centres de R&D en Europe, en Amérique du Nord et en Israël. L’offre principale de l’entreprise est une plateforme cloud centrée sur l’AI, conçue pour des workloads AI intensifs, complétée par diverses autres activités impliquées dans le développement de l’AI générative, l’edtech et les technologies autonomes.
• Piloter les travaux d’optimisation pour des familles de modèles, des endpoints clients ou des backends de serving spécifiques • Comparer les moteurs et recommander des configurations de serving adaptées à des workloads spécifiques • Diagnostiquer les régressions de qualité ou de performance lors des mises en production • Optimiser les endpoints LLM et VLM en matière de latence, de débit, d’efficacité mémoire, d’utilisation des GPU, de qualité et de coût par token • Déployer, configurer, benchmarker et étendre des moteurs d’inférence tels que vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo ou des systèmes similaires • Concevoir et industrialiser des workflows de compression de modèles, notamment la quantification, l’entraînement prenant en compte la quantification, la distillation, le serving en faible précision et la restauration de la précision • Implémenter ou intégrer le speculative decoding, les approches fondées sur un modèle draft, l’optimisation du KV cache, le prefix caching, le chunked prefill, le continuous batching et le serving désagrégé du prefill et du decode • Construire des harnesses de benchmark reproductibles pour le TTFT, le TPOT, le nombre de tokens par seconde et par GPU, la latence p95/p99, la mémoire GPU, la fiabilité et le coût par token • Collaborer avec les ingénieur·es GPU kernel et les ingénieur·es plateforme afin de diagnostiquer les goulots d’étranglement dans le code des modèles, les kernels, le runtime, le scheduler, la gateway et les couches cluster • Rédiger des documents de conception, des rapports de performance, des plans de déploiement et des explications techniques destinées aux clients
• Solides compétences en ingénierie Python et PyTorch • Expérience pratique du déploiement ou de l’optimisation de systèmes d’inférence LLM, VLM ou Transformer à haut débit • Connaissance pratique d’au moins une stack moderne d’inférence telle que vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe ou des systèmes internes équivalents • Excellente compréhension des goulots d’étranglement de l’inférence des Transformers, notamment du KV cache, de l’attention, de la bande passante mémoire, du batching, du parallélisme et du serving de contextes longs • Capacité à analyser quantitativement les compromis entre latence, débit, qualité, utilisation des ressources et coûts • Excellentes aptitudes en communication et capacité à collaborer avec les équipes de recherche, de kernels, d’infrastructure, produit et les équipes clientes • Expérience de l’entraînement prenant en compte la quantification, de la quantification post-entraînement, de FP8, INT8, INT4, NVFP4, MXFP4, AWQ, GPTQ, SmoothQuant ou de techniques apparentées • Expérience de la distillation, du speculative decoding, d’EAGLE, de Medusa, de la prédiction de plusieurs tokens ou d’autres méthodes d’accélération de l’inférence • Expérience des workloads agentiques, notamment du tool calling, des sorties structurées, des API de streaming, de la forte concurrence et de l’orchestration en plusieurs étapes • Connaissance de CUDA ou de Triton • Contributions open source à vLLM, SGLang, TensorRT-LLM, FlashInfer, LMCache, PyTorch, Triton, Ray, KServe ou à des projets apparentés
• Rémunération compétitive • Opportunités d’évolution professionnelle et de formation • Flexibilité et autonomie • Culture collaborative et innovante • Possibilité de travailler sur des projets d’IA à fort impact • Environnement international et équipes talentueuses
Postuler Maintenant🕒 il y a 2 mois
Ingénieur Fullstack spécialisé en IA générative, développement d'une plateforme cyber proactive. Collaboration avec des experts de haut niveau dans un cadre entièrement distant.
🗣️🇺🇸🇬🇧 Anglais requis
Cyber Security
Python