Scientifique/Ingénieur de recherche – Infrastructure d’entraînement

🔥 il y a 12 heures

🇪🇺 Europe – Télétravail

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🧬 Chercheur Scientifique

👻 Score fantôme 12%

infoinfo

🗣️🇺🇸🇬🇧 Anglais requis

Postuler Maintenant
Trouver des Emplois à Distance Similaires

📊 Vérifiez votre score de CV pour ce poste

Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

Logo of Luma AI

Luma AI

2 - 10 employés

🤖 Intelligence artificielle

☁️ SaaS

📱 Médias

💰 €90 000 000 Series B en 2025-01

Artificial Intelligence • SaaS • Media

Luma AI est une entreprise basée à Palo Alto qui développe des modèles d'IA générative multimodale et des outils de flux de travail créatif axés sur la production de vidéos, d'images, d'audio et de textes. Luma propose des modèles et des produits tels que Ray (génération de vidéos), UNI-1/Uni-1. 1 (modèles d'intelligence de marque), et une API/des offres d'entreprise qui permettent aux équipes créatives de générer, éditer et réaliser des contenus de qualité cinématique avec une continuité de marque. Ils mettent l'accent sur la recherche d'avant-garde (Open Physical AI Lab), le développement interne de modèles, et des produits pour les équipes créatives, les agences et les services de production. Luma fournit également des API, des plans d'entreprise, un programme de partenariats créatifs et des ressources d'apprentissage.

Description

• Concevoir, mettre en œuvre et optimiser des systèmes efficaces d’entraînement distribué pour des modèles s’exécutant sur des milliers de GPU • Étudier et mettre en œuvre des techniques avancées de parallélisation, notamment FSDP, le parallélisme tensoriel, le parallélisme pipeline et le parallélisme par experts • Développer des outils de monitoring, de visualisation et de débogage pour des sessions d’entraînement à grande échelle • Optimiser la stabilité de l’entraînement, la convergence et l’utilisation des ressources sur des clusters de très grande taille • Maîtriser la stack d’entraînement actuelle et diagnostiquer les problèmes de stabilité et d’utilisation des ressources à grande échelle • Mettre en production une amélioration de la parallélisation ou de la stabilité apportant un bénéfice mesurable à une session d’entraînement réelle • Développer des outils et solutions de monitoring afin de garantir la fiabilité et l’efficacité des sessions de grande ampleur

🎯 Exigences

• Solide expérience de l’entraînement distribué avec PyTorch et des techniques de parallélisation appliqués à l’entraînement de modèles de fondation • Excellente compréhension des clusters de GPU, des réseaux et des systèmes de stockage • Connaissance des bibliothèques de communication (NCCL, MPI) et de l’optimisation des systèmes distribués • Maîtrise de l’administration de systèmes Linux et du scripting (un plus) • Expérience de la gestion de sessions d’entraînement sur plus de 100 GPU (un plus) • Expérience de la conteneurisation, de l’orchestration et des infrastructures cloud (un plus) • Expérience de FSDP et de l’entraînement multi-nœuds • Capacité à travailler à distance depuis l’Union européenne

🏖️ Avantages

• Employeur garantissant l’égalité des chances • Participation facultative à une enquête sur la diversité et l’inclusion ; un refus n’aura aucune incidence sur la candidature • Poste en télétravail

Postuler Maintenant

Emplois Similaires

🕒 il y a 2 jours

Synthesia

501 - 1000

📣 Marketing

💼 Conseil

📦 Logistique

Scientifique de recherche développant des modèles de diffusion pour des avatars interactifs naturels en temps réel. Synthesia développe des technologies vidéo basées sur l’IA pour la communication des entreprises et le développement des compétences en entreprise.

🇪🇺 Europe – Télétravail

🔥 Financement dans la dernière année

💰 €200 000 000 Series E - Synthesia en 2025-10

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🧬 Chercheur Scientifique

🗣️🇺🇸🇬🇧 Anglais requis