Ingénieur Machine Learning, Voix — Modélisation audio-vidéo conjointe

Emploi pas sur LinkedIn

🔥 il y a 18 minutes

🇪🇺 Europe – Télétravail

💵 $200 000 - $220 000 / an

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🤖 Ingénieur Machine Learning

🗣️🇺🇸🇬🇧 Anglais requis

Postuler Maintenant
Trouver des Emplois à Distance Similaires

📊 Vérifiez votre score de CV pour ce poste

Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

Logo of Cantina

Cantina

51 - 200 employés

Fondée en founded by Sean Parker

🤖 Intelligence artificielle

🎮 Jeux vidéo

🌍 Impact social

Artificial Intelligence • Gaming • Social Impact

Cantina est une entreprise spécialisée dans la création de personnages avancés en IA capables de parler, ressentir et capturer leurs aventures avec des selfies. Elle propose une plateforme où les utilisateurs peuvent libérer leurs bots IA dans des communautés en ligne, permettant à ces créatures sociales et réalistes d'interagir avec les humains. Cantina se concentre sur la création de réseaux d'influenceurs IA et encourage les utilisateurs à explorer et développer leurs propres collections de bots IA. La mission de l'entreprise est de favoriser un univers interactif, invitant à la créativité et à l'interaction sociale à travers des personnalités numériques et la technologie IA.

Description

• Représentations audio : concevoir, entraîner et améliorer les VAE audio, les codecs neuronaux et les vocodeurs sur lesquels reposent nos modèles génératifs ; conception des latents, objectifs de reconstruction et perceptuels, compromis compression vs fidélité. • Construction de modèles : architecturer, implémenter, pré-entraîner, affiner et post-entraîner/aligner (par ex. GRPO/DPO) des transformers de diffusion et de flow-matching pour la génération audio et vidéo à grande échelle. • Modélisation audio-vidéo conjointe : concevoir le conditionnement audio et l’alignement cross-modal au sein de modèles AV conjoints, gérer les latents audio parallèlement aux latents vidéo, le conditionnement par audio de référence et multi-intervenants, et la génération multi-shot audio/vidéo. • Conception expérimentale : concevoir, exécuter et analyser des expériences scientifiques pour approfondir notre compréhension des modèles. • Gestion des données : définir les besoins en données et collaborer sur l’acquisition, la curation, la synchronisation AV et le filtrage qualité, la qualité des annotations et les stratégies de données synthétiques pour des corpus audio-vidéo appariés et de parole. • Évaluation rigoureuse : concevoir des évaluations automatisées objectives/subjectives — métriques de fidélité et d’intelligibilité audio, synchronisation AV, tests d’écoute et de visualisation, contrôles de robustesse et de biais, et études de type red-team. • Efficacité d’inférence : piloter la distillation, la réduction du nombre d’étapes, la quantification et l’optimisation des noyaux/mémoire pour atteindre des objectifs de latence interactive et de coût. • Livraison des pipelines : durcir le pipeline entraînement → évaluation → inférence ; profiler latence, mémoire et coûts ; et respecter les SLA de production avec une supervision et des procédures de rollback robustes. • Scalabilité GPU : collaborer avec l’infrastructure pour exécuter l’entraînement/inférence distribués sur des flottes cloud et industrialiser les modèles avec fiabilité et observabilité. • Leadership de projet : mener de manière autonome de petits projets de recherche tout en contribuant à des initiatives d’équipe plus larges, y compris des travaux inter-équipes sur la génération vidéo. • Développement d’outils : développer et améliorer les outils de dev pour accroître la productivité de l’équipe. • Sécurité et responsabilité : contribuer aux garde-fous de sécurité/consentement, au watermarking et aux mesures de mitigation des usages abusifs pour une technologie de voix et de ressemblance responsable.

🎯 Exigences

• Expérience exceptionnelle en recherche/développement sur des modèles audio à grande échelle (>8 milliards de paramètres, >500 000 heures de données). • Expérience pratique approfondie des transformers de diffusion et/ou de flow-matching, y compris connaissance des samplers, des schedules, des mécanismes de conditionnement et de la distillation. • Expérience pratique approfondie dans l’entraînement de VAE audio, de codecs audio neuronaux et de vocodeurs : conception de latents/tokenizer, objectifs de reconstruction et perceptuels, entraînement adversarial. • Solide expérience de l’entraînement distribué multi-nœuds, multi-GPU (FSDP/DeepSpeed ou équivalent). • Solides compétences en génie logiciel avec un historique avéré de construction de systèmes complexes. • Maîtrise de PyTorch et expérience en optimisation/performance (profilage, CUDA/Triton/C++ selon les besoins) et rédaction de code fiable de qualité production. • Expérience d’avoir déployé en production des modèles génératifs de parole/audio ou multimodaux à grande échelle. • Expérience du travail avec des données ML à grande échelle et capacité à itérer sur les données et à trianguler la qualité en utilisant des signaux subjectifs et objectifs. • Expérience en clonage de voix, contrôle/steerability de la parole ou génération de parole expressive. • Publications remarquables et/ou contributions open-source en speech/audio/ML. • Fortement souhaité : • Expérience en modélisation audio-vidéo multimodale : génération AV conjointe de scènes multi-shot, multi-intervenants avec dialogues, musique et sound design générés conjointement avec la vidéo, et l’alignement cross-modal pour maintenir la synchronisation. • Expérience en génération vidéo : transformers de diffusion/flow-matching pour la vidéo, VAE vidéo, génération conditionnée et multi-shot, construction de pipelines de données pour modèles vidéo. • Génération en streaming ou temps réel, distillation causale (par ex. Self Forcing / Self Forcing++).

🏖️ Avantages

• Rémunération compétitive et généreux package d’actions de l’entreprise • Assurance santé, dentaire et optique – 99,99 % des primes prises en charge par Cantina • 42 jours de congés payés, comprenant : • 15 jours de congés payés (PTO) • 10 jours de maladie • 15 jours fériés d’entreprise • 2 jours flottants • Congé parental généreux et soutien à la fertilité • Plan d’épargne retraite 401(k) • Compte de dépenses lifestyle – 500 $/mois à utiliser librement • Déjeuner et encas offerts pour les employés en présentiel • Adhésion One Medical, et plus encore !

Postuler Maintenant

Emplois Similaires

🕒 il y a 2 jours

Constructor

201 - 500

☁️ SaaS

🤖 Intelligence artificielle

🛍️ eCommerce

Ingénieur Senior en Machine Learning concevant et optimisant des modèles ML/DL chez Constructor. Amélioration de l'expérience client via des résultats de recherche pertinents et des insights pour l'e‑commerce.

🇪🇺 Europe – Télétravail

💵 $80 000 - $120 000 / an

💰 €25 000 000 Series B - Constructor en 2024-06

⏰ Temps Plein

🟠 Senior

🤖 Ingénieur Machine Learning

🗣️🇺🇸🇬🇧 Anglais requis

🕒 il y a 3 jours

Tripledot Studios

501 - 1000

🎮 Jeux vidéo

👥 B2C

Ingénieur Machine Learning senior chez Tripledot Studios, spécialisé dans l'IA pour les jeux. Implémentation d'algorithmes ML et collaboration avec diverses équipes pour améliorer l'expérience joueur et l'efficience de l'entreprise.

🇪🇺 Europe – Télétravail

💰 €116 000 000 Series B - Tripledot Studios en 2022-02

⏰ Temps Plein

🟠 Senior

🤖 Ingénieur Machine Learning

🗣️🇺🇸🇬🇧 Anglais requis

🕒 il y a 3 jours

OnHires

11 - 50

🎯 Recrutement

👥 RH Tech

🤝 B2B

Ingénieur Machine Learning développant les systèmes ML centraux pour des applications de productivité conçues pour l’IA chez A1. Axé sur la construction de workflows ML de production fiables.

🇪🇺 Europe – Télétravail

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🤖 Ingénieur Machine Learning

🗣️🇺🇸🇬🇧 Anglais requis

🕒 il y a 6 jours

OnHires

11 - 50

🎯 Recrutement

👥 RH Tech

🤝 B2B

Responsable technique en ingénierie IA axé sur la construction de systèmes ML évolutifs pour A1, une initiative IA de BJAK en Asie du Sud-Est. Rejoindre l'équipe fondatrice pour façonner la plateforme et la culture.

🇪🇺 Europe – Télétravail

⏰ Temps Plein

🟠 Senior

🤖 Ingénieur Machine Learning

🗣️🇺🇸🇬🇧 Anglais requis

🕒 il y a 2 mois

SweatPals

11 - 50

🏥 Santé

📣 Marketing

🛍️ eCommerce

Scientifique senior en Machine Learning pilotant des projets ML pour une marketplace de fitness. Conception de fonctionnalités avancées propulsées par l'IA chez Sweatpals pour améliorer l'expérience utilisateur.

🇪🇺 Europe – Télétravail

⏰ Temps Plein

🟠 Senior

🤖 Ingénieur Machine Learning

🗣️🇺🇸🇬🇧 Anglais requis