Ingénieur Machine Learning appliqué (Données)

Emploi pas sur LinkedIn

🕒 il y a 3 mois

🇪🇺 Europe – Télétravail

💵 $200 000 - $260 000 / an

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🤖 Ingénieur Machine Learning

🗣️🇺🇸🇬🇧 Anglais requis

Postuler Maintenant
Trouver des Emplois à Distance Similaires

📊 Vérifiez votre score de CV pour ce poste

Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

Logo of Cantina

Cantina

51 - 200 employés

Fondée en founded by Sean Parker

🤖 Intelligence artificielle

🎮 Jeux vidéo

🌍 Impact social

Artificial Intelligence • Gaming • Social Impact

Cantina est une entreprise spécialisée dans la création de personnages avancés en IA capables de parler, ressentir et capturer leurs aventures avec des selfies. Elle propose une plateforme où les utilisateurs peuvent libérer leurs bots IA dans des communautés en ligne, permettant à ces créatures sociales et réalistes d'interagir avec les humains. Cantina se concentre sur la création de réseaux d'influenceurs IA et encourage les utilisateurs à explorer et développer leurs propres collections de bots IA. La mission de l'entreprise est de favoriser un univers interactif, invitant à la créativité et à l'interaction sociale à travers des personnalités numériques et la technologie IA.

Description

• Construire et maintenir des pipelines de données pour de grands modèles de génération vidéo, incluant l’ingestion de données, le parsing, le filtrage, le prétraitement et la curation de jeux de données à grande échelle, en utilisant des outils tels que AWS S3 et DynamoDB. • Concevoir et exécuter des flux de travail d’annotation sur des plateformes telles que MTurk, Prolific et Mechanical Turk, incluant la conception des tâches, le contrôle qualité et la validation des annotations. • Entraîner, évaluer et améliorer des modèles secondaires utilisés pour le filtrage des données, l’évaluation de la qualité, le prétraitement ou d’autres parties du pipeline ML. • Collaborer étroitement avec les équipes de recherche et d’ingénierie pour transformer des workflows expérimentaux en systèmes évolutifs et reproductibles qui prennent en charge l’entraînement et l’évaluation des modèles. • Prendre en charge la qualité des données tout au long du pipeline en identifiant les goulots d’étranglement, les modes de défaillance et les sources de faible qualité, et en améliorant en continu les outils et processus. • Développer des outils internes et des automatisations facilitant la préparation des jeux de données, le lancement des tâches d’annotation, la surveillance des résultats et le support du développement des modèles de bout en bout. • Piloter des projets de pipeline d’envergure de bout en bout, tels que la création de nouveaux jeux de données ou la mise à niveau des infrastructures de labellisation et de prétraitement. • Travailler au sein d’une infrastructure d’entraînement basée sur Kubernetes, en veillant à ce que les jeux de données soient correctement préparés, formatés et livrés aux clusters d’entraînement. • Profiler et optimiser les scripts d’inférence des modèles de recherche utilisés dans les étapes de prétraitement, en s’assurant que les étapes de filtrage et de transformation pilotées par modèle s’exécutent dans des contraintes de temps et de coût pratiques lorsqu’elles sont appliquées à des données brutes à grande échelle.

🎯 Exigences

• 3+ years of experience in machine learning, applied ML, data pipelines, or related engineering roles, ideally working on large-scale multimodal, video, or vision-based systems. • Strong programming skills in Python and solid experience building reliable data processing and preprocessing pipelines for ML workflows. • Hands-on experience preparing training data for ML models, including parsing, filtering, dataset curation, quality control, and large-scale data handling using tools such as AWS S3 and DynamoDB. • Familiarity with annotation and labeling workflows, including task design, vendor or crowd-platform orchestration such as MTurk or Prolific, and methods for ensuring label quality. • Experience working with Kubernetes for orchestrating distributed workloads, including data preprocessing, pipeline execution, and dataset delivery to training clusters. • Comfort working across cloud and on-demand compute environments such as AWS and RunPod, with the ability to port and optimize pipelines across infrastructure. • Familiarity with distributed data processing frameworks and experience designing systems that operate reliably at scale across many nodes or workers. • Working knowledge of PyTorch and the broader deep learning stack, with the ability to read, debug, and optimize research model inference code for use in production preprocessing pipelines. • Ability to work cross-functionally with research and engineering teams and translate experimental ideas into robust, scalable systems. • Bachelor's, Master's, or PhD in Computer Science, Machine Learning, Engineering, Mathematics, or a related technical field; experience in generative video, computer vision, or multimodal ML is strongly preferred. • Bonus: Experience training, evaluating, or fine-tuning smaller ML models used for classification, filtering, ranking, quality assessment, or other supporting tasks in an ML pipeline.

🏖️ Avantages

• Competitive salary and generous company equity • Medical, dental, and vision insurance – 99.99% of premiums covered by Cantina • 42 days of paid time off, including: • 15 PTO days • 10 sick days • 15 company holidays • 2 floating holidays • Generous parental leave & fertility support • 401(k) retirement savings plan • Lifestyle spending account – $500/month to use however you’d like • Complimentary lunch and snacks for in-office employees • One Medical membership, and more!

Postuler Maintenant