Ingénieur Machine Learning — Données multilingues

Emploi pas sur LinkedIn

🕒 il y a 7 mois

🌏 N'importe où dans le monde

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🤖 Ingénieur Machine Learning

👻 Score fantôme 47%

infoinfo

🗣️🇺🇸🇬🇧 Anglais requis

Python

Ray

Spark

Postuler Maintenant
Trouver des Emplois à Distance Similaires

📊 Vérifiez votre score de CV pour ce poste

Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

Logo of Featherless AI

Featherless AI

1 - 10 employés

Fondée en 2023

🤖 Intelligence artificielle

☁️ SaaS

🔌 API

Artificial Intelligence • SaaS • API

Featherless AI est un fournisseur de services d'inférence AI sans serveur et d'hébergement de modèles qui offre un accès API à un vaste catalogue de modèles à poids ouvert (plus de 12 200), permettant aux développeurs et aux entreprises de déployer, ajuster et exécuter des modèles à grande échelle sans gérer de serveurs. La société propose un tarif d'abonnement forfaitaire avec des jetons illimités, l'orchestration GPU, une utilisation privée/anonyme (sans journaux) et des options de self-hosting pour les entreprises ou des unités de mise à l'échelle pour une haute simultanéité. Featherless AI fonctionne également comme un laboratoire de recherche en intelligence artificielle axé sur la recherche open-source et post-transformateur, revendiquant des améliorations significatives en termes de coûts et de performance pour les grands modèles et agents IA.

Description

• Concevoir, construire et maintenir des jeux de données multilingues à grande échelle pour des langues à ressources élevées et faibles • Développer des pipelines de données pour la collecte, le nettoyage, la normalisation, la déduplication et l'étiquetage • Mettre en œuvre des filtres de qualité utilisant des méthodes statistiques, heuristiques et basées sur des modèles • Travailler avec les chercheurs pour définir la couverture linguistique, les benchmarks et les métriques d'évaluation • Analyser les biais des jeux de données, les lacunes de couverture et les modes de défaillance selon les régions et les écritures • Soutenir les workflows d'entraînement, de fine-tuning et de distillation avec des données multilingues de haute qualité • Itérer en continu sur les jeux de données en fonction des performances des modèles et de l'utilisation en production

🎯 Exigences

• Minimum 3 ans d'expérience en tant qu'Ingénieur ML, Applied Scientist ou poste similaire • Solide expérience avec des jeux de données multilingues ou non anglophones • Bonne maîtrise des fondamentaux du NLP (tokenization, embeddings, language modeling) • Expérience dans la conception de pipelines de données scalables (Python, Spark, Ray ou équivalent) • Connaissance de Unicode, des écritures, des enjeux de tokenization et des particularités propres à chaque langue • À l'aise pour collaborer avec des chercheurs et traduire des besoins de recherche en systèmes de production

🏖️ Avantages

• Rémunération compétitive + participation significative au capital au stade de la Série A

Postuler Maintenant