Ingénieur Machine Learning — Données multilingues

Emploi pas sur LinkedIn

🕒 il y a 6 mois

🌏 N'importe où dans le monde

⏰ Temps Plein

🟡 Intermédiaire

🟠 Senior

🤖 Ingénieur Machine Learning

🗣️🇺🇸🇬🇧 Anglais requis

Python

Ray

Spark

Postuler Maintenant
Trouver des Emplois à Distance Similaires

📊 Vérifiez votre score de CV pour ce poste

Améliorez vos chances d'obtenir un entretien en vérifiant votre score de CV avant de postuler.

Logo of Featherless AI

Featherless AI

1 - 10 employés

Fondée en 2023

🤖 Intelligence artificielle

☁️ SaaS

🔌 API

Artificial Intelligence • SaaS • API

Featherless AI est un fournisseur de services d'inférence AI sans serveur et d'hébergement de modèles qui offre un accès API à un vaste catalogue de modèles à poids ouvert (plus de 12 200), permettant aux développeurs et aux entreprises de déployer, ajuster et exécuter des modèles à grande échelle sans gérer de serveurs. La société propose un tarif d'abonnement forfaitaire avec des jetons illimités, l'orchestration GPU, une utilisation privée/anonyme (sans journaux) et des options de self-hosting pour les entreprises ou des unités de mise à l'échelle pour une haute simultanéité. Featherless AI fonctionne également comme un laboratoire de recherche en intelligence artificielle axé sur la recherche open-source et post-transformateur, revendiquant des améliorations significatives en termes de coûts et de performance pour les grands modèles et agents IA.

Description

• Concevoir, construire et maintenir des jeux de données multilingues à grande échelle pour des langues à ressources élevées et faibles • Développer des pipelines de données pour la collecte, le nettoyage, la normalisation, la déduplication et l'étiquetage • Mettre en œuvre des filtres de qualité utilisant des méthodes statistiques, heuristiques et basées sur des modèles • Travailler avec les chercheurs pour définir la couverture linguistique, les benchmarks et les métriques d'évaluation • Analyser les biais des jeux de données, les lacunes de couverture et les modes de défaillance selon les régions et les écritures • Soutenir les workflows d'entraînement, de fine-tuning et de distillation avec des données multilingues de haute qualité • Itérer en continu sur les jeux de données en fonction des performances des modèles et de l'utilisation en production

🎯 Exigences

• Minimum 3 ans d'expérience en tant qu'Ingénieur ML, Applied Scientist ou poste similaire • Solide expérience avec des jeux de données multilingues ou non anglophones • Bonne maîtrise des fondamentaux du NLP (tokenization, embeddings, language modeling) • Expérience dans la conception de pipelines de données scalables (Python, Spark, Ray ou équivalent) • Connaissance de Unicode, des écritures, des enjeux de tokenization et des particularités propres à chaque langue • À l'aise pour collaborer avec des chercheurs et traduire des besoins de recherche en systèmes de production

🏖️ Avantages

• Rémunération compétitive + participation significative au capital au stade de la Série A

Postuler Maintenant

Emplois Similaires

🕒 il y a 11 mois

GoML

51 - 200

🤖 Intelligence artificielle

🤝 B2B

💊 Pharmaceutique

Architecte technique spécialisé dans les solutions AWS et AI pour les missions clients de Neuralgo Software. Responsable de la conception d'architectures et de la collaboration transversale pour des systèmes cloud évolutifs.

🌏 N'importe où dans le monde

⏰ Temps Plein

🟠 Senior

🔴 Expert

🤖 Ingénieur Machine Learning

🗣️🇺🇸🇬🇧 Anglais requis