LoiZéro

Développeur Senior Traitement de Données ML

MontréalFull timeSeniorPosted 21 days ago
Apply on LoiZéro →

Sign into see who you know at LoiZéro.

Nous recherchons un·e Développeur.euse sénior, Traitement de Données ML pour participer au développement, à l’édition et à la mise à l'échelle de notre pipeline d'actifs de données. À la jonction de l'ingénierie des données, de l’édition des données et de l'apprentissage automatique, vous serez responsable de l’entièreté du pipeline qui transforme les données brutes à l'échelle du web en ensembles de données à haut signal utilisés pour entraîner l'IA-Chercheur. Dans ce rôle, vous ne vous contenterez pas de gérer les données ; vous en concevrez la qualité. Vous élaborerez le filtrage algorithmique, développerez des mécanismes de notation basés sur des modèles et assurerez une intégrité rigoureuse des bancs d'essai pour alimenter la prochaine génération d'IA. Et à mesure que nos modèles dépasseront les paradigmes établis, vous concevrez et implémenterez de nouvelles transformations de données qui n'ont pas encore de guide d'utilisation, travaillant à la frontière de ce que peuvent être les données d'entraînement. Nous recrutons plusieurs personnes pour ce poste, et les responsabilités pourront être réparties au sein de l'équipe en fonction de l'expérience, des compétences et des intérêts de chacun·e . Responsabilités clés Travailler en partenariat avec l'équipe de Recherche pour définir, construire, automatiser, mettre à l'échelle et gérer des pipelines de données qui transforment les données brutes à l'échelle du web en ensembles de données d'entraînement pour l'IA-Chercheur. Construire et maintenir des pipelines de traitement de données, incluant la dé-duplication, la notation de qualité basée sur des modèles, le filtrage heuristique, la suppression de la toxicité, le masquage des informations personnelles identifiables (IPI (PII)), l'extraction de métadonnées et les transformations de données propriétaires, avec un versionnage et un suivi de la provenance des ensembles de données complets, en optimisant le débit et le coût à l'échelle.  S'assurer que toutes les données ingérées répondent aux exigences de conformité, aux politiques internes de gouvernance des données et aux obligations légales. Développer et affiner la suite d'outils de notation et de filtrage : heuristiques, évaluateurs basés sur les grands modèles de langage (“LLM-as-a-judge”), classificateurs ML, modules d'extraction de métadonnées et flux de travail de révision avec intervention humaine ("human-in-the-loop") requis pour le traitement et l'assurance qualité des données. Instrumenter les pipelines de traitement de données avec de la surveillance de la qualité des données, des garde-fous et des alertes pour détecter les régressions avant qu'elles ne se propagent en aval. Collaborer avec l'équipe de Recherche et d'autres équipes pour comprendre l'évolution des exigences en matière de données, puis identifier et acquérir de vastes corpus de texte qui répondent à ces exigences. Cela comprend la réalisation d'analyses systématiques de couverture pour identifier les lacu...