Job Opportunities API

The Public Ledger of Openings

← Back to the ledger

Développeur Senior Traitement de Données ML

LoiZéro
CompanyLoiZéro
CategoryEngineering
LocationMontréal
RemoteOn-site (inferred)
EmploymentNot stated
LevelSenior
SalaryNot stated by the employer
Posted2 Jul 2026
Last verified11 Aug 2026
SourceEmployer ATS (greenhouse)
Applications are handled by the employer, not by us.Apply on the employer's site →
Description
Nous recherchons un·e Développeur.euse sénior, Traitement de Données ML pour participer au développement, à l’édition et à la mise à l'échelle de notre pipeline d'actifs de données. À la jonction de l'ingénierie des données, de l’édition des données et de l'apprentissage automatique, vous serez responsable de l’entièreté du pipeline qui transforme les données brutes à l'échelle du web en ensembles de données à haut signal utilisés pour entraîner l'IA-Chercheur. Dans ce rôle, vous ne vous contenterez pas de gérer les données ; vous en concevrez la qualité. Vous élaborerez le filtrage algorithmique, développerez des mécanismes de notation basés sur des modèles et assurerez une intégrité rigoureuse des bancs d'essai pour alimenter la prochaine génération d'IA. Et à mesure que nos modèles dépasseront les paradigmes établis, vous concevrez et implémenterez de nouvelles transformations de données qui n'ont pas encore de guide d'utilisation, travaillant à la frontière de ce que peuvent être les données d'entraînement. Nous recrutons plusieurs personnes pour ce poste, et les responsabilités pourront être réparties au sein de l'équipe en fonction de l'expérience, des compétences et des intérêts de chacun·e . Responsabilités clés Travailler en partenariat avec l'équipe de Recherche pour définir, construire, automatiser, mettre à l'échelle et gérer des pipelines de données qui transforment les données brutes à l'échelle du web en ensembles de données d'entraînement pour l'IA-Chercheur. Construire et maintenir des pipelines de traitement de données, incluant la dé-duplication, la notation de qualité basée sur des modèles, le filtrage heuristique, la suppression de la toxicité, le masquage des informations personnelles identifiables (IPI ( PII )), l'extraction de métadonnées et les transformations de données propriétaires, avec un versionnage et un suivi de la provenance des ensembles de données complets, en optimisant le débit et le coût à l'échelle.  S'assurer que toutes les données ingérées répondent aux exigences de conformité, aux politiques internes de gouvernance des données et aux obligations légales. Développer et affiner la suite d'outils de notation et de filtrage : heuristiques, évaluateurs basés sur les grands modèles de langage (“ LLM-as-a-judge ”), classificateurs ML, modules d'extraction de métadonnées et flux de travail de révision avec intervention humaine (" human-in-the-loop ") requis pour le traitement et l'assurance qualité des données. Instrumenter les pipelines de traitement de données avec de la surveillance de la qualité des données, des garde-fous et des alertes pour détecter les régressions avant qu'elles ne se propagent en aval. Collaborer avec l'équipe de Recherche et d'autres équipes pour comprendre l'évolution des exigences en matière de données, puis identifier et acquérir de vastes corpus de texte qui répondent à ces exigences. Cela comprend la réalisation d'analyses systématiques de couverture pour identifier les lacunes dans le corpus et le développement de stratégies d'acquisition ciblées pour y remédier, ainsi que la collaboration avec l'équipe juridique et de gouvernance pour obtenir la licence de nouvelles sources de données. Concevoir et maintenir des mécanismes stricts de détection des fuites pour se prémunir contre la contamination de l'évaluation à toutes les étapes du pipeline de traitement des données. Construire des outils et des interfaces internes qui permettent aux chercheurs d'explorer, d'interroger et de comprendre les ensembles de données disponibles avec un minimum de friction. Compétences et qualifications Diplôme en informatique, en génie logiciel ou dans un domaine connexe. Expérience avérée dans le traitement des ensembles de données textuelles non structurées massives (échelle du bil