Directeur.rice, Évaluations
LoiZéro
| Company | LoiZéro |
| Category | Consulting & Strategy |
| Location | Montréal |
| Remote | On-site (inferred) |
| Employment | Not stated |
| Level | Director |
| Salary | Not stated by the employer |
| Posted | 19 May 2026 |
| Last verified | 3 Aug 2026 |
| Source | Employer ATS (greenhouse) |
Description
LawZero est une organisation à but non lucratif qui conçoit des systèmes d'IA sûrs dès leur conception ( safe-by-design ). Nous développons « Scientist AI », un système d'IA de pointe conçu dès le départ pour être à la fois hautement performant et sécurisé. Parallèlement au développement de nos modèles généraux Scientist AI et de garde-fous de sécurité pour les modèles de langage de pointe (LLM frontier ), nous devons évaluer de manière rigoureuse et indépendante chaque affirmation concernant leurs capacités et leur sécurité. Nous recherchons un.e Directeur.rice des évaluations pour structurer, diriger et faire grandir l’équipe Évaluations de LawZero.
Il s'agit d'un recrutement fondateur. Vous définirez ce qu'est une évaluation de classe mondiale chez LoiZéro, bâtirez l'équipe et l'infrastructure nécessaires pour la réaliser, et veillerez à ce que les évaluations restent indépendantes de l'axe de recherche principal. Cela permettra de garantir la fiabilité de nos affirmations sur les capacités et la sécurité de nos modèles, tant en interne qu'auprès de la communauté élargie de l'IA et de la sécurité de l'IA.
Responsabilités clés
Définir la stratégie et la feuille de route des évaluations de LoiZéro, en priorisant ce qui doit être mesuré et à quel moment, en étroite coordination avec les équipes de recherche et de produit.
Bâtir l'équipe Évaluations au cours de vos 3 à 6 premiers mois, pour atteindre environ 8 à 10 personnes spécialisées en recherche, ingénierie, conception d'ensembles de données ( datasets ) et de benchmarks, ainsi qu'en red-teaming .
Diriger l'équipe de manière indépendante des axes principaux de recherche et de produit afin d'éviter tout conflit d'intérêt, ce qui inclut la conception de benchmarks inédits permettant de comparer équitablement ( apples-to-apples ) Scientist AI et les LLM de pointe.
Superviser la conception et la création de nouveaux jeux de données, de tâches et d'environnements virtuels ou interactifs pour mesurer les performances de Scientist AI au niveau de ses capacités, sa sécurité (y compris l'honnêteté et l'orientation vers des objectifs), son applicabilité, ses mécanismes causaux et sa détection d'attaques adverses ( adversarial attacks ).
Diriger l'évaluation de Scientist AI lorsqu'il est déployé comme garde-fou ( guardrail ) autour de modèles de pointe, notamment sa capacité à se conformer aux spécifications sur les préjudices, à détecter et bloquer les réponses nocives, à expliquer ses décisions et à résister aux attaques adverses telles que le jailbreak , l'injection de requêtes ( prompt injection) et l'empoisonnement de données.
Établir et diriger nos programmes de red-teaming automatisés et manuels, en interne et en partenariat avec des prestataires externes, afin de tester les limites de Scientist AI en tant que modèle généraliste et en tant que garde-fou.
Piloter la création des outils et des infrastructures internes nécessaires pour exécuter des évaluations à grande échelle, en automatisant et en standardisant le pipeline autant que possible.
Soutenir directement, au besoin et dans la mesure du possible, les équipes de recherche et de produit dans leurs propres besoins internes d'évaluation et de benchmarking afin de lever les blocages et d'accélérer les processus.
Prendre en charge la communication publique des résultats d'évaluation de LawZero (notamment les fiches de modèles/systèmes — model cards , les rapports techniques, les publications évaluées par des pairs et les articles de blog) afin de renforcer la confiance avec la communauté de la sécurité de l'IA.
Représenter LawZero à l'externe sur les questions d'évaluation et de mesure de la sécurité de l'IA, notamment auprès des instituts de sécurité de l'IA, des collaborateurs de recherche et des bailleurs de fonds.
Compét