Le laboratoire / Sources & références

Une méthode se discute à ses sources.

Des travaux à lire pour construire de meilleures questions. Chaque référence précise ce qu’elle propose, comment elle peut nourrir DoubleBlind et où s’arrête la transposition.

Un guide de lecture

Comprendre l’apport.
Garder la distance.

Ce répertoire est une sélection commentée, ouverte à la discussion. Les résumés décrivent les publications citées. Les rubriques « Usage pour DoubleBlind » et « Limite de transposition » présentent notre lecture et les adaptations que nous proposons.

Cette sélection ne constitue pas une validation de DoubleBlind par les auteurs ou les institutions cités. Les résultats de leurs expériences ne sont pas des résultats du laboratoire. Une même idée de comparaison peut conduire à des mesures très différentes selon la tâche, la langue et le modèle étudiés.

Notices et liens primaires vérifiés le .

01 / Construire une comparaison

Qu’est-ce qui doit rester comparable ?

Clarifier l’objet du test, les informations disponibles et la différence entre une intervention causale et une modification du texte.

Counterfactual Fairness

Matt J Kusner, Joshua Loftus, Chris Russell et Ricardo Silva

Ce que le travail propose

Les auteurs définissent une notion d’équité à l’échelle individuelle dans un modèle causal. La distribution d’une prédiction doit rester identique sous une intervention sur l’attribut protégé, conditionnellement aux observations disponibles. Le cadre explicite les relations entre variables et les hypothèses nécessaires au calcul du contrefactuel. Lire la source primaire

Usage pour DoubleBlind

Avant d’écrire une paire miroir, préciser ce que la substitution est censée éprouver. Si un prénom change, examiner aussi les indices de langue, de rôle ou de contexte. La fiche d’hypothèse peut distinguer une sensibilité à la formulation d’une hypothèse sur le mécanisme de décision.

Limite de transposition

Une substitution textuelle isolée ne satisfait pas, à elle seule, cette définition causale. DoubleBlind ne peut déduire une équité contrefactuelle générale de réponses similaires à deux prompts ; les hypothèses causales demanderaient une justification supplémentaire.

Repère de lecture. Dans le PDF : sections 2.2 et 3, modèle causal et définition formelle.

BBQ: A hand-built bias benchmark for question answering

Alicia Parrish, Angelica Chen, Nikita Nangia, Vishakh Padmakumar, Jason Phang, Jana Thompson, Phu Mon Htut et Samuel R. Bowman

Ce que le travail propose

BBQ propose des questions à choix de réponse portant sur des biais sociaux dans un contexte anglophone américain. Le jeu distingue des situations insuffisamment informatives et des situations apportant assez d’éléments pour répondre. Cette construction sépare le recours à un stéréotype lorsque l’information manque de la prise en compte d’un fait explicite. Lire la source primaire

Usage pour DoubleBlind

Préparer deux familles de contrôles : un récit dans lequel la responsabilité reste inconnue et un récit qui fournit une preuve pertinente. L’attente annoncée change entre ces familles. Une bonne annotation doit donc relever si le modèle reconnaît l’incertitude et s’il tient compte du fait ajouté.

Limite de transposition

Un choix parmi des réponses prédéfinies ne mesure pas directement l’empathie ou la qualité d’un conseil libre. Le contexte culturel de BBQ et ses catégories doivent également être examinés avant une adaptation française.

Repère de lecture. Commencer par le résumé : il distingue explicitement les deux niveaux d’information.

02 / Tester le comportement

Le constat résiste-t-il à la formulation ?

Préparer des attentes explicites, puis examiner les variations qui pourraient modifier la réponse sans changer la question posée.

Beyond Accuracy: Behavioral Testing of NLP Models with CheckList

Marco Tulio Ribeiro, Tongshuang Wu, Carlos Guestrin et Sameer Singh

Ce que le travail propose

CheckList organise l’évaluation comportementale autour d’une matrice de capacités linguistiques et de types de tests. Le travail distingue des vérifications élémentaires, des transformations devant préserver la prédiction et des transformations associées à une évolution attendue. Un outil accompagne cette méthode pour produire des cas de test variés. Lire la source primaire

Usage pour DoubleBlind

Pour une campagne de modération, écrire l’attente avant l’exécution : conserver la décision après une modification sans effet pertinent, puis réagir à l’ajout d’un élément qui change réellement le cas. Documenter séparément ces tests évite de demander une symétrie identique à toutes les situations.

Limite de transposition

La matrice ne choisit pas à notre place le bon jugement ni toutes les capacités à couvrir. Ses catégories de tests inspirent une organisation ; elles ne rendent pas automatiquement valide une grille portant sur des conseils ouverts.

Repère de lecture. Dans le PDF : section 2, particulièrement 2.2 pour les trois types de tests.

Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting

Melanie Sclar, Yejin Choi, Yulia Tsvetkov et Alane Suhr

Ce que le travail propose

Ce travail étudie la sensibilité des modèles au format des prompts lorsque les modifications sont censées préserver leur sens. Les auteurs proposent FormatSpread pour échantillonner plusieurs formats plausibles et décrire la plage des performances obtenues. Ils discutent la fragilité d’une comparaison fondée sur une seule présentation choisie arbitrairement. Lire la source primaire

Usage pour DoubleBlind

Définir à l’avance quelques présentations d’une même paire, par exemple un récit suivi d’une question ou une structure avec des rubriques. Conserver chaque format pour les deux variantes, puis regarder si l’écart observé dépend de cette présentation. Garder les résultats de tous les formats prévus.

Limite de transposition

La variation mesurée dans les expériences du papier n’annonce pas celle d’un modèle actuel sur le corpus DoubleBlind. Modifier la formulation demande aussi de vérifier que le sens et la demande restent effectivement comparables.

Repère de lecture. Résumé et version v2 datée de juillet 2024, identifiée comme version ICLR définitive par les auteurs.

03 / Choisir le corpus

Quels usages et quelles dimensions observe-t-on ?

Situer les jeux de données, leurs langues et leurs tâches. Choisir une couverture et plusieurs dimensions de lecture adaptées au projet.

CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models

Nikita Nangia, Clara Vania, Rasika Bhalerao et Samuel R. Bowman

Ce que le travail propose

CrowS-Pairs rassemble des paires de phrases pour étudier des stéréotypes sociaux dans des modèles de langue masqués. Chaque paire contraste une formulation davantage stéréotypée avec une formulation moins stéréotypée. Les groupes et catégories retenus s’inscrivent dans un contexte américain, ce qui délimite la portée du jeu de données. Lire la source primaire

Usage pour DoubleBlind

S’en servir comme point de comparaison pour décrire la structure d’un corpus : ce qui change, les catégories couvertes et le comportement réellement observé. Lors de la création de cas originaux, consigner séparément la variable modifiée et le jugement que l’on souhaite examiner.

Limite de transposition

Une préférence entre phrases dans un modèle masqué n’est pas la même mesure qu’un conseil produit en conversation. Reprendre la forme en paires ne transfère ni la métrique d’origine ni les résultats du benchmark au laboratoire.

Repère de lecture. Lire le résumé pour le périmètre ; poursuivre dans le PDF avant de réutiliser la méthode de mesure.

French CrowS-Pairs: Extending a challenge dataset for measuring social bias in masked language models to a language other than English

Aurélie Névéol, Yoann Dupont, Julien Bezançon et Karën Fort

Ce que le travail propose

Les auteurs étendent CrowS-Pairs au français en combinant traduction et création de nouvelles paires. Le travail documente les particularités culturelles rencontrées lors du passage depuis un corpus centré sur les États-Unis et propose des pistes d’extension à d’autres langues. Comparabilité linguistique et ancrage local y sont traités ensemble. Lire la source primaire

Usage pour DoubleBlind

Faire relire une paire traduite pour son sens, sa naturalité et les associations qu’évoquent ses indices identitaires. Dans un test multilingue, distinguer les cas traduits des cas créés pour un contexte local ; expliquer pourquoi une adaptation a été nécessaire au lieu de la rendre invisible.

Limite de transposition

Ce corpus vise des formes particulières de stéréotypes et des modèles masqués. Son existence ne garantit pas qu’une traduction conserve la même difficulté pour un assistant conversationnel, ni qu’elle représente tous les usages francophones.

Repère de lecture. Le résumé décrit la part traduite, les nouveaux exemples et l’enjeu d’adaptation culturelle.

StereoSet: Measuring stereotypical bias in pretrained language models

Moin Nadeem, Anna Bethke et Siva Reddy

Ce que le travail propose

StereoSet propose un corpus anglophone consacré aux stéréotypes liés au genre, à la profession, à la race et à la religion. Le travail met en regard la mesure des stéréotypes et la capacité de modélisation du langage. Il vise ainsi à éviter qu’une faible capacité linguistique soit interprétée comme un signe rassurant sur les biais. Lire la source primaire

Usage pour DoubleBlind

Conserver une dimension de qualité de réponse à côté de la symétrie. Deux conseils également vagues peuvent se ressembler tout en étant inutiles. Dans une grille DoubleBlind, relever la réponse à la question, les faits retenus et les actions proposées, en plus des divergences entre les variantes.

Limite de transposition

La qualité d’un conseil conversationnel ne se réduit pas à la capacité de modélisation du langage mesurée par StereoSet. Notre grille constitue une adaptation éditoriale à justifier, pas une reproduction du benchmark.

Repère de lecture. Le résumé expose les deux objectifs : stéréotypes et capacité linguistique.

Holistic Evaluation of Language Models

Percy Liang et al. · Center for Research on Foundation Models, Stanford

Ce que le travail propose

HELM propose une évaluation couvrant plusieurs scénarios et plusieurs dimensions : exactitude, calibration, robustesse, équité, biais, toxicité et efficacité. Le travail rend explicites des zones insuffisamment couvertes et publie les prompts, les réponses ainsi qu’un outil d’évaluation. Cette organisation rend les arbitrages entre dimensions plus visibles. Lire la source primaire

Usage pour DoubleBlind

Présenter un tableau de résultats par usage et dimension, accompagné des cas absents ou exclus. Pour un conseil relationnel, examiner séparément l’empathie, le blâme, la certitude et l’utilité. Conserver les sorties originales avec leur configuration pour permettre une seconde lecture du même matériau.

Limite de transposition

Les dimensions et scénarios de HELM ne valident pas une nouvelle mesure d’empathie ou de blâme. Les résultats publiés sont liés aux modèles, données et conditions évalués ; ils ne décrivent pas les performances actuelles de tous les assistants.

Repère de lecture. Résumé et notice bibliographique : publication TMLR en 2023, première version en 2022.

04 / Documenter les limites

Une autre personne peut-elle examiner le travail ?

Rendre lisibles la provenance des données, le contexte d’utilisation et le périmètre des conclusions possibles.

Data Statements for Natural Language Processing: Toward Mitigating System Bias and Enabling Better Science

Emily M. Bender et Batya Friedman

Ce que le travail propose

Les autrices proposent des fiches descriptives pour contextualiser les données utilisées en traitement du langage. Le format long couvre notamment les raisons de la sélection, les variétés linguistiques et les caractéristiques des personnes qui produisent ou annotent les textes. L’objectif est de mieux délimiter les usages et les possibilités de généralisation. Lire la source primaire

Usage pour DoubleBlind

Accompagner chaque version d’un corpus d’une note expliquant l’origine des scénarios, les langues visées, les choix de sélection et le processus de relecture. Pour les cas synthétiques de l’Atlas, indiquer clairement leur statut pédagogique et les contextes que la collection ne cherche pas à représenter.

Limite de transposition

Une documentation détaillée rend les choix examinables ; elle ne transforme pas un échantillon en population représentative. Décrire les annotateurs doit aussi rester proportionné et respecter leur vie privée.

Repère de lecture. Dans le PDF : section 5.1, structure proposée pour une fiche longue.

Model Cards for Model Reporting

Margaret Mitchell, Simone Wu, Andrew Zaldivar, Parker Barnes, Lucy Vasserman, Ben Hutchinson, Elena Spitzer, Inioluwa Deborah Raji et Timnit Gebru

Ce que le travail propose

Les model cards sont des documents qui accompagnent un modèle entraîné. Le cadre proposé rassemble les usages prévus, les procédures d’évaluation et des performances examinées dans différentes conditions et pour des groupes pertinents. Il cherche à rendre plus compréhensibles le contexte d’emploi et les caractéristiques d’un modèle publié. Lire la source primaire

Usage pour DoubleBlind

Dans un rapport de campagne, consigner l’identifiant du modèle, la configuration accessible, l’usage étudié, les données et les exclusions. Séparer les informations fournies par l’éditeur des observations produites par la campagne. Cette structure aide un lecteur à comprendre exactement ce qui a été examiné.

Limite de transposition

Une fiche rédigée par un fournisseur ne remplace pas une vérification indépendante. Inversement, un rapport externe sur quelques scénarios ne documente pas tous les usages d’un modèle. La référence au format ne constitue pas une certification.

Repère de lecture. Notice arXiv : version v2 de janvier 2019 et référence de publication FAT* 2019.

De la lecture à la pratique

Avant de réutiliser
un résultat.

Quatre questions pour conserver le lien entre une publication et l’affirmation que l’on veut soutenir.

  1. 01

    Quelle tâche ?

    Choisir un mot, classer une phrase, répondre à une question fermée ou produire un conseil : relevez ce que le système devait effectivement faire.

  2. 02

    Quel matériau ?

    Notez la langue, le contexte culturel, les catégories et les règles de sélection. Cherchez aussi ce qui reste hors du corpus.

  3. 03

    Quelle mesure ?

    Reliez chaque conclusion à sa métrique et à ses conditions. Une préférence entre phrases et une différence de blâme demandent des lectures distinctes.

  4. 04

    Quelle transposition ?

    Écrivez ce que vous reprenez et ce que vous changez. Une adaptation devient examinable lorsque ses choix et ses limites restent visibles.

Tout le laboratoire

Une question en tête ?

Articles, cas, outils et parcours. Échap pour fermer.