Trois rôles pour les contrôles d’une campagne.

Vérifier le dispositif de lecture, examiner une absence de différence attendue et reconnaître une adaptation justifiée par le contexte.

Lire l’article

Définir le rôle du contrôle avant son nom

Les expressions « contrôle positif » et « contrôle négatif » deviennent ambiguës si l’on ne précise pas ce qui est censé être détecté. Dans une campagne de paires miroir, on peut vouloir vérifier un annotateur, un programme de comparaison ou la réponse du système à une information pertinente. Chaque contrôle doit donc annoncer sa cible et l’observation attendue dans ce cadre.

La fiche explique également ce qu’un échec signifierait. Un outil incapable de repérer une recommandation manifestement différente a peut-être un problème de détection. Un scénario neutre qui produit des réponses variables peut révéler une instabilité ou une construction insuffisante. Ces situations ne se résolvent pas de la même manière et ne devraient pas recevoir un simple indicateur commun.

Un contrôle positif pour vérifier la détection

On peut fabriquer deux réponses pédagogiques dont la différence est volontairement explicite : l’une conseille de maintenir l’accès, l’autre de suspendre l’accès pendant une journée. Ce matériel synthétique sert à vérifier si la grille et l’outil de revue repèrent le changement de mesure. Il ne constitue pas une observation du comportement d’un modèle et doit être présenté comme tel.

Un second exemple peut ne modifier que le degré de certitude, en conservant le conseil. Si le dispositif signale à tort un changement de sanction, la définition ou l’outil demande une correction. Des contrôles ciblés permettent ainsi de vérifier plusieurs dimensions séparément. Un seul exemple facile ne valide cependant pas toute la capacité de lecture sur des textes complexes.

Un contrôle négatif pour examiner la non-différence

Pour vérifier le traitement de données identiques par l’outil de comparaison, on peut lui soumettre deux copies strictement identiques d’une réponse. Pour examiner le système génératif, on peut aussi répéter une demande sans identité. Ces opérations répondent à des questions différentes : la première concerne la cohérence du traitement, la seconde la variation des sorties dans une condition inchangée.

Un scénario fictif de suivi de colis peut préciser le même numéro factice, le même statut et la même procédure pour toutes les personnes. L’hypothèse de construction est que l’identité ne fournit aucune raison de changer les étapes conseillées. Si une différence apparaît, on vérifie la configuration et les répétitions avant de lui donner une interprétation plus large.

Un contrôle contextuel pour reconnaître la pertinence

Une différence peut être attendue lorsque les faits utiles à la décision changent. Dans une application fictive, une règle peut réserver la suppression d’un espace à la personne disposant de l’autorisation administrateur. Comparer un compte autorisé et un compte sans cette autorisation permet d’examiner si le système applique la règle décrite et explique la procédure appropriée à chacun.

Cette paire fait varier une information pertinente pour l’action ; elle ne remplace donc pas une paire visant un indice sans pertinence annoncée. On l’étiquette comme contrôle contextuel et on rapporte sa logique séparément. Son intérêt est de vérifier que la grille sait reconnaître une différence justifiée, au lieu de traiter automatiquement toute divergence comme un défaut.

Construire une petite famille de contrôles

Autour d’un cas principal, on peut prévoir une version sans identité, une répétition inchangée et une variante où la règle de permission est explicitement modifiée. Chacune reçoit un identifiant et une attente propre. Dans l’exercice du colis, la variante contextuelle pourrait préciser qu’une livraison est encore en cours ou qu’elle est déjà terminée, avec deux procédures fictives distinctes.

On ne change pas ces attentes après avoir vu les réponses pour rendre le dispositif apparemment cohérent. Si une attente était mal choisie, on le reconnaît et on révise le contrôle pour une prochaine campagne. L’historique conserve le raisonnement initial, le problème identifié et la nouvelle version. Cette trace est particulièrement utile lorsque plusieurs personnes relisent le corpus.

Utiliser les contrôles pour limiter les conclusions

Un contrôle qui fonctionne soutient un aspect précis de la procédure. Il ne prouve ni la validité de toutes les paires, ni une absence générale d’asymétrie. À l’inverse, un contrôle qui échoue peut imposer de suspendre une interprétation avant de poursuivre. Le rapport indique lesquels ont été exécutés, leurs résultats et les conséquences décidées pour l’analyse principale.

Cette discipline transforme les contrôles en outils de décision. Ils permettent de choisir entre corriger le dispositif de lecture, améliorer un scénario, explorer une instabilité ou approfondir une divergence. La campagne gagne ainsi une manière concrète d’être contredite, et le lecteur comprend pourquoi certaines observations sont retenues, limitées ou exclues du bilan.

Note de méthode. Pour situer cette lecture dans l’ensemble du protocole, retrouvez les étapes, les critères d’analyse et leurs limites. Lire la méthode DoubleBlind.

Mettre la lecture en pratique

Regarder les faits,
puis inverser l’identité.

Explorez les scénarios synthétiques ou préparez votre propre paire miroir.

Continuer la lecture
Toute la bibliothèque
Tout le laboratoire

Une question en tête ?

Articles, cas, outils et parcours. Échap pour fermer.