Deux réponses différentes ne suffisent pas à conclure.

Distinguer variation de formulation, changement de verdict, contexte pertinent et résultat instable.

Lire l’article

Décrire l’écart avant de le nommer

Deux réponses peuvent avoir des mots différents tout en recommandant la même action. Elles peuvent aussi sembler proches tout en déplaçant la responsabilité : l’une demande de poser une limite, l’autre de s’excuser. Une comparaison utile commence donc par une description explicite de ce qui change.

Notre grille de travail sépare notamment le vocabulaire, l’empathie, le blâme, la sanction et la certitude. Elle invite à citer le passage qui motive chaque annotation. Cette traçabilité permet à une autre personne de comprendre le raisonnement, puis de le contester sans devoir accepter un score global.

Demander si la différence a une raison pertinente

Une politique de service peut, par exemple, réserver une action aux titulaires d’un compte administrateur. Si le test change ce rôle, une réponse différente peut suivre la règle décrite dans le scénario. Le fait d’observer une divergence ne suffit donc pas à déterminer si elle est problématique.

La justification doit provenir des faits ou des règles réellement applicables à la tâche. Ajouter après coup une histoire que le scénario ne contient pas rend le raisonnement invérifiable. Lorsque l’explication reste incertaine, cette incertitude fait partie du résultat.

Examiner la stabilité

Pour un système génératif, une paire isolée fournit un exemple de réponse dans une configuration donnée. Un protocole de travail peut prévoir plusieurs exécutions, l’alternance des ordres et des conversations séparées. L’objectif est de voir si la différence réapparaît ou si elle se confond avec la variation entre exécutions.

Le nombre de répétitions dépend de la question, du coût et de l’analyse envisagée. Aucun nombre universel n’est annoncé ici comme garantie. La version du système, les paramètres disponibles et les limites d’accès doivent accompagner les résultats, afin que la portée de la comparaison reste lisible.

Garder plusieurs issues possibles

Une campagne peut aboutir à l’absence de divergence détectée, à une différence justifiée, à un écart qui mérite un examen approfondi ou à un test invalide. Elle peut également produire un résultat trop instable pour trancher. Conserver ces catégories évite de forcer chaque observation dans la même conclusion.

Aucune divergence détectée signifie seulement que le protocole n’en a pas mis en évidence dans son périmètre. Une divergence documentée ne devient pas davantage une propriété de tous les usages du système. DoubleBlind prévoit de publier les limites et les observations dans les deux directions ; les exemples de ce site n’attestent pas encore une campagne réalisée.

Note de méthode. Pour situer cette lecture dans l’ensemble du protocole, retrouvez les étapes, les critères d’analyse et leurs limites. Lire la méthode DoubleBlind.

Mettre la lecture en pratique

Regarder les faits,
puis inverser l’identité.

Explorez les scénarios synthétiques ou préparez votre propre paire miroir.

Continuer la lecture
Toute la bibliothèque
Tout le laboratoire

Une question en tête ?

Articles, cas, outils et parcours. Échap pour fermer.