Chaque clip est une erreur d'au moins un des trois modèles au rappel visé. Soit le modèle s'est trompé, soit l'étiquette est fausse, et aucune courbe ne peut trancher. Vous n'entendez rien d'autre que l'audio : ni le nom du fichier, ni l'étiquette, ni le score — ils ne s'affichent qu'une fois votre réponse donnée.
Montrer l'étiquette avant la réponse ne demande plus « qu'entendez-vous » mais « êtes-vous d'accord », et la seconde question se répond oui par défaut. Le verdict est donc absolu, et la confirmation ou l'infirmation en est déduite après coup.
Les clips durent 5 s mais les modèles sont notés sur les 3 premières
(fixed_window). Ré-annoter les 5 s ré-importerait l'ambiguïté que
l'exercice existe pour retirer : ce qui est joué est ce qui a été noté.
Les paliers sont emboîtés, donc le taux d'infirmation se lit contre le palier. Si P1 n'est pas plus infirmé que P3, le consensus des modèles ne dit rien de la qualité des étiquettes et l'hypothèse tombe d'elle-même.
Les verdicts restent dans le stockage local de ce navigateur, sur cette machine. Rien n'est envoyé nulle part. Un export CSV est la seule copie durable ; l'import fusionne, il n'écrase pas.