Entend-on un pleur, dans ces trois secondes ?

Chaque clip est une erreur d'au moins un des trois modèles au rappel visé. Soit le modèle s'est trompé, soit l'étiquette est fausse, et aucune courbe ne peut trancher. Vous n'entendez rien d'autre que l'audio : ni le nom du fichier, ni l'étiquette, ni le score — ils ne s'affichent qu'une fois votre réponse donnée.

Priorité
Cadence
commencez à annoter
clip
0 s
Répondez pour révéler l'étiquette d'origine.

Pourquoi à l'aveugle

Montrer l'étiquette avant la réponse ne demande plus « qu'entendez-vous » mais « êtes-vous d'accord », et la seconde question se répond oui par défaut. Le verdict est donc absolu, et la confirmation ou l'infirmation en est déduite après coup.

Trois secondes, pas cinq

Les clips durent 5 s mais les modèles sont notés sur les 3 premières (fixed_window). Ré-annoter les 5 s ré-importerait l'ambiguïté que l'exercice existe pour retirer : ce qui est joué est ce qui a été noté.

Ce que P1 teste

Les paliers sont emboîtés, donc le taux d'infirmation se lit contre le palier. Si P1 n'est pas plus infirmé que P3, le consensus des modèles ne dit rien de la qualité des étiquettes et l'hypothèse tombe d'elle-même.

Où ça vit

Les verdicts restent dans le stockage local de ce navigateur, sur cette machine. Rien n'est envoyé nulle part. Un export CSV est la seule copie durable ; l'import fusionne, il n'écrase pas.