Vizzia · Détection de pleurs de bébé · 20 août 2026 · page 2 sur 3
Sélection des modèles :
six candidats, et un plafond commun.
Ce que chaque modèle exige, ce qu'il sait nommer, ce qu'il vaut sur le corpus de référence, et sur quelle durée d'écoute le faire tourner. Six modèles, un seul protocole — et pourquoi le septième ne changerait rien.
01 — Les modèles
Ce que chaque modèle exige, a appris, et peut réapprendre
| Modèle | Durée d'audio exigée | Fréquence | Coût | Ce sur quoi il a été entraîné | Réentraînement |
|---|---|---|---|---|---|
| CED ced-small | libre — à partir de 0,15 s | 16 kHz | 15 ms | AudioSet, distillé d'un ensemble de modèles | possible, non nécessaire : il gagne déjà sans réglage |
| YamNet | libre — par tranches de 0,975 s | 16 kHz | 6 ms | AudioSet uniquement | déjà fait sonde entraînée sur ses représentations |
| EfficientAT mn10_as | libre | 32 kHz | 57 ms | AudioSet uniquement | possible (code d'entraînement public, MIT) |
| MS-CLAP 2023 | 7 s imposées — plus court = son répété en boucle | 44,1 kHz | 62 ms | 4,6 M de paires son–texte (AudioSet, FreeSound) | possible ; levier gratuit = réécrire ses 24 descriptions de classes |
| LAION-CLAP | 10 s imposées | 48 kHz | 220 ms | LAION-Audio-630K | éliminé |
Les classes de sons que chaque modèle sait nommer
MS-CLAP et LAION-CLAP · 24 classes rédigées à la main
Sons de bébé
Sons d'enfant plus grand
Présence adulte
Maison
Nature et extérieur
Chaque classe est une phrase — « this is a sound of a baby grunting ». On peut donc en ajouter, en retirer ou en reformuler sans réentraîner quoi que ce soit. Les quatre classes d'enfant plus grand ont justement été ajoutées après avoir constaté que rien n'absorbait ces sons.
CED, EfficientAT et YamNet · le catalogue AudioSet, figé
527 classes (521 pour YamNet), les mêmes pour les trois. 13 seulement ont un rapport avec le problème, et une seule désigne le pleur de bébé :
Les 13 classes pertinentes sur 527
Ce qui n'existe pas dans le catalogue
Le détail est savoureux et il explique tout : Babbling existe, mais il est classé dans la parole, juste à côté de « narration » ; Grunt existe, mais entre « fredonner » et « siffler », sans rapport avec un nourrisson ; et Coo — le gazouillis — se trouve entre « Pigeon » et « Corbeau » : c'est le roucoulement d'oiseau.
Cette liste est figée : ajouter « gazouillis de bébé » exigerait de réentraîner le modèle. C'est pourquoi ces trois modèles rangent leurs erreurs sous « parole » — ils n'ont pas d'autre mot.
Et la sonde YamNet : aucune classe
C'est un détecteur binaire entraîné sur nos données — pleur ou non-pleur, rien d'autre. Il gagne en performance sur le corpus qui l'a entraîné, mais il ne peut rien dire de ce qu'il a cru entendre.
La durée exigée décide de l'architecture
MS-CLAP réclame 7 secondes d'audio quoi qu'il arrive. Lui en donner 3 revient à lui répéter les mêmes 3 secondes deux fois et demie : aucune information de plus, tout le calcul en plus.
Aucun n'a vu notre corpus de référence
deBarbaroCry est sous accès protégé et absent du web ouvert. C'est ce qui rend ses résultats crédibles — contrairement à ceux mesurés sur AudioSet.
Réentraîner suppose d'abord de réparer les étiquettes
Avec ~40 % d'erreurs sur les fausses alarmes à score élevé, réentraîner aujourd'hui revient à apprendre le bruit. C'est ce qui rend l'annotation prioritaire.
02 — Comparaison
Aucun modèle ne débloquera ce sujet
Chaque courbe montre le compromis d'un modèle : plus on veut détecter de pleurs (axe vertical), plus on déclenche à tort (axe horizontal). Six candidats, un seul protocole — et le message de ce graphique n'est pas lequel gagne, c'est à quel point ils se ressemblent.
Aire sous la courbe ROC · survolez pour isoler
Ce que le graphique dit vraiment
Les quatre courbes du milieu sont superposées. Leur écart (0,004) est plus petit que l'incertitude de mesure — et bien plus petit que les erreurs d'étiquetage du corpus. Choisir entre eux sur ce graphique n'aurait aucun sens.
CED se détache, et l'écart tient statistiquement : comparaison appariée bébé par bébé sur les 21 sujets, l'intervalle de confiance de l'écart exclut zéro. Mais l'écart vaut +0,014 — à comparer aux ~40 % d'erreurs d'étiquetage de la page Données.
LAION-CLAP est nettement en dessous — éliminé.
Le même corpus, l'autre métrique : le classement bascule
| Modèle | ROC-AUC | PR-AUC |
|---|---|---|
| CED | 0,9516 · 1er | 0,9526 · 1er |
| Sonde YamNet | 0,9430 · 2e | 0,9313 · 4e |
| YamNet | 0,9394 · 3e | 0,9292 · 5e |
| EfficientAT | 0,9379 · 4e | 0,9323 · 3e |
| MS-CLAP | 0,9358 · 5e | 0,9389 · 2e |
MS-CLAP passe de 5e à 2e selon la métrique choisie. Ce n'est pas une contradiction : c'est la démonstration que ces modèles ne sont pas départageables. Quand l'ordre dépend de la règle de lecture, c'est qu'il n'y a pas d'ordre.
Deux précautions de lecture
La courbe de YamNet est anguleuse : son score n'a que 27 valeurs possibles. Il n'offre donc que 27 réglages de sensibilité, ce qui limite tout ajustement fin.
Ce graphique flatte tout le monde : à 50 % de pleurs, les courbes paraissent excellentes. Mesuré depuis : sur un corpus où les pleurs ne représentent que 1,7 %, les ROC-AUC restent toutes entre 0,97 et 0,99 pendant que les PR-AUC s'étalent de 0,64 à 0,87. Ce sont les mesures de la page Résultats qui décident.
Six modèles, deux métriques, 37 085 extraits : l'écart entre le meilleur et le quatrième est de 0,014, quand le corpus qui sert à les mesurer contient de l'ordre de 40 % d'erreurs d'étiquetage sur ses cas difficiles. Le prochain gain ne viendra pas d'un septième modèle, il viendra d'une donnée plus fiable.
03 — Durée d'écoute
Écouter 5 s, 3 s, ou décider chaque seconde ?
Deux réglages indépendants : combien de son on écoute avant de décider, et sous quelle forme on le donne au modèle — d'un seul tenant, ou découpé en tranches d'une seconde jugées séparément. Les deux comptent, et pas de la même façon selon le modèle.
Qualité de détection
Fausses alarmes, à 95 % de pleurs attrapés
✕ = objectif inatteignable : sous 3 secondes, YamNet ne peut pas attraper 95 % des pleurs, quel que soit le réglage — 17 % d'entre eux reçoivent un score exactement nul.
Ce graphique est tracé à 95 % de pleurs attrapés, parce que c'est le seul réglage où ce plafond de YamNet apparaît. Les tableaux ci-dessous sont au réglage de service, 90 % — d'où des taux plus bas.
| On écoute | Forme | Qualité | Fausses alarmes | soit × la référence |
|---|---|---|---|---|
| 1 s | une tranche | 0,877 | 44,3 % | × 3,8 |
| 3 s | 3 tranches d'1 s | 0,924 | 19,6 % | × 1,7 |
| 3 s | d'un seul tenant | 0,937 | 16,4 % | × 1,4 |
| 5 s | 5 tranches d'1 s | 0,939 | 14,3 % | × 1,2 |
| 5 s | d'un seul tenant | 0,953 | 11,7 % | référence |
Trois lectures
- La forme compte autant que la durée. Les mêmes 3 secondes, données d'un bloc plutôt qu'en trois morceaux, retirent 16 % des fausses alarmes de CED (19,6 % → 16,4 %). YamNet, lui, ne bouge pas : ses tranches internes font déjà une seconde.
- Passer de 5 s à 3 s coûte ~40 % de fausses alarmes en plus (11,7 % → 16,4 %), à qualité de détection presque identique. C'est le prix de la réactivité, et il est chiffré.
- Sur la qualité seule, 3 s d'un tenant égale 5 s découpées (0,937 contre 0,939). Mais sur les fausses alarmes, 5 s découpées restent meilleures (14,3 % contre 16,4 %) — c'est cette colonne-là qui décide.
| Modèle | Qualité | Fausses alarmes | Coût |
|---|---|---|---|
| CED | 0,937 | 16,4 % | ≈9 ms |
| MS-CLAP | 0,923 | 26,7 % | 62 ms |
| YamNet | 0,918 | 17,9 % | ≈2 ms |
MS-CLAP est le plus lent et le plus bruyant : ses 7 secondes obligatoires lui font entendre les mêmes 3 secondes répétées deux fois et demie.