Vizzia · Détection de pleurs de bébé · 20 août 2026 · page 1 sur 3
Les données :
ce qu'il faut vraiment séparer.
Le problème n'est pas « un pleur contre du bruit », c'est « un pleur contre le reste de ce que fait ce bébé ». Cette page pose le verrou technique, le mesure sur les erreurs réelles, dit ce que vaut chacun des cinq corpus, et spécifie le paysage sonore que le produit doit couvrir — 37 085 extraits, 21 bébés.
01 — La problématique
Reconnaître un pleur parmi les autres sons du même bébé
Le babyphone écoute une chambre où le bébé est seul. C'est ce détail qui change tout : le son concurrent n'est pas la télévision ni la voix des parents, c'est le bébé lui-même qui babille, gazouille, grogne ou rit.
Ce qu'on croit devoir séparer
Un pleur d'un bruit de porte, d'une voiture, d'un chien. C'est facile — et ce n'est pas le vrai problème.
Ce qu'il faut vraiment séparer
Un pleur d'un babillage du même bébé, sur le même micro, dans la même pièce. C'est là que tous les modèles se trompent.
01 — La problématique · le verrou
Le verrou technique : distinguer un pleur d'un babillage
Ce n'est pas une intuition. Les deux graphiques ci-dessous disent la même chose, l'un sur les données, l'autre sur les erreurs : ce que le détecteur doit trancher, ce sont les vocalisations d'un même bébé entre elles.
Ce que MS-CLAP reconnaît dans les 18 352 sons « non-pleurs »
La classe que le modèle place en tête. Trois négatifs sur quatre sont de la voix humaine, et 28 % sont des vocalisations du bébé lui-même. Les bruits d'ambiance sont marginaux — le chien, la porte, la voiture n'apparaissent quasiment pas.
Sur ses fausses alarmes, qu'entend-il d'autre que le pleur ?
Sur ses fausses alarmes, la meilleure classe après le pleur. Les trois premières totalisent 80 %, et ce sont toutes des sons de bébé. Le modèle reconnaît bien « un bébé vocalise » — il échoue sur quelle sorte de vocalisation.
Et l'erreur va dans les deux sens : sur un vrai pleur, MS-CLAP ne met « pleur » en tête que 62 % du temps — dans 23 % des cas, la classe qu'il choisit est le babillage. Le problème n'est pas « pleurs contre bruit », c'est « pleurs contre le reste de ce que fait ce bébé ».
Pourquoi le choix du corpus en découle
Un jeu de données dont les sons concurrents sont la pluie et les tronçonneuses ne mesure rien de ce problème. C'est ce qui disqualifie ESC-50 et relègue AudioSet.
Pourquoi les étiquettes sont en cause
Pleur et babillage coexistent dans un même extrait, mais l'étiquette est binaire. La frontière est donc parfois tracée du mauvais côté — ce que le test d'écoute a confirmé.
Comment lire ces deux graphiques
Les catégories ne sont pas des étiquettes du corpus : deBarbaroCry ne nomme pas ses négatifs, il dit seulement « pleur / pas pleur ». Ce sont les classes que MS-CLAP leur attribue, sur les 37 085 extraits et 21 bébés. C'est un proxy — et c'est exactement le manque que FSD50K vient combler.
Pourquoi c'est aussi le levier
MS-CLAP est le seul modèle à nommer « gazouillis » et « grognement ». Les autres rangent tout sous « parole ». C'est ce vocabulaire qui rend l'erreur attaquable plutôt que constatée.
02 — Les données
Un seul corpus fait foi. Les trois autres ont un rôle étroit.
| Corpus | Extraits | Ce qu'il contient | Ce qu'il vaut |
|---|---|---|---|
| deBarbaroCry | 37 085 | 21 bébés enregistrés à leur domicile, moitié pleurs / moitié autres sons des mêmes bébés | Référence le seul dont les sons concurrents ressemblent au produit, et le seul qu'aucun modèle n'a vu à l'entraînement |
| AudioSet | 1 368 | extraits YouTube — pleurs, voix d'enfants, rires | Contaminé nos extraits viennent du lot d'entraînement des modèles testés |
| ESC-50 | 2 000 | 40 pleurs noyés dans pluie, tronçonneuse, hélicoptère | Trop facile deux modèles y font un score parfait — il ne départage rien |
| FSD50K nouveau | 3 584 | 36 catégories de sons de chambre nommées — cri, toux, chat, rire, respiration — et 1,7 % de pleurs seulement | Fausses alarmes le seul corpus où une fausse alarme porte un nom, donc se corrige |
| TheBoby | 47 | le seul audio capté sur notre matériel — que des pleurs | Contrôle vérifie que le micro réel n'est pas hors sujet, rien de plus |
Trou n°1 · comblé pour la mesure, pas pour l'entraînement
FSD50K apporte 3 524 sons de chambre étiquetés — nous en avions 25. Nous savons désormais sur quoi chaque modèle se trompe. Reste à s'en servir pour entraîner et pour fixer le seuil.
Trou n°2 · Les pleurs sont trop fréquents
Le corpus est à 50 % de pleurs. Dans une vraie chambre ils sont rares. Impossible d'en déduire un nombre de fausses alarmes par nuit — le seul chiffre qui intéresse un parent.
Trou n°3 · Les étiquettes du corpus de référence sont douteuses
Test d'écoute à l'aveugle sur 10 fausses alarmes à score élevé : 4 étaient de vrais pleurs mal étiquetés. Sur 10 clips et un seul auditeur, c'est un signal, pas une mesure — mais le sens ne fait pas de doute, et l'ordre de grandeur dépasse l'écart entre les modèles (0,004 à 0,014).
Le transformer en mesure coûte ~17 minutes d'écoute : 200 extraits tirés au sort. C'est le chantier n°1.
03 — Le paysage sonore
Ce qu'on a en magasin, et ce qui manque vraiment
Le produit n'est pas un détecteur binaire, c'est un classifieur d'événements de chambre dont le pleur est la classe critique. Nous avons donc décrit tout ce qu'un moniteur peut entendre — 52 classes — puis nous sommes allés les chercher. Elles sont là : 5 980 extraits sur disque, dont 4 550 ont déjà servi.
| Ce qu'on entend | Classes | Extraits |
|---|---|---|
| Le pleur · la classe cible | 1 | 725 |
| Le bébé, hors pleur · babillage, gazouillis, hoquet, rire… | 8 | 925 |
| Enfant plus grand · fratrie, cris, sanglots | 7 | 705 |
| Le parent · parole, chuchotement, berceuse | 5 | 504 |
| Événements de la pièce · porte, chute, froissement, pas | 9 | 912 |
| Le reste du logement · évier, chasse d'eau, aspirateur… | 8 | 802 |
| Extérieur · pluie, voiture, orage, sirène | 7 | 707 |
| Appareils de la chambre · ventilateur, TV, mobile | 3 | 300 |
| Animaux · chat, chien, oiseau | 3 | 300 |
| Chambre au repos · silence | 1 | 100 |
| Total | 52 | 5 980 |
Ce qui a déjà servi 36 classes · 3 630 extraits
La moitié issue de FSD50K, aux étiquettes vérifiées à l'oreille. C'est elle qui a produit le résultat le plus utile du projet : le classement des modèles s'inverse quand on les confronte à de vrais sons de chambre.
C'est aussi le seul corpus où une fausse alarme porte un nom de son, donc où elle se diagnostique au lieu de se compter. 3 584 de ces extraits ont été présentés aux modèles, après exclusion des étiquettes ambiguës.
Ce qui n'a jamais été présenté à un modèle 13 classes · 1 430 extraits
Le corpus AudioSet que nous avons évalué ne couvre que trois catégories de sons d'enfant : pleurs, rire de bébé, parole d'enfant. Les 13 autres classes téléchargées n'ont encore été soumises à aucun modèle.
Dont le babillage — le confondant central de cette présentation, celui sur lequel 61 % des fausses alarmes se produisent. Cent extraits, étiquetés, sur nos disques, jamais scorés.
Avec aussi le silence, la berceuse, le réveil, l'aspirateur et la télévision : tout le fond sonore réel d'une chambre.
Ce qui manque vraiment
Les sons qu'aucun corpus public ne contient, parce qu'ils sont propres au produit : la tétine et la succion, le mobile musical, le grincement du matelas quand l'enfant se retourne, une couche qu'on change — et le babyphone lui-même, souffle du haut-parleur et larsen.
Et ce qu'aucun téléchargement ne donnera : nos micros, nos pièces, nos bébés. C'est l'objet du corpus propriétaire.
Le paysage sonore est couvert à 100 % par des corpus publics, et un quart de ce qui est téléchargé n'a jamais été présenté à un modèle — à commencer par le babillage. Ce n'est pas la collecte qui est en retard sur ce projet, c'est ce qu'on en fait.