01 / 05

Vizzia · Détection de pleurs de bébé · 20 août 2026 · page 1 sur 3

Les données :
ce qu'il faut vraiment séparer.

Le problème n'est pas « un pleur contre du bruit », c'est « un pleur contre le reste de ce que fait ce bébé ». Cette page pose le verrou technique, le mesure sur les erreurs réelles, dit ce que vaut chacun des cinq corpus, et spécifie le paysage sonore que le produit doit couvrir — 37 085 extraits, 21 bébés.

01 — La problématique

Reconnaître un pleur parmi les autres sons du même bébé

Le babyphone écoute une chambre où le bébé est seul. C'est ce détail qui change tout : le son concurrent n'est pas la télévision ni la voix des parents, c'est le bébé lui-même qui babille, gazouille, grogne ou rit.

Ce qu'on croit devoir séparer

Un pleur d'un bruit de porte, d'une voiture, d'un chien. C'est facile — et ce n'est pas le vrai problème.

Ce qu'il faut vraiment séparer

Un pleur d'un babillage du même bébé, sur le même micro, dans la même pièce. C'est là que tous les modèles se trompent.

< 3 sdélai de réaction visé par le produit
2 questionsquel modèle, et à quel seuil de déclenchement — les deux restent ouvertes
F1 0,613meilleur résultat publié sur ce corpus, par ses propres auteurs, sur 24 h d'audio réel. C'est le niveau à battre.

01 — La problématique · le verrou

Le verrou technique : distinguer un pleur d'un babillage

Ce n'est pas une intuition. Les deux graphiques ci-dessous disent la même chose, l'un sur les données, l'autre sur les erreurs : ce que le détecteur doit trancher, ce sont les vocalisations d'un même bébé entre elles.

Ce que MS-CLAP reconnaît dans les 18 352 sons « non-pleurs »

Voix d'adulte27 %
Babillage de bébé18 %
Pas11 %
Parole d'enfant10 %
Jeux d'enfants7 %
Gazouillis de bébé7 %

La classe que le modèle place en tête. Trois négatifs sur quatre sont de la voix humaine, et 28 % sont des vocalisations du bébé lui-même. Les bruits d'ambiance sont marginaux — le chien, la porte, la voiture n'apparaissent quasiment pas.

Sur ses fausses alarmes, qu'entend-il d'autre que le pleur ?

Babillage61 %
Gazouillis12 %
Grognement7 %

Sur ses fausses alarmes, la meilleure classe après le pleur. Les trois premières totalisent 80 %, et ce sont toutes des sons de bébé. Le modèle reconnaît bien « un bébé vocalise » — il échoue sur quelle sorte de vocalisation.

Et l'erreur va dans les deux sens : sur un vrai pleur, MS-CLAP ne met « pleur » en tête que 62 % du temps — dans 23 % des cas, la classe qu'il choisit est le babillage. Le problème n'est pas « pleurs contre bruit », c'est « pleurs contre le reste de ce que fait ce bébé ».

Pourquoi le choix du corpus en découle

Un jeu de données dont les sons concurrents sont la pluie et les tronçonneuses ne mesure rien de ce problème. C'est ce qui disqualifie ESC-50 et relègue AudioSet.

Pourquoi les étiquettes sont en cause

Pleur et babillage coexistent dans un même extrait, mais l'étiquette est binaire. La frontière est donc parfois tracée du mauvais côté — ce que le test d'écoute a confirmé.

Comment lire ces deux graphiques

Les catégories ne sont pas des étiquettes du corpus : deBarbaroCry ne nomme pas ses négatifs, il dit seulement « pleur / pas pleur ». Ce sont les classes que MS-CLAP leur attribue, sur les 37 085 extraits et 21 bébés. C'est un proxy — et c'est exactement le manque que FSD50K vient combler.

Pourquoi c'est aussi le levier

MS-CLAP est le seul modèle à nommer « gazouillis » et « grognement ». Les autres rangent tout sous « parole ». C'est ce vocabulaire qui rend l'erreur attaquable plutôt que constatée.

02 — Les données

Un seul corpus fait foi. Les trois autres ont un rôle étroit.

CorpusExtraitsCe qu'il contientCe qu'il vaut
deBarbaroCry37 08521 bébés enregistrés à leur domicile, moitié pleurs / moitié autres sons des mêmes bébésRéférence le seul dont les sons concurrents ressemblent au produit, et le seul qu'aucun modèle n'a vu à l'entraînement
AudioSet1 368extraits YouTube — pleurs, voix d'enfants, riresContaminé nos extraits viennent du lot d'entraînement des modèles testés
ESC-502 00040 pleurs noyés dans pluie, tronçonneuse, hélicoptèreTrop facile deux modèles y font un score parfait — il ne départage rien
FSD50K nouveau3 58436 catégories de sons de chambre nommées — cri, toux, chat, rire, respiration — et 1,7 % de pleurs seulementFausses alarmes le seul corpus où une fausse alarme porte un nom, donc se corrige
TheBoby47le seul audio capté sur notre matériel — que des pleursContrôle vérifie que le micro réel n'est pas hors sujet, rien de plus

Trou n°1 · comblé pour la mesure, pas pour l'entraînement

FSD50K apporte 3 524 sons de chambre étiquetés — nous en avions 25. Nous savons désormais sur quoi chaque modèle se trompe. Reste à s'en servir pour entraîner et pour fixer le seuil.

Trou n°2 · Les pleurs sont trop fréquents

Le corpus est à 50 % de pleurs. Dans une vraie chambre ils sont rares. Impossible d'en déduire un nombre de fausses alarmes par nuit — le seul chiffre qui intéresse un parent.

Trou n°3 · Les étiquettes du corpus de référence sont douteuses

Test d'écoute à l'aveugle sur 10 fausses alarmes à score élevé : 4 étaient de vrais pleurs mal étiquetés. Sur 10 clips et un seul auditeur, c'est un signal, pas une mesure — mais le sens ne fait pas de doute, et l'ordre de grandeur dépasse l'écart entre les modèles (0,004 à 0,014).

Le transformer en mesure coûte ~17 minutes d'écoute : 200 extraits tirés au sort. C'est le chantier n°1.

03 — Le paysage sonore

Ce qu'on a en magasin, et ce qui manque vraiment

Le produit n'est pas un détecteur binaire, c'est un classifieur d'événements de chambre dont le pleur est la classe critique. Nous avons donc décrit tout ce qu'un moniteur peut entendre — 52 classes — puis nous sommes allés les chercher. Elles sont là : 5 980 extraits sur disque, dont 4 550 ont déjà servi.

Le paysage sonore, par provenance du son
Ce qu'on entendClassesExtraits
Le pleur · la classe cible1725
Le bébé, hors pleur · babillage, gazouillis, hoquet, rire…8925
Enfant plus grand · fratrie, cris, sanglots7705
Le parent · parole, chuchotement, berceuse5504
Événements de la pièce · porte, chute, froissement, pas9912
Le reste du logement · évier, chasse d'eau, aspirateur…8802
Extérieur · pluie, voiture, orage, sirène7707
Appareils de la chambre · ventilateur, TV, mobile3300
Animaux · chat, chien, oiseau3300
Chambre au repos · silence1100
Total525 980

Ce qui a déjà servi  36 classes · 3 630 extraits

La moitié issue de FSD50K, aux étiquettes vérifiées à l'oreille. C'est elle qui a produit le résultat le plus utile du projet : le classement des modèles s'inverse quand on les confronte à de vrais sons de chambre.

C'est aussi le seul corpus où une fausse alarme porte un nom de son, donc où elle se diagnostique au lieu de se compter. 3 584 de ces extraits ont été présentés aux modèles, après exclusion des étiquettes ambiguës.

Ce qui n'a jamais été présenté à un modèle  13 classes · 1 430 extraits

Le corpus AudioSet que nous avons évalué ne couvre que trois catégories de sons d'enfant : pleurs, rire de bébé, parole d'enfant. Les 13 autres classes téléchargées n'ont encore été soumises à aucun modèle.

Dont le babillage — le confondant central de cette présentation, celui sur lequel 61 % des fausses alarmes se produisent. Cent extraits, étiquetés, sur nos disques, jamais scorés.

Avec aussi le silence, la berceuse, le réveil, l'aspirateur et la télévision : tout le fond sonore réel d'une chambre.

Ce qui manque vraiment

Les sons qu'aucun corpus public ne contient, parce qu'ils sont propres au produit : la tétine et la succion, le mobile musical, le grincement du matelas quand l'enfant se retourne, une couche qu'on change — et le babyphone lui-même, souffle du haut-parleur et larsen.

Et ce qu'aucun téléchargement ne donnera : nos micros, nos pièces, nos bébés. C'est l'objet du corpus propriétaire.

Le paysage sonore est couvert à 100 % par des corpus publics, et un quart de ce qui est téléchargé n'a jamais été présenté à un modèle — à commencer par le babillage. Ce n'est pas la collecte qui est en retard sur ce projet, c'est ce qu'on en fait.