Obtention d'une segmentation de la parole avec une précision sous-trame grâce à une analyse multimodale computationnelle : mise en relation des exigences des neurosciences avec des solutions d'ingénierie
Titre original en anglais : Achieving Sub-Frame Precision Speech Segmentation Through Computational Multimodal Analysis: Bridging Neuroscience Requirements with Engineering Solutions
Poplin, M., Hughes, M., McCrory, B., & Modyanova, N. (2026). Achieving Sub-Frame Precision Speech Segmentation Through Computational Multimodal Analysis: Bridging Neuroscience Requirements with Engineering Solutions. 2026 International Conference on Artificial Intelligence, Computer, Data Sciences and Applications (ACDSA), 1-6. https://doi.org/10.1109/acdsa67686.2026.11468095
Cette publication est intégrée dans AutiHub via :
Auteurs
Résumé
Des recherches récentes en neurosciences révèlent que l'intégration audiovisuelle de la parole se produit dans des fenêtres temporelles spécifiques de$100-300 \text{ms}$, les mouvements des lèvres entraînant les oscillations cérébrales à$\mathbf{2 - 7 H z}$correspondant au débit syllabique. L'étude de ces phénomènes, en particulier dans les populations cliniques où les différences de synchronisation peuvent servir de biomarqueurs, nécessite un contrôle temporel précis que les outils actuels de traitement vidéo ne peuvent pas fournir. Nous présentons une nouvelle approche computationnelle qui combine la détection de repères faciaux fondée sur MediaPipe comme déclencheur visuel avec une validation des débuts audio fondée sur LibROSA, atteignant une précision temporelle sous-trame grâce à la détection des débuts audio à des intervalles de 5 ms. Contrairement aux études antérieures en neurosciences qui utilisaient des stimuli à mot unique préparés manuellement, notre système traite un discours continu tout en maintenant la précision temporelle requise pour les expériences EEG/fNIRS. L'étape de détection visuelle identifie les mouvements de la bouche à l'aide de 468 repères faciaux, déclenchant une analyse audio ciblée dans une fenêtre de recherche de 300 ms fondée sur la neurobiologie. L'évaluation sur des vidéos de présentation démontre une exactitude d'extraction des segments de 92 à 100 % avec des vitesses de traitement de$0.556 \times$le temps réel. L'implémentation actuelle cible des enregistrements à locuteur unique, avec visage de face et qualité audio contrôlée. Cela permet une investigation à grande échelle des différences d'intégration audiovisuelle, ce qui est particulièrement pertinent pour la recherche sur le trouble du spectre de l'autisme, dans lequel une liaison temporelle altérée peut caractériser la condition.
Bibliographie citée par cette référence
Les références citées sont importées depuis des sources externes de métadonnées lorsqu’elles sont disponibles. La liste peut être partielle.
Vue d’ensemble de l’inclusion dans la bibliographie
Ces indicateurs décrivent la bibliographie citée importée pour cette publication. Les métriques de références citées utilisent le total des références citées comme dénominateur. Les métriques d’auteurices cité·es indiquent si elles utilisent toutes les occurrences d’auteurices cité·es ou seulement les occurrences rattachées à des auteurices déjà intégré·es à la base de données AutiHub. Ils utilisent les rattachements mis en cache entre les auteurices cité·es et les auteurices intégré·es à la base de données AutiHub. Dernier calcul : 16/08/2026 11:31.
-
HARRY MCGURK , JOHN MACDONALD (1976). Hearing lips and seeing voices . Nature, 264(5588), 746-748. Springer Science and Business Media LLC.Crossref OpenAlex
-
Chandramouli Chandrasekaran , Andrea Trubanova , Sébastien Stillittano , Alice Caplier , Asif A. Ghazanfar (2009). The Natural Statistics of Audiovisual Speech . PLoS Computational Biology, 5(7), e1000436. Public Library of Science (PLoS).Crossref OpenAlex
-
Ayaz A. Shaikh , Dinesh K. Kumar , Wai C. Yau , M. Z. Che Azemin , Jayavardhana Gubbi (2010). Lip reading using optical flow and support vector machines . 2010 3rd International Congress on Image and Signal Processing, 327-330. IEEE.Crossref OpenAlex
-
Hyojin Park , Christoph Kayser , Gregor Thut , Joachim Gross (2016). Lip movements entrain the observers’ low-frequency brain oscillations to facilitate speech intelligibility . eLife, 5. eLife Sciences Publications, Ltd.Crossref OpenAlex
-
Patrick Reisinger , Marlies Gillis , Nina Suess , Jonas Vanthornhout , Chandra Leon Haider , Thomas Hartmann et al. (2025). Neural Speech Tracking Contribution of Lip Movements Predicts Behavioral Deterioration When the Speaker's Mouth Is Occluded . eneuro, 12(2), ENEURO.0368-24.2024. Society for Neuroscience.Crossref OpenAlex
-
Jongseo Sohn , Nam Soo Kim , Wonyong Sung (1999). A statistical model-based voice activity detection . IEEE Signal Processing Letters, 6(1), 1-3. Institute of Electrical and Electronics Engineers (IEEE).Crossref OpenAlex
-
Kazuki Sekine , Christina Schoechl , Kimberley Mulder , Judith Holler , Spencer Kelly , Reyhan Furman et al. (2020). Evidence for children’s online integration of simultaneous information from speech and iconic gestures: an ERP study . Language, Cognition and Neuroscience, 35(10), 1283-1294. Informa UK Limited.Crossref OpenAlex
-
Brian McFee , Colin Raffel , Dawen Liang , Daniel Ellis , Matt McVicar , Eric Battenberg et al. (2015). librosa: Audio and Music Signal Analysis in Python . Proceedings of the Python in Science Conference, 18-24. SciPy.Crossref OpenAlex
-
Kartynnik (2019). Real-time facial surface geometry from monocular video on mobile GPUs . CVPR Workshop on Computer Vision for Augmented and Virtual Reality.Type: AutreCrossref
-
Frédéric Roux , Blair C. Armstrong , Manuel Carreiras (2017). Chronset: An automated tool for detecting speech onset . Behavior Research Methods, 49(5), 1864-1881. Springer Science and Business Media LLC.Crossref OpenAlex
-
Arnab Dey , Kousik Dasgupta (2022). Emotion Recognition Using Deep Learning in Pandemic with Real-time Email Alert . Dans Lecture Notes in Electrical Engineering (pp. 175-190). Springer Singapore.Type: Chapitre de livre DOI: 10.1007/978-981-16-8862-1_13 OpenAlex: https://openalex.org/W4226493412Crossref OpenAlex
-
Diego Resende Faria , Abraham Itzhak Weinberg , Pedro Paulo Ayrosa (2024). Multimodal Affective Communication Analysis: Fusing Speech Emotion and Text Sentiment Using Machine Learning . Applied Sciences, 14(15), 6631. MDPI AG.Crossref OpenAlex
-
Stavros Petridis , Themos Stafylakis , Pingehuan Ma , Feipeng Cai , Georgios Tzimiropoulos , Maja Pantic (2018). End-to-End Audiovisual Speech Recognition . 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 6548-6552. IEEE.Crossref