Neural signatures of predictive coding in natural speech listening

Peter W. Donhauser · 2019

Le traitement de la parole dans le cerveau a été décrit comme une séquence hiérarchique d'étapes allant de régions corticales de bas niveau aux régions corticales de haut niveau. Commençant par l'analyse acoustique de la parole, ceci est alors suivi par la catégorisation des sons de la parole en phonèmes, puis la détection des mots et enfin l'extraction du sens des phrases. Contrairement à cette vision ascendante du traitement sensoriel, la théorie du codage prédictif affirme que les régions de haut niveau du cerveau génèrent activement des prédictions sur les données sensorielles en fonction du contexte. Celles-ci sont propagées dans les régions sensorielles de bas niveau, dont le rôle est de détecter puis de relayer les erreurs résiduelles existant entre les données sensorielles prédites et observées. Dans cette thèse, je décris une enquête qui soutient le point de vue de l'existence d'un codage prédictif du traitement de la parole. Je conduis une série d'expériences avec des participants humains qui écoutent des extraits de parole naturelle et continuelle pendant que j'enregistre l'activité neuronale en temps réelle en utilisant la magnétoencéphalographie (MEG). Par l'entremise de deux études, je démontre que les réponses neuronales à la parole naturelle sont organisées en deux échelles de temps distinctes: l'activité rapide de la bande thêta (3-8 Hz) dans les régions de bas niveau et l'activité lente de la bande delta (<3 Hz) dans les régions de haut niveau ainsi que, dans une moindre mesure, dans les régions de bas niveau. Je démontre également que l'activité dans ces deux échelles de temps est modulée par des prédictions contextuelles. Lorsque la parole est manipulée de façon à être moins prévisible, les réponses neuronales lentes dans les régions de bas et de haut niveau sont augmentées, ce qui correspond à une augmentation de l'activité liée aux erreurs (manuscrit 2). De plus, je démontre (manuscrit 3) qu'une plus grande incertitude par rapport à un phonème à venir conduit à une augmentation des réponses de la bande thêta dans les régions de bas niveau, ce qui suggère une modulation prospective du gain sensoriel. Les réponses en bande delta, en contraste, sont augmentées pour les phonèmes informatives ou inattendues, conformément au codage prédictif et à l'inhibition des réponses aux stimulus prédits. Les résultats de cette enquête ont été rendus possibles grâce à deux importants développements méthodologiques. Premièrement, j'ai proposé une nouvelle approche pour la détection de sources anatomiques distinctes à partir des données du MEG (manuscrit 1), ce qui a joué un rôle déterminant dans la séparation régionale et spectrale de l'activité neuronale liée à la parole. Deuxièmement, j'ai proposé une architecture de réseau neuronal qui modélise les prédictions générées pendant l'écoute de la parole sur les phonèmes et les mots à venir (manuscrit 3). Ceci a permis la séparation fonctionnelle de l'activité neuronale liée à l'incertitude de l'activité neuronale liée à l'erreur. Par conséquent, cette thèse introduit une nouvelle approche pour l'étude du traitement neuronal de la parole, d'une manière très engageante pour les participants, tout en étant théoriquement guidée par le codage prédictif et en effectuant une caractérisation fonctionnelle basée sur un modèle computationnel.

Read the paper · More papers on PaperTik