Ученые из Китая с помощью высокоплотной электрокортикографии (ЭКоГ) показали, что во время мысленного произнесения слогов мозг кодирует движения губ, языка, челюсти и гортани. При этом часть нейронных популяций работает одинаково при реальной и воображаемой речи, а другая активируется только в одном из этих состояний. Используя эти сигналы, исследователи смогли с относительно высокой точностью распознавать мысленно произносимые слоги и даже восстанавливать звучание и артикуляционные движения. Работа опубликована в Nature Neuroscience.

Архитектура модели глубокого обучения для декодирования бета-1-активности в текст, аудиосигнал речи и движения артикуляторов
Внутренняя речь – это мысленное произнесение слов без движения речевого аппарата и слышимого звука. Мы постоянно используем ее, когда проговариваем про себя фразу, читаем текст или мысленно формулируем ответ. При этом остается не до конца понятно, насколько такая речь использует те же нейронные механизмы, что и обычное произнесение слов.
Предыдущие исследования с помощью фМРТ, МЭГ и ЭЭГ показывали, что при внутренней речи активируются некоторые из тех же областей, что и при настоящей артикуляции (прежде всего премоторная кора). Однако неинвазивные методы плохо подходят для изучения быстрых процессов в коре. Кроме того, внутренняя речь не сопровождается движениями мышц (если говорить о корректно поставленном эксперименте), поэтому было сложно определить, формирует ли мозг при этом детальный моторный план. В 2025 году исследователям из Стэнфорда уже удавалось декодировать внутреннюю речь пациентов с тетраплегией и дизартрией при помощи имплантации микроэлектродной матрицы в моторную и премоторную кору.
В новом исследовании участвовали 9 человек, которым проводили операцию по удалению опухоли мозга. Во время операции пациентам временно помещали на поверхность мозга две пластины общей сложности с 256 электродами, что является менее инвазивным методом, при этом искажений работы мозга от жизни с параличом конечностей и нарушениями речи не было. Это позволяло записывать активность большого участка лобно-теменной коры с высокой временной и пространственной точностью. Все участники были в сознании и выполняли задания непосредственно во время хирургического вмешательства.
Участники либо произносили вслух слоги, либо представляли их беззвучно. В первом варианте исследователи использовали 6 слогов, во втором — 8. Чтобы убедиться, что при мысленной речи человек действительно не двигает речевыми мышцами, ученые заранее обучали участников, наблюдали за ними во время эксперимента и у четырех человек дополнительно регистрировали ЭМГ мышц лица и рта.
Оказалось, что настоящая и мысленная речь действительно используют частично общую нейронную архитектуру, но активность мозга при них распределена по-разному. Особенно интересной оказался нижний диапазон бета-активности в диапазоне 12-24 Гц (так называемая бета-1-активность). При реальном произнесении сильнее всего артикуляционные движения кодировались в высокочастотном γ-диапазоне, а бета-1-активность была вторым по значимости сигналом. При мысленной речи ситуация менялась: именно бета-1-активность становилась основным источником информации об артикуляции).
Также ученые обнаружили два типа нейронных популяций. Первая группа демонстрировала сходные паттерны активности при настоящей и мысленной речи – вероятно, она участвует в общем планировании артикуляции. Вторая была преимущественно связана с реальным произнесением и гораздо слабее реагировала на мысленную речь.
Затем исследователи проверили, можно ли использовать обнаруженную активность для нейроинтерфейса. Они создали систему из трех параллельных потоков: первый классифицировал слог, второй восстанавливал звуковой сигнал, а третий предсказывал траектории движений артикуляторов (мышц рта, гортани).
Результат оказался близким как для настоящей, так и для мысленной речи. Медианная точность распознавания мысленно произносимого слога составила 80,4%, а реально произносимого – 78,3%.
Хотя нейросеть смогла распознать мысленные слоги с высокой точностью и синтезировать звук, уложившийся в рамки научно приемлемого качества, речь шла исключительно об искусственно сгенерированных компьютерных аудиофайлах отдельных изолированных слогов, а не о полноценных фразах. Причем в ходе эксперимента обычные люди лишь подтвердили, что синтезированный робоголосовой звук получается у модели одинаковым по качеству независимо от того, читал ли алгоритм сигналы реального произнесения или улавливал скрытую внутреннюю артикуляцию.
Нужно подчеркнуть, что обсуждаемое исследование пока далеко от готового нейропротеза речи. Во-первых, в нем участвовали всего девять человек, причем все они были пациентами с опухолями мозга, которым временно устанавливали электроды во время операции. Поэтому полученные результаты еще предстоит проверить у людей с постоянно имплантированными нейроинтерфейсами.
Кроме того, эксперименты проводились с небольшим набором слогов и ограниченным числом повторений. Насколько хорошо система будет работать с большим словарем, непрерывной речью и естественными предложениями, пока неизвестно. Авторы также отмечают, что записанный во время операции звук мог содержать фоновые шумы, а ЭМГ регистрировали только у четырех участников. Наконец, обнаружение моторных сигналов при внутренней речи само по себе не доказывает, что мозг не одновременно кодирует более абстрактные языковые представления.
Текст: Олег Юркин
Zhao, Z., Wang, Z., Liu, Y. et al. A neural architecture for imagined and overt speech motor dynamics. Nat Neuroscience (2026). https://doi.org/10.1038/s41593-026-02456-0
Читайте материалы нашего сайта во ВКонтакте, Одноклассниках, Яндекс-Дзен и каналах в Telegram и MAX