耳をふさいでいないのに、聞こえていたはずの音が、ある瞬間だけ変わってしまうことがあります。種明かしをすると、音声そのものはずっと「バ」としか言っていません。変わったのは、映像に映っている口の動きだけです。
これは心理学で「マガーク効果(McGurk effect)」と呼ばれる現象です。1976年、ある研究室の録音ミスから偶然発見されたこの錯覚は、音声と映像をわざとズラすだけで、多くの人の耳に誰も発していない第三の音を聞かせてしまいます。
さらに面白いのは、この錯覚の起こりやすさに、人によって、そして言語によっても大きな差があるらしいという報告です。論文4本から、"目が耳を書き換える"仕組みを見ていきましょう。
なぜ"目で聞く"ようなことが起きるのか
人は会話をするとき、音声だけを聞いているわけではありません。無意識のうちに、相手の唇の動きや表情も同時に読み取っています。これは多感覚統合(たかんかくとうごう=目・耳など複数の感覚からの情報を、脳がひとつにまとめて処理するしくみ)と呼ばれる働きの一部です。
特に雑音の多い場所や、発音が聞き取りにくい場面ほど、脳は視覚情報(唇の動き)への依存を強めるとされています。騒がしい居酒屋で、つい相手の口元を見てしまう——あの行動は、この仕組みが働いている証拠かもしれません。
通常、音声と唇の動きはぴったり一致しているため、この"統合"作業が表に出てくることはありません。ところが、音声と映像のあいだに意図的なズレを作ると、普段は隠れているこの仕組みが、思いがけない形で姿を見せます。
実験:録音スタジオの偶然から生まれた錯覚
マガーク効果が世に知られるきっかけになったのは、1976年にHarry McGurkとJohn MacDonaldが『Nature』誌に発表した論文でした。もともと2人は、乳児がどのように言葉を聞き取るかを調べる実験の準備をしていたとされています。
映像に別録りの音声を当てはめる作業の途中、「ガ」と発音している口の映像に、「バ」という音声が重なって再生されるという出来事が起こります。研究室でこの映像を確認した2人が実際に聞いたのは、バでもガでもない「ダ」という、どちらの素材にも存在しない音でした。
この偶然をきっかけに、2人は音声と映像の組み合わせを変えた一連の実験を行います。基本の仕組みはシンプルです。
- 音声トラック:「バ」と発音している声を録音する
- 映像トラック:別撮りで「ガ」と発音している人の口の動きを撮影する
- この2つを同時に再生し、参加者に「何と言っているように聞こえるか」を答えてもらう
目を閉じて音声だけを聞けば「バ」、音声を消して映像だけを見れば「ガ」と読み取れる場面です。ところが両方を同時に見聞きすると、多くの人の耳には、どちらでもない融合した音(「ダ」など)が聞こえることが報告されました。
結果:個人差は0%から100%、国によっても差があった
マガーク効果そのものは、その後の追跡研究で何度も確認されてきました。ただし「誰にでも同じように起こる」とは言えないことも、同時にわかってきています。
Basu Mallick, Magnotti, & Beauchamp(2015)は、英語を話す165人の参加者に12種類の音声・映像ペアを提示し、融合した音を聞いたと答えた割合(融合反応率)を個人ごとに調べました。その結果、ある参加者はどの組み合わせを見ても融合した音を一度も感じず(0%)、別の参加者はほぼすべての組み合わせで融合した音を感じた(100%)という、非常に大きな個人差が報告されています。さらに、このうち40人を1年後に再テストしたところ、個人ごとの融合反応率はおおむね安定していたとされ、その日の気分ではなく、ある程度その人固有の特性である可能性が示唆されています。
もう一つ注目されているのが、言語による差です。Sekiyama & Tohkura(1991)は、日本語を母語とする10人を対象に、日本語の音節を使った実験を行いました。
| 条件 | 日本語話者への影響(Sekiyama & Tohkura, 1991) |
|---|---|
| 音声がはっきり聞こえる(ノイズなし) | 効果は小さく、音声の聞き取りにくさが残る場合にほぼ限られた |
| 音声が聞き取りにくい(ノイズを加えた) | 効果は大きく、広い範囲で融合した音が聞かれた |
この結果から、研究チームは「日本語版のマガーク効果は、英語版より起こりにくく、音声そのものがどれだけ聞き取りやすいかに左右される」と結論づけています。関連する研究では、日本語話者は英語話者に比べて、視覚情報(唇の動き)に影響される度合いがそもそも小さい傾向があるとも報告されました。
2024年に発表されたMagnotti, Lado, & Beauchamp(2024)の研究では、日本語を母語とする80人を対象に15種類の音声・映像ペアを提示したところ、融合反応が起きる割合は刺激ごとに3%から78%、参加者ごとに0%から91%まで幅があったと報告されています。日本語話者の集団全体として見ても、やはり"全員が同じように錯覚を起こす"わけではないことが、改めて確かめられた形です。
なぜこうなるのか
なぜ脳は、正しく聞こえた音と正しく見えた口の動きを、わざわざ別の第三の答えに統合してしまうのでしょうか。
有力な説明のひとつは、脳が音声と視覚の情報を、それぞれの"信頼度"に応じて重み付けしながら足し合わせている、という考え方です。音声があいまいなときほど視覚の重みが増し、音声がはっきりしているときは視覚の影響が小さくなる——Sekiyama & Tohkura(1991)で、ノイズを加えた条件のほうが効果が強く出たのも、この考え方と一致します。音声という手がかりの"信頼度"が下がった分だけ、脳が視覚という別の手がかりに頼る割合を増やした、と解釈できます。
もう一つの視点は、言語ごとの"聞き取りやすさ"の違いです。Sekiyamaらは、日本語は英語に比べて口の動きが伝える視覚的な情報量が少なく、使われる音の種類(音素)の数自体も少ないため、視覚に頼らずに音声だけで聞き分けやすい言語だという見方を示しています。英語のように音の種類が多く、似た音も多い言語ほど、視覚からの"補足情報"が聞き取りに果たす役割が大きくなる、という理屈です。
たとえるなら、音声は雑音混じりのラジオ放送、映像はその場で配られる"字幕の断片"のようなものです。ラジオの受信状態が良いときは字幕をあまり見ませんが、電波が悪くなるほど、人は無意識に字幕のほうを頼るようになる——マガーク効果は、その"頼り方"が極端な形で表に出た瞬間だと言えます。
この話、こう使える
マガーク効果の実験結果を、そのまま日常の会話に当てはめることはできません。ただ、"視覚が聞き取りを助ける"という仕組みの面白さから、持ち帰れる視点はいくつかあります。
注意点:この研究の限界
- 実験で使われた音声・映像は、特殊な人工刺激です。 単語や文ではなく、「バ」「ガ」のような単一の音節を人工的に組み合わせた刺激が使われています。日常の自然な会話が、実験と同じ比率で聞き間違いを引き起こすとは限りません。
- 日本語話者を対象にした研究は、参加者数が限られています。 Sekiyama & Tohkura(1991)の対象は10人、2024年の追跡研究でも80人規模です。言語差についての結論は、今後さらに大規模な検証が必要とされています。
- 言語間の差についての説明は、一つの解釈です。 視覚的な情報量や音素の数の違いといった説明は研究者による解釈であり、まだ議論が続いているテーマです。
- 知能や言語能力の優劣とは関係ありません。 マガーク効果の起こりやすさは、あくまで音声と視覚の統合のしかたについての個人差・言語差であり、何らかの能力を測る指標ではありません。
よくある質問
今日の3行まとめ
これは脳が声と唇の動きを自動的に統合して聞こえる音を決めているために起こり、感じやすさには0%から100%まで非常に大きな個人差があります。
日本語話者は英語話者より影響を受けにくいとする報告もあり、"聞く"という体験は、実は耳だけでなく目にも左右されています。
マガーク効果のように、母語によって音の聞き取り方が変わる現象は他にもあります。日本人がRとLの聞き分けをどこまで訓練で変えられるかを調べた研究も、あわせてどうぞ。
R/Lの聞き分け訓練の記事を読む →参考文献
- McGurk, H., & MacDonald, J. (1976). Hearing Lips and Seeing Voices. Nature, 264, 746–748. 論文を見る
- Sekiyama, K., & Tohkura, Y. (1991). McGurk effect in non-English listeners: Few visual effects for Japanese subjects hearing Japanese syllables of high auditory intelligibility. Journal of the Acoustical Society of America, 90(4), 1797–1805. 論文を見る
- Basu Mallick, D., Magnotti, J. F., & Beauchamp, M. S. (2015). Variability and stability in the McGurk effect: Contributions of participants, stimuli, environment, and disambiguation. Psychonomic Bulletin & Review, 22(5), 1299–1307. 論文を見る
- Magnotti, J. F., Lado, A., & Beauchamp, M. S. (2024). The noisy encoding of disparity model predicts perception of the McGurk effect in native Japanese speakers. Frontiers in Neuroscience, 18, 1421713. 論文を見る