「ことばブリッジ」以前の学びに、何が起きているのか
これから何度かに分けて、AIの学習の仕組みを手がかりに、子どもの学びについて考えていきたいと思います。まずは、教材で学び始めるよりもずっと前——まだ文字も読めない、赤ちゃんや幼い子どもの中で、いったい何が起きているのか、そこから考えてみます。
赤ちゃんが耳にする言葉は、実際には単語ごとに区切られて聞こえてくるわけではありません。「きょうはいいてんきですね」は、途切れのない一続きの音として耳に届きます。それにもかかわらず、赤ちゃんはある時期になると、この連続した音の中から「単語」という単位を、自分の力で見つけ出せるようになります。
これがどうやって可能になっているのかを示した、有名な実験があります。1996年、心理学者のジェニー・サフラン、リチャード・アスリン、エリッサ・ニューポートの3人が、科学誌『サイエンス』(Science)に発表した研究です。生後8ヶ月ほどの赤ちゃんに、区切りのない人工的な音の連続を聞かせ続けたところ、赤ちゃんは、その中にある「まとまり」を、わずか2分ほど聞いただけで見分けられるようになったのです。手がかりは、音と音のつながりやすさでした。ある音の次に、別のある音が来る確率——専門的には「遷移確率」(transitional probability)と呼ばれます——は、一つの単語の内部では高く安定しているのに対し、単語と単語の境目では、がくんと下がります。赤ちゃんは、この確率の変化を、教えられることなく無意識のうちに読み取り、単語の境目を見つけ出していると考えられています。
ある音(や文字)の次に、別のある音が来る確率のこと。「とう」の後には「きょう」が続きやすいが、単語の境目をまたぐと、次に何が来るかの予測しやすさが急に下がる。この落差が、単語の切れ目の手がかりになります。
この現象は、特定の言語だけで見られる、たまたまの結果ではありません。その後、性質の異なるいくつもの言語を対象に行われた同様の実験でも、共通して確認されています。赤ちゃんは、育つ環境の言語が何であるかにかかわらず、この統計的な手がかりを読み取る力を、生まれつき備えているようです。
言語学には「二重分節」(double articulation)という考え方があります。フランスの言語学者アンドレ・マルティネが整理したもので、人間の言語には二つの階層があるとする見方です。
ここで一つ、紛らわしい点を先に整理しておきます。「分節」という言葉自体は、本来、発話全体という大きなまとまりを、より小さな単位へと分けていく——文を単語に分け、単語をさらに音に分けるという「大きい方から小さい方へ」の分析の作業を指しています。マルティネの言う「第一次分節」とは、この分析でまず取り出される、意味を持つ単位(単語)のことであり、「第二次分節」とは、そこからさらに細かく分析して取り出される、それ自体は意味を持たない単位(音素)のことです。
ところが、この仕組みがなぜ言語を効率的にしているのかを説明するときには、向きが逆になります。音が組み合わさって単語になり、単語が組み合わさって文になるという、「小さい方から大きい方へ」組み立てていく方向で語られるのが普通です。ここから先の説明も、この組み立ての向き、つまり音の組み合わせから話を進めます。分析するときの向きと、組み立てを説明するときの向きが逆になっている、という点だけ、頭の片隅に置いておいてください。
音素が組み合わさって単語ができ、単語が組み合わさって文ができる——この二段構えの仕組みがあるおかげで、限られた数の音の組み合わせだけから、ほとんど無限に近い数の単語と文を作り出すことができます。
ここでもう一つ、紛らわしい二つの言葉を区別しておきます。「音声」(phone)と「音素」(phoneme)です。「音声」とは、ある瞬間に、誰かの口から実際に出た、物理的な音そのものを指します。同じ「か」という音でも、話す人や、その時の話し方によって、音響的には毎回微妙に違う音が出ています。一方「音素」とは、そうした無数の物理的な違いを、ある言語の話し手が「同じ音だ」とみなして区別しなくなる、頭の中の分類の単位です。
分かりやすい例が、英語の「p」の音です。英語の "pin" の「p」と "spin" の「p」は、実は息の出方がはっきり違う、別の音声です。しかし英語を話す人には、この違いはほとんど意識されず、同じ「p」の音(同じ音素)として扱われます。ところが、ヒンディー語のように、この息の出方の違いが単語の意味そのものを変えてしまう言語では、この二つの音は、別々の音素として区別されます。どの音の違いを「同じ」とみなし、どの違いを「別」とみなすかは、言語によって異なるのです。
つまり、赤ちゃんが連続した音の中から単語を切り出すという作業は、この二重分節のうちの、最初の階層をゼロから自力で発見している、ということになります。これは、言語という体系全体の土台を、誰にも教えられることなく築いている作業だと言えます。
ここに、AI側の対応物があります。今の言語系AIの多くは、文章を扱う準備として「トークン化」(tokenization)という処理を行います。その代表的な手法の一つ「バイトペア符号化」(Byte Pair Encoding, BPE)は、あらかじめ単語の境目を教えられるのではなく、大量の文章データの中で、どの文字の並びが高頻度で一緒に出現するかという統計だけを頼りに、意味のありそうな「かたまり」を自動的に見つけ出していきます。
境界線を外から与えられることなく、生の連続データの中の統計的な規則性だけから、意味のある単位を切り出す——これは、赤ちゃんが遷移確率を頼りに単語を見つけ出すプロセスと、驚くほど同じ構造をしています。
BPEのようなAIのトークン化は、文字の出現頻度という統計だけを根拠に単位を切り出しており、その単位が実際に何を意味するのかということには、まったく関知していません。切り出す作業と、意味を理解する作業は、AIの中では完全に別の工程です。
一方、赤ちゃんの場合、単語を切り出す作業と、その単語が指す意味を知る作業は、同時に、しかも身体的な経験——指をさされたもの、触れたもの、その場の状況——と結びつきながら進んでいきます。統計的に単語を切り出すという部分だけを取り出せばAIと同じ構造でも、赤ちゃんはそれを「意味のある世界」に結びつけながらやっている点で、はるかに難しいことをしていることになります。
ここまでは、AIの仕組みが人間の学びを説明する手がかりになる、という方向で話を進めてきました。ここで一度、向きを変えてみたいと思います。今の言語系AIは、書籍に換算すれば数百万冊分にも相当するような、桁違いの量の文章データを読み込んで、ようやく今の言語運用力を身につけています。一方、子どもが日常生活の中で実際に耳にする言葉の量は、それとは比較にならないほど少ないとされています。それでいて、子どもは、AIとは比べ物にならない少なさの経験から、豊かな言語の力を身につけていきます。
この開きは「サンプル効率」(sample efficiency)の差と呼ばれ、AI研究の側でも、まだ十分には解けていない謎とされています。ここから先は、AIが子どもの学びを説明するのではなく、子どもの学び方の方が、AI研究に問いを突きつけているという、これまでとは逆向きの話になります。
いくつか有力な仮説がありますが、どれか一つで決着がついているわけではありません。
一つ目は、意味が最初から結びついた状態で学んでいる、という見方です。子どもが言葉を覚えるとき、その言葉は必ず、目の前の物や動作、その場の状況と同時に入ってきます。「わんわん」という音は、実際の犬を見ながら、指をさされながら、飼い主が笑いながら、という具体的な場面ごと届きます。AIが読む文章データの中の「犬」という文字列には、こうした身体的な手がかりは何もついていません。1回の経験あたりの情報の濃さそのものが、そもそも桁違いに違う、という見方です。
二つ目は、子どもに向けられる言葉そのものが、常に「今の力」に合わせて編集され続けている、という見方です。大人が赤ちゃんに話しかけるときの、あの高い声でゆっくり話す独特な話し方——専門的には「対乳児発話」(infant-directed speech)、通称「マザリーズ」と呼ばれます——は、大人が無意識のうちに、子どもの理解力に合わせて難易度を調整し続けている、双方向のやりとりだと考えられます。AIの学習データの多くは、こうした調整のない、固定された文章の集まりです。相手に合わせて編集され続けているデータの方が、学習の効率がはるかに高いだろうことは、想像に難くありません。
三つ目は、人間の脳に、言語を効率よく学び取るための、何らかの生まれつきの偏りが備わっているのではないか、という見方です。これは古くからある、そして今も決着のついていない仮説です。AI研究の言葉を借りるなら、これは「データの量」の問題ではなく「モデル自体の構造」——専門的には「帰納バイアス」(inductive bias)と呼ばれます——の問題だ、という主張に近いものです。同じ量のデータを与えても、構造の違いによって学習の効率がまったく変わってくることは、AI研究でも広く知られています。
限られた経験から一般的な規則を導き出す(帰納する)際に、学び手があらかじめ持っている、特定の答えを見つけやすくする性質や偏りのこと。同じ経験をしても、この偏りの違いによって、学びの速さや方向が変わってきます。
①〜③のどれもが、有力な手がかりではあっても、これですべてが説明できたと言える段階には至っていません。「なぜ子どもは、これほど少ない経験でここまで言葉を身につけられるのか」は、AI研究の第一線でも、今なお真剣に参考にされ続けている、生きた問いです。
ここまで、赤ちゃんの学びについて、AIの学習構造を手がかりに考えてきました。ここで見えてきたのは、AIが子どもに何かを教えてくれる関係ではなく、子どもの学び方の方が、AI研究にまだ解けない問いを投げかけている関係です。ここで取り上げたいくつもの見立ても、結局のところ、まだ十分に解明されていない、人間の学びという豊かな現象の、ほんの一部を映し出しているに過ぎないのかもしれません。
付け加えておきたいのは、だからこそ、AIの学習手法から、子どもの学び方を安易に導き出し、そのまま教育の現場に持ち込むことには、慎重であるべきだということです。ここまで見てきた対応関係は、あくまで「よく似た構造が見つかる」という、発見としての面白さにとどまるものです。そこからただちに「だからこの指導法が正しい」という具体的な手法を設計してよい、という保証には、まったくなりません。