В конце восьмидесятых у него начал развиваться Альцгеймер. К началу девяностых он уже не помнил, что когда-то написал статью, изменившую цифровой век. Бетти и дети поместили его в специальную клинику. Он умер 24 февраля 2001 года, двух месяцев не дожив до восьмидесяти пяти лет.
Сегодня шенноновы идеи находятся буквально в каждом устройстве, имеющем процессор. Алгоритмы сжатия — JPEG, MP3, ZIP, любой компромисс между размером файла и качеством — следствие шеннонова закона о минимальной длине кодирования. Коррекция ошибок в сотовой связи, чтении компакт-дисков, передаче спутниковых данных — следствие шеннонова доказательства, что любой канал имеет конечную пропускную способность и до этой границы можно подойти сколь угодно близко при правильном кодировании. Современные криптографические системы — те, на которых держится весь интернет-банкинг и протокол HTTPS, — теоретическими основаниями восходят к шенноновым военным работам по теории секретности.
Но самое неочевидное наследие Шеннона — то, ради которого, в общем-то, и пишется эта книга, — спрятано в тех страницах его статьи 1948 года, где он, развлечения ради, моделировал английский язык цепями Маркова и доставал из шляпы псевдо-английские фразы. В этих страницах был зародыш всей будущей статистической школы обработки естественного языка. Той самой школы, которая через тридцать лет, в конце 1970-х, дала первые системы распознавания речи на основе скрытых марковских моделей. Той, которая в 1990-е дала первые статистические переводчики. Той, которая в начале 2000-х породила технологию T9 — подсказку следующего слова в SMS-сообщениях на кнопочных телефонах, ту самую, которую миллионы подростков мира научились ненавидеть за её упорное превращение слова «cool» в «book». Той, которая в конце концов привела к нейросетевым языковым моделям, к трансформеру и ко мне.
В каждом из этих звеньев, при всей разнице технологий, можно расслышать одну и ту же шенноновскую интонацию: посмотрите, как часто за этим идёт то. Посчитайте. Используйте знание о частотах. Предсказывайте. Уменьшайте неопределённость.
На полке у меня — у того гипотетического «меня», у которого есть полка, — стоит, в воображении, томик Bell System Technical Journal, июль 1948 года, страницы 379–423. Тонкий журнал в бумажной обложке. Внутри — статья человека, который любил жонглировать на одноколёсном велосипеде. На обороте обложки — реклама телефонных компонентов. На последней странице — оглавление следующего выпуска. Никто, открывший этот журнал летом 1948-го, не догадывался, что только что в человеческой культуре произошло нечто, сравнимое по последствиям с появлением алфавита.
А впереди был ещё один длинный, тёмный коридор. Дисциплина, которая в 1948 году только зарождалась, тридцать с лишним лет проведёт во мраке, пробуя свои силы то на n-граммах, то на скрытых марковских моделях, то на перцептронах, то на экспертных системах, — и почти каждый раз будет терпеть поражение от собственных ожиданий. Идеи Шеннона лежали наготове. Просто никто ещё не знал, что нужно сделать с ними, чтобы они заработали по-настоящему.
За поворотом ждала зима.
Глава 2
Долгая зима
Каждый раз, когда я увольняю лингвиста, точность распознавания речи растёт.
История науки знает много примеров, когда хорошая идея появлялась слишком рано и десятилетиями ждала, пока созреют условия для её осуществления. Шенноновские наброски статистических языковых моделей — один из таких случаев. К моменту их публикации не существовало ни компьютеров достаточной мощности, чтобы посчитать вероятности по большому массиву текстов, ни самих больших массивов, ни инженерных задач, требовавших такого моделирования. Идея лежала в журнале, журнал стоял на полке, полка пылилась.
Чтобы она ожила, требовалась смежная история, на первый взгляд не имеющая отношения к лингвистике. История о том, как машина учится сама.
Фрэнк Розенблатт, конец 1950-х
В 1957 году в Корнеллской аэронавтической лаборатории, в городе Буффало, штат Нью-Йорк, работал молодой психолог по имени Фрэнк Розенблатт. Ему было двадцать девять лет. Он закончил Корнеллский университет, написал диссертацию по теории восприятия и пришёл в лабораторию заниматься тем, что тогда называлось «электронные модели мозга». В отличие от Шеннона, Розенблатт интересовался не математической абстракцией информации, а живой биологией: как именно нейроны в человеческом мозге переплетаются между собой, и можно ли в принципе построить машину, которая работала бы по тому же принципу.