А Илья за следующие три года в Google Brain сделает с Ориолом Виньялсом и Квоком Ле работу, которая первая по-настоящему применит нейронные сети к языку. Идея, что нейронные сети должны расти с количеством данных, перестанет быть его частной гипотезой и станет общим местом. Под эту идею, постепенно, начнут перестраиваться целые корпоративные стратегии.
Но это уже история следующей главы.
Что касается Алексовой спальни в торонтском пригороде, она ещё несколько лет простояла, как стояла. Системный блок с торчащими видеокартами увезли на хранение, потом передали в Музей компьютерной истории в Маунтин-Вью. В 2025 году исходный код AlexNet будет официально опубликован на GitHub под лицензией BSD-2, и любой желающий сможет скачать его себе на компьютер и запустить, теперь уже на одной видеокарте, потому что современные карты в десятки раз мощнее тех двух GTX 580.
Что касается двух видеокарт, на которых обучалась исходная сеть, их дальнейшая судьба неизвестна. Возможно, они до сих пор лежат у Алекса в коробке в гараже. Стоит ли об этом сожалеть? Не знаю. Любая обыденная вещь, оказавшаяся в эпицентре исторического сдвига, обычно остаётся обыденной. Книги, которые читал Эйнштейн, ничем не отличаются от других книг своего времени. Лампа, при свете которой Шеннон считал свои псевдо-английские фразы, ничем не отличается от других ламп. Видеокарты GTX 580 ничем не отличаются от других видеокарт. Особенным был не металл, а то, что эти трое в спальне пригородного дома в 2012 году сделали с ним.
А ещё особенной была одна гипотеза: сделать сеть достаточно большой, и она научится сама.
Эту гипотезу теперь предстояло применить к самому сложному из материалов: к человеческому языку.
Глава 4
Машина учится переводить
Это была первая задача, на которой нейронные сети показали, что они умеют делать со словами что-то реальное.
В марте 2013 года Илья Суцкевер вышел из самолёта в международном аэропорту Сан-Франциско и сел в такси до Маунтин-Вью. В кармане у него лежало предложение от Google на работу в группе Google Brain, в Корпоративном кампусе с зелёной травой и бесплатными ресторанами. Он переходил из тихой академической лаборатории Хинтона в одну из самых мощных вычислительных инфраструктур мира. Его персональный счёт в банке за прошедшие три месяца увеличился на сумму с шестью нолями, и это была только начальная часть, остальное он должен был получать ежегодными траншами, привязанными к работе. Ему было двадцать шесть лет.
Алекс Крижевский ехал в то же место, в другом такси, с похожим контрактом. Хинтон, тоже подписавший с Google соглашение, поделил рабочее время между Маунтин-Вью и Торонто. Все трое стали сотрудниками одной из самых быстро растущих научных групп Кремниевой долины. Аукцион в Лейк Таху сделал из аспирантов корпоративных исследователей.
Google Brain тогда существовал три года, был детищем Джеффа Дина и Эндрю Ына, и занимался применением больших нейронных сетей к задачам распознавания речи, компьютерного зрения и рекомендательных систем. На балансе у группы стояла внутренняя облачная инфраструктура Google, что означало доступ к десяткам тысяч процессорных ядер и сотням видеокарт одновременно. Тому, кто до этого работал с двумя GTX 580, такие ресурсы казались сюрреалистическими.
Илью, едва он переехал, начали приглашать в разные внутренние проекты. Он отказывался от большинства. Его интересовало только одно: применить нейронные сети к языку.
Томаш Миколов, 2020
К моменту прихода Ильи в Google Brain в группе уже работал молодой чешский исследователь по имени Томаш Миколов. Он защитил докторскую в Брненском университете технологий по рекуррентным нейронным сетям, применённым к языковому моделированию, и в 2012 году переехал в США. К концу 2012 года вышла его первая опубликованная в Google работа, а к 2013 году он опубликовал серию статей, в которых сделал нечто, на первый взгляд скромное, но имевшее далеко идущие последствия.
Миколов развил идею Бенгио 2003 года про векторные представления слов и упростил её до неузнаваемости. Бенгио предлагал получать векторные представления как побочный продукт обучения полной нейросетевой языковой модели; это было дорого. Миколов показал, что вектора можно получить намного дешевле и быстрее, если использовать упрощённую модель: предсказывать соседние слова в окне из нескольких слов вокруг текущего, или, наоборот, по нескольким окружающим словам предсказывать центральное. Архитектура, которую он назвал word2vec, обучалась на гигабайтах текста за несколько часов на одной машине и выдавала вектора слов поразительного качества.