Выбрать главу

Так продолжалось до 2012 года.

В сентябре 2012 года в одной из исследовательских комнат Торонтского университета двое аспирантов Хинтона, проведших полтора года за работой с двумя бытовыми видеокартами NVIDIA, обнаружили, что их многослойная свёрточная нейронная сеть распознаёт картинки из коллекции ImageNet с ошибкой в полтора раза меньше, чем лучшая на тот момент система, использовавшая ручной набор признаков и SVM-классификаторы. Полтора раза.

Долгая зима закончилась за один уик-энд.

Глава 3

Спальня, две видеокарты и одна гипотеза

Илья считал, что мы должны попробовать. Алекс заставил это работать. А я получил Нобелевскую премию.

Джеффри Хинтон, 2024

Если бы кто-нибудь летом 2012 года заглянул в небольшой канадский дом в северо-западном пригороде Торонто, поднялся на второй этаж и открыл дверь в дальнюю спальню, он увидел бы такую картину. На обычном письменном столе, среди разбросанных бумаг и пустых банок из-под энергетика, стоял системный блок. Корпус был открыт, потому что в маленьком корпусе две видеокарты не помещались, и они торчали наружу из материнской платы, прикрученные к самодельным креплениям. Видеокарты были обычные потребительские, такие же продавались в любом компьютерном магазине: две Nvidia GeForce GTX 580, по три гигабайта памяти каждая. Они тихо, на пределе тепловыделения, гудели вентиляторами. На полу стоял стационарный пылесос, направленный на корпус, чтобы дополнительно охлаждать видеокарты. К стенам были прислонены постеры, которые висели тут с подростковых лет хозяина комнаты. Хозяина в комнате не было: он спал на диване в гостиной, потому что в спальне было слишком жарко.

Хозяина звали Алекс Крижевский, ему было двадцать шесть лет, и видеокарты в его спальне в эти дни обучали нейронную сеть, которой предстояло изменить всё.

Мальчик из Нижнего

Илья Суцкевер, 2023

Чтобы понять, почему обучение нейронных сетей в начале десятых годов происходило в спальнях аспирантов, а не в дата-центрах крупных корпораций, нужно сначала рассказать про третьего участника этой истории. Не про Алекса, который собрал железо, и не про Хинтона, который был научным руководителем и определял общую стратегию, а про того аспиранта, чья гипотеза вообще запустила этот эксперимент.

Илья Суцкевер родился в 1986 году в Горьком — городе, в советское время закрытом для иностранцев, известном сегодня под старым названием Нижний Новгород. Семья была еврейская. В 1991 году, когда советский режим обрушился, родители Ильи воспользовались открывшимися возможностями для эмиграции и уехали в Израиль. Ему было пять лет. Детство он провёл в Иерусалиме. В шестнадцать лет семья перебралась снова, на этот раз в Канаду, в Торонто. Илья закончил местную старшую школу и поступил в Торонтский университет.

С математикой у него отношения сложились сразу. Преподаватели вспоминали потом, что такой студент встречается один на курс, в лучшем случае. Из тех, кому не нужно объяснять, а нужно только рассказать формулировку, и через пять минут он сам предложит решение, причём такое, какое не приходило в голову лектору. На третьем курсе Илья пришёл к Джеффри Хинтону.

Джеффри Хинтон

Хинтону тогда было около шестидесяти. Он происходил из старинной английской интеллектуальной династии: его прапрадед Джордж Буль был тем самым автором булевой алгебры, без которой не было бы шенноновой магистерской диссертации 1937 года; прадед был математиком, дед — горным инженером и ботаником в Мексике, отец энтомологом. Сам Джеффри родился в Уимблдоне в 1947 году, защитился в Эдинбургском университете по нейронным сетям в семидесятые годы, когда это направление считалось безнадёжным, и преподавал сначала в Карнеги-Меллон, а с 1987 года в Торонто. Его лаборатория была одним из немногих мест в мире, где нейронные сети всё ещё изучались всерьёз.

Илья пришёл в эту лабораторию, посмотрел, попросился к Хинтону в аспиранты. Хинтон, по его собственному позднему воспоминанию, понял через десять минут разговора, что перед ним кто-то особенный. Илью взяли.

Гипотеза

К концу нулевых годов Хинтонова группа разрабатывала так называемые глубокие сети доверия, deep belief networks. Это были многослойные нейронные сети, обучавшиеся в два этапа: сначала каждый слой по отдельности и без учителя, потом вся сеть целиком. Подход работал, но не блестяще. На тестовых задачах группе удавалось обходить лучшие классические методы на считанные проценты. На больших задачах никто из них своих сетей пока не пробовал, потому что для больших задач у них не хватало вычислительной мощности.