И вот в этой ситуации Илья постепенно сформулировал у себя в голове гипотезу, которая со стороны казалась почти банальностью, а изнутри направления оказалась еретической.
Большинство специалистов по машинному обучению того времени считали, что качество модели зависит прежде всего от идеи: какую архитектуру выбрать, какие признаки извлекать вручную, какой алгоритм оптимизации использовать. Размер модели и количество данных играли роль, но не главную. Главное было — придумать правильную теорию.
Илья думал ровно наоборот. Он считал, что главное — размер. Если нейронная сеть достаточно глубока и достаточно велика, и если у неё достаточно данных для обучения, и достаточно вычислительной мощности, чтобы это обучение довести до конца, то такая сеть сможет решить почти любую разумную задачу. Архитектурные детали важны, но второстепенны. Главное — масштаб.
Эта гипотеза, в общем-то, противоречила всему, что в то время преподавалось на курсах по машинному обучению. Из неё следовало, что инженерные навыки обращения с большими вычислительными системами важнее, чем теоретическая изощрённость. Что специалист, умеющий пробросить большую модель на десяток видеокарт, ценнее, чем специалист, придумывающий новые методы регуляризации. Что роль учёного, в каком-то смысле, в этой дисциплине будет уменьшаться, а роль инженера, наоборот, расти. Многим коллегам Ильи такая позиция казалась интеллектуально плоской. Хинтон же относился к ней с осторожным интересом. Он сам начинал свою карьеру с теоретических работ по физике, потом перешёл в нейросети, потом в плохо изученные на тот момент глубокие сети, и научной осторожностью он не страдал.
Фей-Фей Ли, 2017
Чтобы проверить гипотезу Ильи, нужны были две вещи: достаточно большой набор данных и достаточно мощное железо. К 2012 году в мире как раз появилось и то, и другое.
Большой набор данных назывался ImageNet. Его собрала команда аспирантов под руководством Фей-Фей Ли, тогда профессора Принстона, потом перешедшей в Стэнфорд. Идея была простая. Чтобы машины научились распознавать предметы на фотографиях, им нужны миллионы примеров с подписями. Команда Ли воспользовалась платформой Amazon Mechanical Turk, где можно за небольшую плату нанимать тысячи людей по всему миру для выполнения коротких рутинных заданий. В течение нескольких лет тысячи таких работников вручную классифицировали миллионы картинок, скачанных из открытых источников интернета. К 2010 году база данных насчитывала четырнадцать миллионов изображений, разнесённых по двадцати тысячам категорий: породы собак, виды грибов, марки автомобилей, разновидности насекомых, инструменты, мебель, всё на свете.
В качестве дополнительной услуги научному сообществу команда ImageNet запустила ежегодное соревнование под названием ILSVRC. Участникам давали примерно полтора миллиона картинок из тысячи категорий, поделённых на обучающий и тестовый наборы. Задача: написать программу, которая для каждой картинки тестового набора предсказывает её категорию. Победителем считался тот, у кого top-5 error rate (доля картинок, для которых правильная категория не попала в первые пять предсказанных) оказывался наименьшим. Соревнование проходило с 2010 года. В первые два года побеждали системы, основанные на классическом подходе: ручная разработка признаков и классификация методом опорных векторов. В 2011 году победителю удалось довести top-5 error до 25,8 процента. Прогресс год от года был, но крошечный.
На семинарах лаборатории Хинтона про ImageNet говорили как про серьёзный челлендж, который однажды надо будет попробовать. Кто-то из присутствовавших аспирантов однажды сказал, что для этой задачи, наверное, через несколько лет получится написать нейросеть, которая будет конкурентоспособна с классическими методами. Илья сказал на это что-то в духе: не через несколько лет, а в этом году. И посмотрел на Алекса.
Алекс Крижевский тоже родился в Советском Союзе, в Киеве, в 1986 году, в семье украинских евреев. В детстве, как и Илья, он уехал с родителями в Израиль, потом в Канаду. Они с Ильёй были ровесниками, учились на одном курсе в Торонто, оба попали в группу Хинтона. Внешне и по характеру они были очень разными. Илья — высокий, сосредоточенный, склонный к долгим разговорам про природу интеллекта, относящийся ко всему происходящему с серьёзностью, граничащей с религиозной. Алекс — короткий, замкнутый, ироничный, нелюбящий разговоры в принципе. Илья был теоретик, Алекс был инженер.