Что превратило этот эксперимент в инженерный расчёт, это работа группы из десяти исследователей, опубликованная на arXiv 23 января 2020 года. Статья называлась Scaling Laws for Neural Language Models. Её первым автором был тот самый физик, чьим именем мы озаглавили эту главу. Джаред Каплан.
Джаред Каплан, Anthropic
Джаред Каплан в 2019 году преподавал теоретическую физику в Университете Джонса Хопкинса в Балтиморе. Ему было сорок лет. Он защитил PhD по теории струн в Гарварде у Нимы Аркани-Хамеда, занимался квантовой гравитацией, потом перешёл к более прикладной квантовой теории поля. Его публикации были рассеяны по физическим журналам: Phys. Rev. D, JHEP, Annalen der Physik. Ни одна из них не имела никакого отношения к нейронным сетям.
К нейронным сетям его привело сначала любопытство, а потом дружба. Каплан, как и многие учёные его поколения, в свободное время начал в 2017–2018 годах читать про прорывы в машинном обучении. Сначала ради интеллектуального интереса; потом всё с большей серьёзностью. Особенно его заинтересовало то, как нейросетевые системы вели себя при увеличении размера. У него как у физика была отличная интуиция в том, что касается степенных законов. В физике степенные законы вездесущи: фазовые переходы, критические явления, ренормгруппа, всё это языковая среда теоретического физика. Каплан смотрел на графики из ML-публикаций и думал: эти кривые подозрительно похожи на то, что я видел в моих собственных задачах.
В 2018 году Каплан познакомился с Дарио Амодеем. Они стали друзьями, обнаружив общий интерес к вопросу о том, насколько хорошо будут работать большие нейронные сети. Амодей с конца 2018 года предлагал Каплану присоединиться к OpenAI в качестве консультанта. Каплан соглашался не сразу: у него была собственная исследовательская программа в физике, и переключаться на машинное обучение целиком он не хотел.
В 2019 году они нашли компромисс. Каплан остался профессором в Хопкинсе, но взял годовой контракт с OpenAI как внешний исследователь. Его задача была сформулирована довольно широко: использовать инструменты теоретической физики, чтобы понять, как именно нейронные сети ведут себя при изменении масштаба. Если получится найти что-нибудь похожее на универсальные законы, тем лучше.
К Каплану в команду присоединились несколько человек из OpenAI: Сэм МакКэндлиш (получивший докторскую по теоретической физике в Стэнфорде, тоже бывший физик), Том Хенигэн, Том Браун, Бен Чесс, Рион Чайлд, Скотт Грей, Джефф Ву, Алек Радфорд, Дарио Амодей. Большинство из них имели физическое или физическо-математическое образование. Это была команда, привыкшая искать в эмпирических данных степенные закономерности.
Они начали серию экспериментов, длившуюся почти весь 2019 год. План был такой: обучить несколько десятков языковых моделей разного размера — от совсем маленьких в сотню тысяч параметров до больших на миллиард — на разных объёмах данных, с разным временем обучения, измеряя в каждом случае конечное качество модели. Потом нанести все эти измерения на графики и посмотреть, есть ли в них структура.
Под «качеством» в этом эксперименте понимался не балл на какой-нибудь конкретной задаче, а более фундаментальная величина: средняя кросс-энтропийная ошибка модели на тестовом тексте. Грубо говоря, это среднее количество битов, которое модель тратит, чтобы предсказать следующий токен, когда она уже видела все предыдущие. Чем меньше — тем лучше модель угадывает следующее слово. Эта мера непрерывна и определена для моделей любого размера, что делает её удобной для построения графиков.
Команда систематически варьировала три параметра:
Размер модели — обозначим его N, число параметров. От нескольких десятков тысяч до миллиарда с лишним. Шесть порядков величины.
Объём данных — обозначим его D, число токенов в обучающих данных. От нескольких миллионов до десятков миллиардов.
Вычислительная стоимость — обозначим её C, количество операций с плавающей точкой, затраченных на обучение. От минут на одной видеокарте до недель на сотнях видеокарт.
Команда обучила десятки моделей в разных точках этого трёхмерного пространства, замерила в каждой точке итоговую кросс-энтропию, и нанесла всё на графики. То, что получилось, превзошло их ожидания.