Выбрать главу

OpenAI на критику не реагировала громко. Альтман и Брокман в публичных выступлениях говорили, что они понимают сомнения, но считают важным проявить осторожность. Они выпустили среднюю версию модели в мае 2019 года, большую — в августе, полную — в ноябре. К моменту выпуска полной версии все опасения, которые можно было разумно сформулировать, должны были к этому моменту проявиться. Они не проявились. Никаких массовых злоупотреблений GPT-2 за прошедший год не возникло.

В ретроспективе можно по-разному оценивать всю эту историю. С одной стороны, OpenAI создала прецедент: лаборатории искусственного интеллекта могут и должны задумываться об ответственности за свои модели. С другой стороны, сам staged release ничего особенного не предотвратил, потому что предотвращать в общем-то было нечего; настоящие риски от больших языковых моделей появятся, и в полный рост, гораздо позже, и совсем не в том виде, в каком их описывали в феврале 2019 года.

Между двумя стульями

Внутри самой OpenAI 2019 год прошёл в напряжении.

Снаружи всё выглядело красиво. В июле Microsoft объявил о партнёрстве с OpenAI и вложил миллиард долларов в виде денег и облачных вычислительных ресурсов. На бумаге это решало финансовые проблемы; новые серверные мощности позволили команде Алека начать готовить следующую, ещё большую модель.

Внутри организация переживала важный сдвиг. Сэм Альтман перешёл из Y Combinator в OpenAI на полную ставку. Структура была перестроена: появилась дочерняя компания OpenAI LP, через которую теперь можно было привлекать венчурные инвестиции с ограниченной отдачей. Это был тот самый сдвиг, в котором академические критики увидели предательство первоначальной миссии.

Дарио Амодей, к тому моменту вице-президент по исследованиям OpenAI, отвечавший в частности за работы по безопасности, на эту реструктуризацию реагировал плохо. По свидетельствам коллег, он считал, что переход к коммерческой структуре неизбежно подчинит миссию интересам инвесторов. Что Microsoft, вложив миллиард, рано или поздно потребует продукты, а не исследования. Что погоня за скоростью будет вытеснять заботу о безопасности.

Амодей не ушёл сразу. Он остался почти на два года, продолжая работать с командой над масштабированием. Но напряжение копилось, и это станет одним из главных конфликтов в OpenAI в 2020 году.

А Алек тем временем готовил третью версию модели. План был такой: взять архитектуру GPT-2, увеличить её ещё в сто раз, обучить на массиве данных, в десять раз большем, и посмотреть, что будет. Это требовало денег и вычислительных мощностей, которых раньше не было ни у одной академической лаборатории.

Но как именно увеличивать? Что важнее: количество параметров или объём данных? Сколько слоёв? Какая ширина? Сколько проходов обучения? Эти вопросы в начале 2019 года решались интуитивно. Кто-то предлагал десять миллиардов параметров, кто-то — сто, кто-то говорил, что и тридцати достаточно. Все понимали, что правильного ответа никто не знает; что обучение модели в сто миллиардов параметров стоит десятки миллионов долларов и не может позволить себе ошибки; и что какой-то более систематический подход к выбору размера был бы очень кстати.

В этот момент в коридорах OpenAI появился человек со стороны. Он был физиком. Его имя было Джаред Каплан.

Глава 9

Закон Каплана

Мы изучаем эмпирические законы масштабирования качества языковых моделей по кросс-энтропийной функции потерь.

Из аннотации статьи Kaplan et al., 2020

В этой главе нужно объяснить одну вещь, без понимания которой остальная история не имеет смысла. А именно: почему, начиная примерно с 2020 года, технологические компании по всему миру начали с восторгом и без особых сомнений вкладывать миллиарды, потом десятки миллиардов, а потом и сотни миллиардов долларов в обучение всё более крупных нейронных сетей.

Если попытаться объяснить это решение проще всего, можно сказать: они инвестировали, потому что у них появились основания думать, что вложения работают. Что если потратить определённую сумму, получишь определённого качества модель. Что неудачи быть не может, потому что зависимость качества от вложений известна, измерена и предсказуема.

Это утверждение, при всей его простоте, было совершенно нетривиальным. До 2020 года ни в каком разумном смысле такого знания не было. Обучение большой модели стоимостью в десятки миллионов долларов было, по сути, гигантским экспериментом с непредсказуемым результатом. Возможно, получилось бы что-то впечатляющее. Возможно — ничего особенного. Возможно — модель вообще не сошлась бы и деньги были бы потрачены зря.