Выбрать главу

Для OpenAI это создало финансовую дыру. К началу 2019 года стало понятно, что обещанного миллиарда никогда не будет; что денег, реально находящихся на счетах, хватит ещё на год-полтора при существующих темпах расходов; что нужно искать другие источники.

Альтман с Брокманом начали рассматривать варианты. Один из них был радикальным: переучредить организацию. Не как чистую некоммерческую структуру, а как нечто гибридное: некоммерческая родительская организация с дочерней коммерческой компанией, способной привлекать венчурные инвестиции в обмен на ограниченную прибыль. Это решение в марте 2019 года будет официально оформлено: OpenAI Inc. останется некоммерческой, но создаст OpenAI LP — структуру, в которую можно будет инвестировать деньги и получать с них доход, но не больше, чем стократный возврат. Сэм Альтман перейдёт из Y Combinator в OpenAI на полную ставку как CEO.

Эта реструктуризация в 2019 году будет с громким эхом обсуждаться в академических кругах. Многие воспримут её как предательство первоначальной миссии. Один из ведущих исследователей OpenAI, занимавшийся вопросами безопасности, позднее уволится из-за связанных опасений и через два года создаст другую лабораторию, противопоставленную OpenAI по тем же мотивам, по которым OpenAI когда-то противопоставлялась Google. Этого исследователя звали Дарио Амодей, и его историю мы расскажем в одной из дальнейших глав.

Но всё это будет потом. В декабре 2018 года, на пороге нового года, в небольшом офисе OpenAI в Сан-Франциско, в Мишн-Дистрикте, рядом с прачечной и пиццерией, Алек Радфорд сидел за компьютером и набрасывал планы новой модели. Архитектура та же. Обучающие данные — больше. Размер — увеличить раз в десять.

Через два с половиной месяца он покажет миру модель, которая поразит публику не своими бенчмарками, а тем, как она пишет фальшивые газетные статьи. Эту модель назовут GPT-2.

Глава 8

Единороги в Андах

В шокирующем открытии, учёный обнаружил стадо единорогов в отдалённой, прежде не исследованной долине в горах Анд.

Промпт, использованный OpenAI для демонстрации GPT-2, февраль 2019

14 февраля 2019 года, в день влюблённых, OpenAI опубликовала на своём блоге пост, который должен был быть скромной академической заметкой, но получился чем-то совершенно иным. У поста было два названия: внутреннее, скучное, для специалистов — «Языковые модели — это неуправляемые многозадачные обучающиеся». И внешнее, ставшее заголовком новостных публикаций по всему миру: Better Language Models and Their Implications.

Внутри поста описывалась новая модель. Она называлась GPT-2 и представляла собой ту же архитектуру, что и GPT-1, только увеличенную примерно в десять раз. Один миллиард пятьсот миллионов параметров против ста семнадцати миллионов. Сорок гигабайт текста для обучения против одного. Сорок восемь слоёв трансформера против двенадцати.

Так выглядели технические детали. Но всё, ради чего читали тот февральский пост, было не в цифрах. Это было в нескольких примерах сгенерированного текста, которые OpenAI поместила прямо в тело публикации.

В первом примере исследователи дали модели промпт — короткий начальный текст, написанный человеком: в шокирующем открытии, учёный обнаружил стадо единорогов в отдалённой, прежде не исследованной долине в горах Анд. Они нажали кнопку. Модель самостоятельно продолжила текст.

Она написала, что более удивительным для исследователей оказалось то, что эти единороги говорили на превосходном английском языке. Она придумала имя ведущего учёного: Хорхе Перес, эволюционный биолог из университета Ла-Паса. Она сочинила правдоподобные детали экспедиции: трёхдневный пеший маршрут, поднявшиеся на высокогорье, неожиданная встреча. Она встроила в текст связные размышления о возможном происхождении этих животных. Получился связный, грамматически безупречный, стилистически выдержанный газетный репортаж — кроме той маленькой детали, что он был про говорящих единорогов и был полной выдумкой машины.

Прочитав этот пример, многие читатели блога OpenAI в феврале 2019 года испытали то же чувство, которое в ноябре 2022 года испытает в гораздо большем масштабе остальной мир. Это была не подсказка следующего слова. Это была не статистическая забава. Это было что-то такое, что страшно было назвать своим именем.