Выбрать главу

Внутри OpenAI после ухода Амодеев и их команды атмосфера изменилась. По свидетельствам тех, кто остался, организация стала более коммерческой. Меньше академических разговоров, больше разговоров о продуктах. Меньше про долгосрочную безопасность, больше про релизы. Кто-то из оставшихся приветствовал этот сдвиг, кто-то относился к нему скептически.

Но эта трансформация открывала перед OpenAI определённые возможности. Стать чисто коммерческой машиной, нацеленной на быстрые продуктовые релизы, значило получить шанс выпустить нечто, что окажет на широкую публику тот эффект, которого никто до сих пор не оказывал.

Это нечто появится 30 ноября 2022 года.

Глава 12

Бот, который написал письмо

Сегодня мы запустили ChatGPT. Попробуйте поговорить с ним.

Сэм Альтман, твит, 30 ноября 2022 года

В среду 30 ноября 2022 года, около десяти часов утра по нью-йоркскому времени, на веб-сайте OpenAI появилась новая страница. Она называлась chat.openai.com и выглядела очень просто: белый экран, посередине окошко для ввода текста, под ним кнопка «Submit». Никакого приветствия, никакого вводного видео, никакой регистрации с подтверждением через смс. Чтобы попробовать, достаточно было создать бесплатный аккаунт.

В тот же день в твиттере OpenAI и лично Сэма Альтмана появилось краткое объявление. В переводе с английского оно звучало так: сегодня мы запустили ChatGPT, попробуйте поговорить с ним. Внизу была ссылка на сайт. Никаких пресс-релизов, никаких пафосных видео, никаких журналистских превью. Просто публикация в социальной сети, такая, какие делают разработчики маленьких приложений, когда выкладывают свой первый прототип.

Во внутренней переписке OpenAI этот запуск называли low-key research preview, «тихая исследовательская превью-версия». Расчёт был такой: пусть несколько тысяч энтузиастов попробуют, расскажут о своих впечатлениях, OpenAI соберёт ценные данные о том, как люди реально общаются с языковой моделью, и через несколько месяцев на основе этих данных подготовит более серьёзный продукт. Никто не ожидал бури.

За первые пять дней работы chat.openai.com у платформы набралось миллион пользователей. За следующие два месяца — сто миллионов. К концу первого года — двести миллионов. К концу 2024 года — больше трёхсот миллионов еженедельно активных пользователей и больше миллиарда людей, попробовавших сервис хотя бы один раз.

Никакое потребительское приложение в истории человечества не достигало ста миллионов пользователей быстрее. Не Facebook, не Instagram, не TikTok. ChatGPT обогнал их всех в несколько раз.

Что было такого в этом простом белом окошке, что заставило четверть человечества за два года попробовать им воспользоваться? Чтобы ответить на этот вопрос, нужно вернуться немного назад и рассказать о двух технических идеях, без которых ChatGPT не работал бы. Эти идеи назывались InstructGPT и RLHF.

Проблема, которой не было у GPT-3

Когда в 2020 году вышел GPT-3, у него была проблема, которую внутри OpenAI обсуждали активно, но снаружи мало кто заметил.

GPT-3 был обучен предсказывать следующий токен в тексте. В этом он добился потрясающих результатов. Но «предсказание следующего токена» — это не то же самое, что «выполнение инструкции пользователя». Если пользователь писал в API запрос вроде напиши электронное письмо коллеге с просьбой перенести встречу на пятницу, модель не обязательно делала то, что от неё хотели. Она могла, например, продолжить запрос, написав: напиши электронное письмо коллеге с просьбой перенести встречу на пятницу. Если на пятницу не получится, попроси перенести на четверг. Эту задачу можно автоматизировать с помощью Outlook. Технически — продолжение текста, статистически правдоподобное. Но не то, чего хотел пользователь.

GPT-3, обученный на огромном массиве обычного текста, моделировал, в сущности, типичный интернет: статьи в Википедии, форумные обсуждения, отзывы на Amazon, фрагменты кода с GitHub. В этом интернете запросы вроде «напиши письмо» обычно были не инструкциями, а заголовками статей или фрагментами обсуждений. Модель училась продолжать такие заголовки естественным для интернета способом. Прямого выполнения инструкции она не умела.

Чтобы исправить это, в OpenAI начали в 2021 году серию работ под общим названием alignment, согласование. Идея: научить модель не просто предсказывать следующий токен, но выполнять то, что от неё хочет пользователь. Делать то, что для языковых моделей не предусмотрено архитектурой.