Выбрать главу
RLHF и Пол Кристиано

Пол Кристиано, NIST

Главным техническим инструментом, который для этого пригодился, оказался метод, известный под аббревиатурой RLHF: Reinforcement Learning from Human Feedback, обучение с подкреплением на основе обратной связи от людей.

Идея метода восходит к работе 2017 года, которую опубликовал Пол Кристиано, тогда исследователь OpenAI (позже он перейдёт в Anthropic, потом учредит свой исследовательский институт). В оригинальной статье Кристиано показал, что можно обучать агента (например, нейросетевого игрока в видеоигру) не на заранее заданной функции награды, а на оценках реальных людей: пусть люди смотрят пары роликов и говорят, какой из двух больше нравится. По этим оценкам можно построить функцию, аппроксимирующую человеческие предпочтения, и обучать агента максимизировать её.

В 2021 году в OpenAI команда под руководством Лонга Уянга начала применять эту идею к языковым моделям. Процесс выглядел так. Берём GPT-3. Запускаем её на множестве тестовых промптов. Получаем для каждого промпта по несколько разных ответов. Показываем эти ответы группе наёмных оценщиков и просим ранжировать: какой ответ лучше, какой хуже. Собираем десятки тысяч таких сравнений. По ним обучаем отдельную небольшую модель, которая предсказывает, какой из двух ответов человек оценит выше. Эту модель называем «модель награды». Дальше используем модель награды как сигнал для тонкого дообучения GPT-3 методами обучения с подкреплением: модель должна давать ответы, на которых модель награды показывает высокий балл.

В январе 2022 года команда Уянга опубликовала статью под названием Training language models to follow instructions with human feedback. Модель, полученная этим способом, назвали InstructGPT. По сравнению с обычным GPT-3, она показывала разительно более полезное поведение: лучше следовала инструкциям, реже выдавала нерелевантные продолжения, точнее отвечала на конкретные вопросы.

InstructGPT была доступна через API OpenAI, и в течение 2022 года стала вытеснять обычную GPT-3 у разработчиков. Но она оставалась инструментом для разработчиков; широкая публика её не пробовала. Никакого общедоступного интерфейса у неё не было.

Идея чата

Кому именно в OpenAI принадлежит идея сделать из InstructGPT простой чат-интерфейс для широкой публики, в точности неизвестно. По одним свидетельствам, идея витала в воздухе и обсуждалась несколькими сотрудниками одновременно с лета 2022 года. По другим, ключевую роль сыграл сам Альтман, который в какой-то момент сказал: давайте сделаем что-то, что просто работает без программирования; пусть любой человек может с этим поиграть.

В сентябре 2022 года несколько инженеров под руководством Джона Шульмана начали готовить специальную версию модели, дополнительно подкрученную для удержания контекста длинного диалога. Им нужно было решить несколько задач, которые в чисто инструктивных моделях не возникали. Во-первых, помнить предыдущие реплики разговора. Во-вторых, корректно обрабатывать длинные многоходовые задачи (когда пользователь, скажем, начинает с вопроса, потом уточняет, потом снова уточняет). В-третьих, по возможности отказываться от выполнения вредных или неуместных запросов.

Модель, которая получилась, внутри OpenAI называли GPT-3.5. По размеру она была близка к оригинальной GPT-3 (хотя точные параметры компания никогда не раскрывала). По способностям, благодаря дополнительному RLHF и тренировке на диалогах, она была заметно лучше.

В ноябре 2022 года команда обсудила: что с этим делать? Опубликовать статью? Запустить как платный API для разработчиков? Дождаться следующего поколения, GPT-4, которое уже было в разработке и должно было выйти в 2023 году?

Альтман предложил запустить простой бесплатный веб-интерфейс. Не как продукт. Как «исследовательский превью», чтобы собрать данные о том, как обычные люди общаются с языковой моделью. Он сказал коллегам: выложим без рекламы, без пресс-релиза. Если получится что-то интересное, разовьём это в полноценный продукт. Если нет, тихо закроем.

Внутри команды были сомнения. Несколько человек считали, что модель ещё недостаточно отполирована и что публичный запуск может привести к скандалам (если ChatGPT начнёт давать оскорбительные ответы, например). Другие, наоборот, считали, что отполировать модель в лабораторных условиях невозможно: только реальные пользователи покажут реальные проблемы.

В итоге запустили. 30 ноября, в среду.

Что произошло потом

Рост числа пользователей ChatGPT