Выбрать главу

12 июня 2017 года статья появилась на arXiv. К тому моменту восемь её авторов уже отправили её на конференцию NIPS 2017 (которая через несколько лет будет переименована в NeurIPS), которая должна была проходить в Лонг-Бич в декабре. Препринт быстро начал расходиться. К утру следующего дня про него говорили в кулуарах нескольких крупных лабораторий по всему миру.

Реакция мира

Реакция академического сообщества на трансформер не была мгновенной взрывной волной. Это позднейший миф. В первые недели после выхода статья воспринималась примерно так же, как любая хорошая публикация на NIPS: вот ещё одна новая архитектура для машинного перевода, у неё есть свои преимущества, она интересная.

Однако три вещи заметили сразу:

Во-первых, на исходный код. Команда вместе со статьёй выложила работающую реализацию на основе tensor2tensor от Лукаша Кайзера. Это означало, что любой исследователь в любой лаборатории мог в течение часа скачать код и запустить трансформер у себя. По меркам того времени это была редкость. Большинство ML-публикаций не приходило с прилагающимся кодом; результаты приходилось воспроизводить с нуля, что обычно занимало месяцы и часто заканчивалось неуспехом.

Во-вторых, на лёгкость параллелизации. Уже к осени 2017 года несколько групп воспроизвели трансформер, запустили его на больших кластерах в десятки и сотни GPU, и убедились, что он действительно отлично масштабируется. Удвоение количества видеокарт давало почти двукратное ускорение обучения. Этого нельзя было сказать о LSTM-моделях.

В-третьих, на качество. Через несколько месяцев на нескольких языковых парах трансформер показывал результаты, обходящие лучшие LSTM-системы, причём с гораздо меньшим временем обучения. К концу 2017 года в индустрии было ясно: новые модели машинного перевода нужно делать на трансформерах.

Что было гораздо менее очевидно тогда — это универсальность новой архитектуры. В исходной статье трансформер предложен в форме encoder-decoder, со специализацией на машинный перевод. Но почти сразу разные исследователи начали задаваться вопросом: а если использовать только энкодер, без декодера? Получится ли хорошая модель для классификации текстов? А если, наоборот, использовать только декодер, без энкодера? Получится ли что-то для свободной генерации текста?

Эти два вопроса — «только энкодер» и «только декодер» — через год превратятся в две главные ветви будущих больших языковых моделей. Первая ветвь породит BERT и его потомков; вторая — GPT и всю генеративную линию вплоть до ChatGPT. Но это случится в 2018 году, не в 2017.

Что было неочевидно

Когда восемь авторов трансформера сдали статью на NIPS и потом разъехались каждый по своим обычным делам, никто из них точно не понимал, какого масштаба объект они только что выпустили в мир.

Они, конечно, знали, что архитектура хороша. Они знали, что она масштабируется. Они знали, что в Google её начнут применять ко всему, что движется, потому что Google любил трансформировать любые свои продукты с использованием новейших ML-моделей. Они знали, что статья будет много цитироваться.

Но было нечто, чего они в 2017 году знать ещё не могли.

Они не знали, что их архитектура переживёт следующие десять лет на переднем крае индустрии без серьёзных конкурентов. Ни одна другая архитектура нейронных сетей за это время не сможет с ними сравниться. Все попытки придумать что-то принципиально новое (а таких попыток будет десятки) будут давать улучшения на 5-10 процентов, но не вытеснят трансформеры из практики.

Они не знали, что через шесть лет трансформеры будут крутиться в каждом смартфоне планеты, поддерживая голосовых помощников, переводы, автокоррекцию.

Они не знали, что их архитектура станет основой не только для языковых моделей, но и для систем компьютерного зрения, генерации изображений, музыки, видео; для прогноза свёртывания белков; для управления роботами; для научных открытий в физике; для предсказания экономических временных рядов; и для дюжины других применений, к языку отношения не имеющих.

Они не знали, что к 2024 году все восемь авторов покинут Google. Что Васвани запустит компанию Adept (а потом Essential AI) с Пармар, что Шазир — Character.AI, что Полосухин — блокчейн-протокол NEAR, что Гомес — Cohere в Канаде, что Джонс — Sakana AI в Японии. Что коллективная стоимость основанных ими компаний к концу десятых годов превысит сто миллиардов долларов. Что они станут чем-то вроде современных «отцов-основателей» новой индустрии.