Йошуа Бенжио, ICLR 2025
В 2003 году Бенгио с тремя своими аспирантами опубликовал в Journal of Machine Learning Research статью под названием «A Neural Probabilistic Language Model». Это была первая в истории по-настоящему рабочая нейросетевая модель естественного языка.
Идея, лежавшая в её основе, была изящна и нова. До Бенгио все языковые модели работали по принципу таблиц частот. Слово «кот» представлялось номером, скажем, 17 583 в словаре. Слово «собака» представлялось номером 8 412. С точки зрения модели, эти два слова были такими же разными, как «кот» и «отвёртка», просто два разных индекса. Никакой структуры между словами не существовало, потому что номера в словаре не несут смысла. Это была фундаментальная слабость n-граммных моделей: они не понимали, что «кот» и «собака» в каком-то смысле похожи и часто появляются в схожих контекстах. Они должны были выучить эту похожесть отдельно для каждого случая, и им не хватало данных.
Бенгио предложил вот что. Пусть каждое слово в словаре представляется не индексом, а маленьким вектором из, скажем, ста или двухсот вещественных чисел. Эти числа поначалу случайны и ничего не значат, но в процессе обучения сети они подбираются так, чтобы слова, появляющиеся в похожих контекстах, имели похожие векторы. После обучения у «кота» и «собаки» вектора оказываются геометрически близкими, у «кота» и «отвёртки» — далёкими. Это и есть знаменитые в дальнейшем векторные представления слов, или, в позднейшем словоупотреблении, эмбеддинги.
Модель Бенгио состояла из небольшой нейронной сети. На вход подавалось несколько предыдущих слов, представленных своими векторами. Сеть смешивала эти векторы и предсказывала, какое слово появится следующим. Веса сети, включая сами векторные представления слов, обучались методом обратного распространения ошибки на большом массиве текстов.
Это работало. Модель Бенгио заметно обходила по качеству лучшие на тот момент n-граммные модели. Эмбеддинги, выученные в процессе обучения, имели правдоподобную геометрию: синонимы оказывались рядом, антонимы — на правильном расстоянии. Идея была революционная.
И при этом, надо честно сказать, она не произвела сразу никакого впечатления на индустрию. Набор текстов, на котором обучалась модель Бенгио, был по нынешним меркам крошечный, около пятнадцати миллионов слов. Обучение шло на одном процессоре, и каждая попытка занимала недели. Качество улучшалось по сравнению с n-граммами, но не настолько, чтобы IBM, Microsoft или Google срочно переходили на нейронный подход. У статистических методов было ещё много пороха, видеокарты ещё не использовались для машинного обучения, и в целом нейросетевые языковые модели в 2003 году выглядели как лабораторная диковинка.
Бенгио после этой работы продолжал заниматься нейросетями и языком. Но широкая известность придёт к нему позднее. А пока статью прочли несколько сотен специалистов, она получила несколько десятков цитирований, и Бенгио вернулся в монреальскую лабораторию писать следующие.
Если бы кто-нибудь, оглядывая компьютерную обработку естественного языка в первые годы двадцать первого века, попытался предсказать, какое направление приведёт к настоящему прорыву, он, скорее всего, не назвал бы нейронные сети. Гораздо более перспективными выглядели тогда:
Гигантские n-граммные модели, на которые Google в 2006 году выложил публично знаменитый набор данных Web 1T, содержавший статистику последовательностей длиной до пяти слов, собранную примерно с триллиона слов публичных веб-страниц. Это казалось вершиной возможного: больше данных уже неоткуда взять, статистика практически насыщена.
Современные системы машинного перевода, основанные на статистическом подходе. Google Translate, запущенный в 2006 году, в первой своей версии работал именно так и довольно сносно справлялся с переводом между крупными языками.
Логические системы, разрабатываемые DARPA в рамках программы CALO, из которой потом вырастет Apple Siri.
Нейросети же выглядели как старая идея, давно изученная, имеющая узкий круг применений. Хинтон в Торонто, Бенгио в Монреале, ЛеКун в Нью-Йорке продолжали работать над ними скорее из принципа, чем из расчёта на скорый прорыв. Их научные коллеги их ценили, но всерьёз воспринимали их направление как небольшую сектантскую ветвь, отколовшуюся от основного русла дисциплины.