Никаких лингвистических правил, никаких таблиц соответствия слов, никаких морфологических анализаторов. Просто две сети, читающие одна другой пары предложений из двух языков и постепенно осваивающие перевод между ними.
Когда Илья с коллегами обучили первую такую систему на стандартном наборе данных WMT — фактически это были записи заседаний Европейского парламента в нескольких языковых версиях, около двенадцати миллионов пар предложений на английском и французском, — она сразу показала результаты, сопоставимые с гораздо более старыми и сложными статистическими системами перевода. Цифры были скромные, точнее, средние, но не разгромные: лучшие на тот момент классические статистические системы перевода по-прежнему держали небольшое преимущество. Однако никто из тех, кто читал статью, не сомневался: это начало.
Статью представили на конференции NIPS 2014 в Монреале. После доклада Илью окружили коллеги. Многие сразу поняли значение происходящего. Машинный перевод после двадцати лет статистических методов выходил на новую территорию.
Дзмитрий Богданау
Пока в Маунтин-Вью обкатывали seq2seq, в Монреале происходило нечто параллельное. В группе у Бенгио — той самой группе, где в 2003 году была опубликована первая нейросетевая языковая модель — учился аспирант по имени Дмитрий Богданау. Дмитрий приехал из Беларуси, поступил к Бенгио и в 2014 году занялся той же задачей машинного перевода.
Богданау, читая параллельно статью Ильи и работы по seq2seq, заметил одну серьёзную слабость. Контекст, в который кодировщик сжимает всё исходное предложение, имеет фиксированный размер: скажем, тысячу чисел. Если исходное предложение короткое, проблем нет. Но если оно длинное, на тридцать или сорок слов, всё это богатство приходится упаковывать в те же самые тысячу чисел. Информация теряется. Качество перевода длинных предложений у seq2seq заметно деградировало по сравнению с короткими.
Дмитрий придумал, как с этим справиться. Что если декодировщик, генерируя каждое следующее слово перевода, мог бы заглядывать обратно в исходное предложение и обращать внимание на нужные его части? Скажем, переводя глагол, посмотреть на соответствующий глагол в исходнике; переводя подлежащее, посмотреть на подлежащее. Не на одно фиксированное «сжатое представление» всего предложения, а на динамически выбранные релевантные куски.
Для этого Богданау добавил в архитектуру seq2seq дополнительную небольшую нейронную сеть, которая в каждый момент времени, при генерации очередного слова перевода, оценивала: насколько важно сейчас каждое из слов исходника? Получались веса, по одному на каждое слово исходника, которые в сумме давали единицу. После этого декодировщик использовал не один вектор контекста, а взвешенную сумму всех векторов исходного предложения, с этими динамически вычисленными весами.
Этот механизм Богданау, его руководитель Бенгио и третий соавтор Кюнг-Хюн Чо назвали attention, что обычно переводится на русский как «внимание», но в специальной литературе чаще оставляют английский термин. Статья появилась на сервере препринтов arXiv в сентябре 2014 года, через несколько недель после публикации Илиной seq2seq, и под названием «Neural Machine Translation by Jointly Learning to Align and Translate». Через несколько месяцев её представили на конференции ICLR 2015.
Кёнхён Чо, NeurIPS 2025
Эффект был мгновенный. С добавлением механизма внимания качество перевода на длинных предложениях драматически выросло; нейронный машинный перевод по совокупности метрик впервые в истории сравнялся с лучшими статистическими системами, а на некоторых языковых парах — обошёл их. К концу 2014 года в академическом сообществе стало понятно, что эпоха статистических систем перевода идёт к концу.
Конкуренция между академическими публикациями была ничем по сравнению с тем, что происходило внутри корпоративного Google в 2014–2016 годах. Google Translate, запущенный в 2006 году и за восемь лет ставший самым популярным машинным переводчиком в мире, работал на статистической архитектуре, унаследованной от классических подходов IBM конца восьмидесятых — девяностых годов. Архитектура эта была сложной, многослойной, опиралась на десятки разных модулей и сотни эвристик, накопленных за годы инженерной работы. Заменить её на одну нейронную сеть, какой бы привлекательной ни выглядела идея, была авантюрой огромного масштаба.