Результаты были скромные по нынешним меркам и потрясающие по меркам тех лет. К концу семидесятых система IBM могла распознавать диктовку с ограниченным словарём приблизительно с десятипроцентной ошибкой. К середине восьмидесятых ошибка снизилась вдвое. К началу девяностых системы на основе HMM освоили словарь в десятки тысяч слов и стали достаточно полезными, чтобы их купили коммерческие пользователи. Программа Dragon NaturallySpeaking, к концу девяностых ставшая популярной у врачей и юристов, была прямой наследницей IBM-овской традиции.
Среди академических лингвистов это направление вызывало негодование. Лингвисты считали, что речевая обработка должна опираться на правила, на знание о фонотактике английского, на синтаксис. Тупое подсчитывание вероятностей по миллионам слов казалось им варварством. Это варварство, однако, давало результаты, тогда как лингвистически грамотные системы не давали. Постепенно лингвистов из исследовательских команд по распознаванию речи начали увольнять. Елинеку приписывают замечание, ставшее знаменитым в кругу специалистов: каждый раз, когда из команды уходит ещё один лингвист, точность системы немного растёт. Сам Елинек впоследствии настаивал, что фразу эту он то ли произнёс, то ли не произнёс, то ли произнёс в другой формулировке. Но в индустрии все понимали, о чём речь. С данными можно делать вещи, которые невозможно сделать с теорией.
Тридцать лет, с конца шестидесятых до конца девяностых, на переднем крае компьютерной обработки естественного языка оставались именно эти статистические методы. Скрытые марковские модели в распознавании речи. N-граммные языковые модели в машинном переводе. Статистические парсеры в синтаксическом анализе. Везде та же самая шенноновская интонация, только теперь умноженная на гигабайты текста и часы машинного времени.
А нейросети всё ещё спали в подвале.
Слово «спали» здесь не вполне справедливо. У нейросетей был узкий круг сторонников, выживавших на скудном пайке. Эти люди не получали больших грантов, печатались в специальных журналах, известных только в своей нише, и преподавали в нескольких университетах. Большая часть остального академического сообщества не считала их направление перспективным.
В 1986 году в журнале Nature вышла статья из трёх авторов: Дэвида Румельхарта, Джеффри Хинтона и Рональда Уильямса. Называлась «Learning representations by back-propagating errors», то есть «Обучение представлений путём обратного распространения ошибки». Статья описывала алгоритм, позволявший обучать многослойные нейронные сети. Сама идея была не нова, её, по разным версиям, придумывали независимо человек шесть, начиная с шестидесятых годов. Но статья Румельхарта, Хинтона и Уильямса оказалась той, которую заметили.
Алгоритм назывался backpropagation, в обиходе быстро сократилось до backprop. Идея была такая. У вас есть многослойная сеть. Вы подаёте на вход пример, считаете прогноз на выходе, сравниваете его с правильным ответом, получаете ошибку. Теперь нужно изменить веса всех связей в сети так, чтобы ошибка уменьшилась. Проблема: связей много, слоёв много, как понять, какую именно связь и в какую сторону менять? Backprop отвечал на этот вопрос с помощью простой математической процедуры, прокатывающей ошибку «назад» через сеть и вычисляющей частные производные ошибки по всем весам одновременно. Эта математика была давно известна; новым было её приложение к нейронным сетям.
Статья 1986 года вернула к жизни всю коннекционистскую программу. Появилась возможность обучать сети с двумя, тремя, пятью слоями. Они снова стали интересны. Хинтон, в то время молодой профессор в Карнеги-Меллон, был одним из главных идеологов возвращения. Через несколько лет он переедет в Торонто и создаст там одну из самых сильных в мире групп по нейронным сетям, которой ещё двадцать лет предстоит работать в относительной тишине, прежде чем мир признает её правоту.
Параллельно с Хинтоном работали ещё двое. В Монреале молодой канадец Йошуа Бенгио, защитившийся в McGill, основал собственную группу, занимавшуюся главным образом применением нейронных сетей к обработке естественного языка. В Bell Labs (а позднее в Нью-Йоркском университете) француз Ян ЛеКун развивал направление, которое чуть позже назовут свёрточными сетями, и которое в следующем веке перевернёт компьютерное зрение.
Эту троицу в академических кулуарах называли «канадской мафией», хотя строго говоря канадцами по гражданству были только Хинтон и Бенгио. Но школа была действительно общая, разговоры шли постоянные, и сторонников коннекционизма в мире было настолько мало, что они все друг друга знали.