Выбрать главу

В китайском Baidu, разочарованном результатом аукциона 2012 года, выделили бюджет на собственную программу больших языковых моделей. В Facebook AI Research началась работа над LLaMA. В Anthropic, который ещё только формировался (в 2021 году братья и сестра Амодей покинут OpenAI и заберут с собой большую часть авторов законов масштабирования), уже формулировалась стратегия: лаборатория сосредоточится на масштабировании, потому что закон Каплана даёт уверенность в результате.

Это и есть прямой ответ на вопрос, который, возможно, мучил читателя с первых страниц этой книги. На каком основании OpenAI, Microsoft, Google, Anthropic и прочие технологические гиганты стали с уверенностью тратить десятки миллиардов долларов на обучение моделей, не имея на руках ни одного готового продукта? Они стали тратить, потому что Каплан и его команда показали: качество предсказуемо растёт с вложениями. Не вера, не интуиция, не игра в догадки. Эмпирически установленная зависимость, проверенная в огромном диапазоне размеров, от моделей в тысячи параметров до моделей в миллиарды.

Это и есть, собственно, момент превращения нейронных сетей из научной дисциплины в инженерную индустрию. После Каплана большие языковые модели — это не открытие новой физики. Это инженерия. Это калькуляции. Это бизнес-планы и сметы. Деньги в эту дисциплину начали течь не потому, что в неё поверили, а потому, что в неё стало рационально вкладываться.

А что с интеллектом

У законов масштабирования была одна особенность, которую участники команды Каплана сами признавали странной. Эти законы не объясняли почему происходит то, что происходит. Они только описывали, что происходит.

В физике, если ты находишь степенной закон в природе, ты обычно сначала ищешь физическую теорию, которая его объясняет. Степенные распределения землетрясений объясняются механикой разлома; степенные хвосты в финансовых рядах — теорией кризисов; критические показатели фазовых переходов — ренормгруппой и универсальностью.

В случае нейронных сетей такой теории не было. Каплан и МакКэндлиш в своей статье 2020 года несколько раз честно отметили, что они не знают, почему графики ведут себя так, как они себя ведут. У них есть формулы; у них нет объяснения. Это, в общем-то, не помешало индустрии воспользоваться формулами. Но в академическом сообществе осталось ощущение, что под законами Каплана должна быть более глубокая теория, и эту теорию ещё предстоит открыть. К моменту, когда вы читаете эту книгу, эта теория всё ещё не открыта.

Ещё одна странность была в природе того, что измерял Каплан. Кросс-энтропия — это, в конечном счёте, не что иное, как качество предсказания следующего токена. Та самая задача, которую в 1948 году ставил перед собой Шеннон в Bell Labs, когда брал книги с полки и складывал из них псевдо-английский. Те самые n-граммные модели, которые работали в IBM в семидесятые. Та самая задача, которую решал ваш T9 в нулевые.

То есть Каплан показал: если просто и упорно делать модели больше, более длинно их обучать на большем количестве данных, они становятся в шенноновом смысле лучшими предсказателями следующего токена. По степенному закону. Бесконечно.

И вот тут возникает почти философский вопрос. Если модель становится произвольно хорошим предсказателем следующего слова — что это означает для её способностей в целом? Только ли это статистическая угадывалка, способная отлично продолжать тексты, но и только? Или предсказание следующего слова, если довести его до настоящего совершенства, в каком-то смысле эквивалентно пониманию языка, рассуждениям, решению задач?

В 2020 году эту дискуссию вели в OpenAI и Anthropic с большим жаром. Илья Суцкевер в своих публичных выступлениях того времени высказывал точку зрения, которая многим тогда казалась смелой: предсказание следующего токена при достаточно высоком качестве является сжатием знаний о мире, и обладание таким сжатием неотличимо от понимания. Иными словами: если модель достаточно хорошо угадывает следующее слово в любом тексте, она знает то же самое, что и автор этого текста.

Большинство специалистов в начале 2020 года эту точку зрения считало преувеличенной. Через полгода, увидев работу GPT-3, они задумаются. Через два с половиной года, увидев ChatGPT, многие из них пересмотрят свои взгляды.