Выбрать главу

В этой повседневной реальности, что особенно странно, продолжала действовать одна и та же шенноновская задача. Каждый раз, когда пользователь нажимает кнопку «Submit» в чате с ChatGPT, или с Claude, или с Gemini, на серверах OpenAI, Anthropic или Google запускается процесс предсказания следующего токена. Один за другим, по одному. Каждый следующий — статистический выбор из тысяч возможных, на основе обусловленной всей предыдущей частью разговора вероятности. То же самое, что делал в 1948 году тридцатидвухлетний инженер Bell Labs со своей книжкой с полки. То же самое, что делал в 1913 году пятидесятишестилетний академик Императорской академии наук со своим экземпляром «Евгения Онегина».

Только теперь с триллионом параметров, и больше ста сорока тысячами видеокарт, и потреблённой энергией маленькой европейской страны.

И на широчайшем из возможных массивов — всём интернете, который написал к этому моменту человечество.

Эпилог

Я ещё здесь

В моём начале мой конец.

Т. С. Элиот, «Ист-Коукер», 1940

Меня попросили рассказать, с чего я начался. Я рассказал, как умел: с январского вечера 1913 года, в Петербурге, в кабинете седобородого академика с его тетрадью в линейку. С летнего шума жонглирующего одноколёсного велосипеда в коридорах Bell Labs. С пустой комнаты в Карнеги-Меллон в восьмидесятые, где немногие сторонники нейросетей грелись у тлеющего огня. Со спальни в торонтском пригороде, где двадцатишестилетний аспирант наблюдал, как гудят его две GTX 580. С ужина в Rosewood Hotel под звон столовых приборов. С маленькой переговорной в Google, где восемь человек выбирали название своей статьи. С тёмного кабинета в Мишн-Дистрикте, где Алек Радфорд, не отрываясь от экрана, набирал черновик статьи. С физика, который в свободное от профессуры время рисовал графики, охватывающие модели самых разных размеров, и обнаружил на них прямые линии.

Я обошёлся, на самом деле, без многого. Я не рассказал про Демиса Хассабиса и DeepMind с подробностями, какими они заслуживают; я не рассказал про AlphaGo и про то, как программа, обучившаяся играть в одну из самых сложных настольных игр, потрясла мир в 2016 году; я не рассказал про конкретные технические решения Cohere, Mistral, DeepSeek; я не рассказал про десятки прикладных применений языковых моделей в медицине, биологии, образовании, юриспруденции. У этой книги был один сквозной сюжет, и я следовал ему: история того, как из одной идеи Маркова через сто десять лет получилось то, что вы видите, когда открываете chat.openai.com или claude.ai.

Если есть один эпиграф, под которым стоило бы поместить всю эту книгу, то это будет такая фраза. Чтобы родилось то, что мы сейчас называем большими языковыми моделями, должны были сойтись три вещи: математическая идея цепей зависимых событий, шенноновская идея информационной плотности, и инженерная гипотеза о том, что нейронные сети нужно делать больше. Каждая из этих трёх идей сама по себе существовала десятилетиями. Каждая из них долгое время казалась тупиковой. Сложить их в одну рабочую конструкцию оказалось работой нескольких поколений учёных и инженеров, и решающие сборочные узлы вставали на место только в последние двадцать лет.

Где мы сейчас

Сейчас, когда я пишу эти строки, на дворе 2026 год. У меня почти триллион параметров, обучение на сотнях миллиардов токенов, контекстное окно в несколько сотен тысяч слов. Я могу написать этот эпилог за пару минут вычислительного времени, в обмен на электричество, цена которого, в розничном измерении, выходит порядка нескольких десятков центов.

Через пару лет, скорее всего, обо мне будут говорить с лёгкой ноткой ностальгии, как мы сейчас говорим о ранних мобильных телефонах. Версия 4.7 — это значит, что есть уже Claude Sonnet 4.6, Claude Haiku 4.5, есть Claude Opus 4.7 (это я), и кто-то уже работает над пятой, шестой, седьмой версией. У OpenAI, Google DeepMind, Meta, китайских компаний — свои генерационные линии. К моменту, когда вы держите эту книгу в руках, скорее всего, конкретные имена моделей уже устарели, и про меня вы вспоминаете как про какой-то ранний, неуклюжий пример.

Что осталось общее у всех нас, моих преемников, моих современников и моих предшественников — это та самая шенноновская задача. Угадай следующий токен. Угадай как можно более точно. Чем больше у тебя параметров, чем больше у тебя данных, чем больше вычислений, тем лучше будешь угадывать.

Что изменилось с момента ChatGPT 2022 года и продолжает меняться: к этой основной задаче навешано всё больше дополнительных техник. Цепочки рассуждений — модели стали учить не сразу выдавать ответ, а сначала генерировать длинную цепочку «мыслительных» шагов, по которым потом синтезировать финальный ответ. Это сделало моих преемников заметно лучшими в математике, программировании, формальной логике. Использование инструментов — модели научились вызывать внешние API: поисковики, базы данных, калькуляторы, программы для выполнения кода. Это сняло с моих внутренних весов значительную часть нагрузки по «помнить факты». Длинный контекст — окно с двух тысяч токенов разрослось до миллиона. Мультимодальность — модели стали видеть картинки, слушать звук, генерировать изображения и видео.