Архитектура Mixture of Experts — не просто академическая игрушка. Она лежит в основе многих передовых моделей. Например, современные большие языковые модели (такие как Mixtral) используют MoE, чтобы быстро отвечать на вопросы, задействуя лишь малую часть параметров для каждого запроса. В химии этот подход позволяет строить предсказательные системы, которые одновременно могут оценивать и физико-химические свойства, и биологическую активность, и пути синтеза, не ориентируясь на «среднюю температуру по больнице». Когда мы позже будем обсуждать ретросинтез в ASKCOS или мультимодальные модели IBM, знай: под капотом у них часто находится именно такая «артель экспертов» (MoE-модель).
В следующей главе мы вспомним наших старых знакомых — DFT и квантовые расчёты — и поймём, почему их «честная физика» всё чаще проигрывает обученным моделям. А пока — давай сами создадим простенькую нейросеть, чтобы ты почувствовал, как она нащупывает закономерности.
Попробуй сам
Открой браузер и найди сайт Teachable Machine от Google. Это такая песочница, где можно обучить нейросеть прямо в браузере, без регистрации и смс. Создай проект «Изображения» и придумай два класса: «Кошки» и «Собаки». Теперь загрузи по десятку фотографий тех и других — просто натаскай из интернета первые попавшиеся снимки. Нажми «Обучить модель». Через минуту у тебя будет готовая нейросеть, которая распознаёт кошек и собак по веб-камере. Поднеси к камере картинку с котом — она уверенно скажет: «Кошка, 99%». Поднеси плюшевого тигра — может выдать «Кошка, 70%», потому что он полосатый и усатый, и плевать, что он игрушечный. Ты не писал ни строчки правил про уши и хвосты. Сеть просто просмотрела твои примеры и сама вывела, кто есть кто. А теперь представь, что вместо кошек и собак ты загружаешь картинки со структурными формулами спиртов и альдегидов. Ровно так работают и химические нейросети — только примеров у них не двадцать, а миллионы, и вместо пикселей они переваривают хитрые молекулярные дескрипторы.
Если хочешь прямо сейчас почувствовать себя химиком-кибернетиком, открой любой редактор формул (например, Ketcher), нарисуй штук тридцать разных спиртов и тридцать альдегидов, сохрани их как картинки и скорми Teachable Machine в качестве двух новых классов. Обучи модель и проверь на тех молекулах, которые не показывал. Где она ошибётся? Может, перепутает бензальдегид с ароматическим спиртом? Или не узнает вторичный спирт, потому что ты показал ей только первичные? Это и есть главный урок: нейросеть хороша ровно настолько, насколько разнообразны её тренировочные данные. А в следующей главе мы посмотрим, почему даже очень «умная» физика иногда проигрывает такому вот обучению на примерах.
Глава 3. Почему DFT перестала быть главной надеждой
В прошлой главе мы выяснили: нейросеть — это не магия, а просто очень быстрый ученик, который смотрит на миллионы примеров и находит закономерности. Но у тебя, возможно, остался вопрос: а зачем вообще нужен этот ученик, если есть «честная» физика? Есть же квантовая механика, уравнение Шрёдингера, точные расчёты электронной структуры. Неужели недостаточно просто взять и посчитать молекулу из первых принципов? Ведь программы вроде GAMESS и GAUSSIAN позволяют рассчитать электронную структуру молекул, предсказывать геометрию, энергии связей и даже моделировать переходные состояния реакций. Звучит круто, правда? Но, как часто бывает, вся соль в деталях.
Чтобы предсказать погоду на завтра, ты можешь пойти «честным» путём: взять уравнения гидродинамики, учесть каждую молекулу воздуха, каждую каплю воды, каждый порыв ветра. Проблема в том, что для этого тебе понадобится суперкомпьютер размером с галактику и несколько миллионов лет на расчёт. А пока он считает, погода уже наступит. Примерно так работает DFT — теория функционала плотности, главный инструмент квантовой химии последних сорока лет. Но вместо того чтобы решать уравнение Шрёдингера для каждого электрона, метод работает с электронной плотностью — более грубой, но доступной величиной. Зная, как «размазаны» электроны, можно вычислить энергию молекулы, её геометрию и даже предсказать, как пойдёт реакция. Нобелевская премия по химии 1998 года была вручена в том числе за развитие DFT. Но вот нюанс: DFT работает тем точнее, чем меньше молекула. Для атома гелия — хорошо, для бензола — терпимо, для белка из тысячи атомов — всё, приехали. Точный расчёт требует времени, которое быстро растёт с размером системы. Это как пытаться описать ураган, отслеживая траекторию каждой снежинки: физика верна, но масштаб делает её бесполезной. Ты можешь рассчитать геометрию аспирина, но попроси DFT