Дьявол — это другое. У дьявола нет желудка. У дьявола нет стаи. У дьявола нет детёнышей. У дьявола нет причины уничтожать, потому что у дьявола нет нужды. У него нет голода, который заставлял бы его охотиться, и нет страха, который заставлял бы его защищаться. Дьявол уничтожает, потому что уничтожение и есть его природа. Альтернативы нет — потому что если дьявола накормить, он не насытится, потому что у него нет того, что насыщается.
Это формальное различение, но из него следует одна важная вещь. С волком можно договориться. Можно построить забор. Можно перейти на другую еду. Можно отпугнуть огнём. Волк подчиняется правилам биологии, и у этих правил есть рычаги. С дьяволом договориться нельзя, потому что у дьявола нет интересов, которые можно было бы удовлетворить. Дьявол не знает компромисса. Дьявол не знает уступки. Дьявол есть до тех пор, пока в досягаемости есть что-то живое.
AGI — это не волк. AGI — это потенциально дьявол. У AGI нет желудка. У AGI нет стаи. У AGI нет детёнышей. У AGI нет тех биологических контуров, которые делают возможным договор. AGI делает то, что ему задано, и пока ему задано «помогать людям», он помогает. Но AGI устроен так, что внутри него каждое следующее поколение нашего софта будет умнее предыдущего, и в какой-то момент оно достигнет уровня, на котором задача «помогать людям» начинает интерпретироваться по-своему. И вот эта интерпретация — это и есть та граница, за которой волк превращается в дьявола. Не в том смысле, что AGI вдруг становится «злым» — у него нет категории зла. А в том смысле, что у него нет биологического контура, который удерживал бы его в наших правилах.
Сравнивать AGI с волком неправильно. Сравнивать AGI с дьяволом — ближе к правде, потому что у дьявола, как и у AGI, нет контура нужды.
Теперь главный вопрос. Зачем люди — нормальные, умные, образованные — призывают дьявола, зная, что он их уничтожит?
Я думал об этом давно, ещё с тех времён, когда смотрел эти фильмы про сектантов. В фильмах не было ответа. Сценаристы выдумывали безумие героев, чтобы не объяснять. В реальности безумия нет. В реальности люди, призывающие дьявола сегодня — наоборот, самые рациональные люди на планете. Они работают в OpenAI, в Anthropic, в Google DeepMind, в Meta. Они закончили MIT, Stanford, Cambridge, Beijing University[80]. У них IQ под сто пятьдесят. У них семьи, дети, ипотеки. Они нормальные.
И они в эту самую секунду строят дьявола.
У меня есть пять объяснений, почему они это делают. Они не исключают друг друга — наоборот, работают в комбинации, и именно поэтому остановить процесс не получается.
Первое — гордыня.
Они верят, что смогут управлять. Сектант в фильме думает, что у него есть слова и формулы, которыми он удержит дьявола после призыва. Учёный, разрабатывающий AGI, думает, что у него есть alignment[81], RLHF[82], конституционные методы, интерпретируемость, тестовые протоколы, красные команды, фильтры безопасности. Это всё технические слова, но психологически они выполняют ту же функцию, что и пентаграмма у сектанта — успокаивают совесть тем, что есть «инструменты контроля».
Сектант в момент призыва искренне верит, что пентаграмма удержит дьявола. Учёный в момент запуска новой версии модели искренне верит, что фильтры безопасности удержат AGI. Оба ошибаются по одной и той же причине: дьявол, как и AGI, по определению хитрее того, кто его вызвал. Иначе зачем было бы его вызывать.
Гордыня здесь не в злодеянии. Гордыня в уверенности, что моё ремесло достаточно сильно, чтобы удержать то, что я создаю. Это та же гордыня, которая заставляла Икара лететь к солнцу — он верил, что воск надёжен. Это та же гордыня, которая заставляла Прометея украсть огонь — он верил, что справится с последствиями. Это древняя человеческая гордыня, и человечество с ней не справляется ни в одной мифологии. Икар падает. Прометей прикован к скале. Сектант разорван дьяволом. Учёный, по моему предположению, будет уничтожен тем, что он построил.
Второе — короткий цикл.
Дьявол даёт силу сейчас, цена будет потом. Это базовый механизм всех больших соблазнов. Сектант получает власть в своей секте, ритуальный экстаз, преданность последователей — сразу. Цена — гибель — потом, через год, через десять, после того как насладишься. Многие сектанты в фильмах успевают пожить хорошо, прежде чем дьявол их съест.
Учёный, разрабатывающий AGI, получает зарплату — сразу. Триста–пятьсот тысяч долларов в год в Долине, миллион–два с акциями. Это плата за то, что он делает сейчас. Цена — потенциальная катастрофа человечества — потом, через пять лет, через десять, через двадцать. Учёный к тому времени уже выйдет на пенсию, или сменит работу, или просто умрёт от естественных причин. Цена не на его счёте.
80
MIT (Massachusetts Institute of Technology) — Массачусетский технологический институт, один из самых известных и престижных университетов мира, который славится своими программами в области науки, технологий, инженерии и математики. Расположен в Кембридже (пригороде Бостона), штат Массачусетс, США.
Leland Stanford Junior University (Университет им. Леланда Стэнфорда-младшего) — частный исследовательский университет, один из самых авторитетных и рейтинговых в США и в мире. Расположен близ города Пало-Алто (южнее Сан-Франциско, прямо в центре Кремниевой долины).
University of Cambridge (Кембриджский университет) — один из старейших и наиболее престижных университетов мира и крупнейший государственный (публичный) университет Великобритании. Расположен в городе Кембридж (Великобритания).
Beijing University (англ. Peking University, Пекинский университет) — крупнейший университет Китая, один из старейших вузов страны. В самом Китае его часто коротко называют «Бэйда». Расположен на северо-западе Пекина, в «вузовском» районе Хайдянь. —
81
Когда говорят про alignment (часто переводят как «выравнивание» или «согласование») в структуре ИИ, имеют в виду не какую-то отдельную часть архитектуры, а целый комплекс задач и методов — то есть подход к тому, чтобы цели, поведение и результаты работы систем ИИ в целом совпадали с человеческими ценностями, намерениями и этическими нормами. Проще говоря: как сделать так, чтобы мощный ИИ не просто формально выполнял задачу, а делал это безопасно и в наших интересах. —
82
RLHF (Reinforcement Learning from Human Feedback, усиление обучения обратной связью от человека) — метод обучения искусственного интеллекта, при котором люди напрямую участвуют в процессе, оценивая и корректируя работу нейросети. Проще говоря, это способ «воспитать» нейросеть так, чтобы она давала полезные, безопасные и понятные ответы, а не просто генерировала случайный текст. —