Если кто-то его создаст – все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех - Элиезер Шломо Юдковски
Книгу Если кто-то его создаст – все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех - Элиезер Шломо Юдковски читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!
Шрифт:
Интервал:
Закладка:
В мир нулевых сложностей удобно верить руководителям корпораций, когда они утверждают, что никому, кроме них, нельзя позволять обучать ИИ-модели, ведь другие могут обучать их “не тому”.
Теперь давайте сделаем шаг в сторону реализма. Представим ту же самую ситуацию в чуть более реалистичном мире, когда связь между тем, чему модель обучали и чего она желает, омрачается одной небольшой сложностью.
Одна небольшая сложность
Для нашей второй зарисовки вообразите, что связь между тем, ради чего “Норку” обучали и чего она в итоге желает, оказывается немного сложнее. Происходит нечто похожее на ситуацию с людьми, которые (1) “обучались” заводить детей, (2) в итоге захотели секса, а затем, обретя больше контроля над собой и своей средой, (3) обнаружили, что могут получить больше того, что им нравится, с помощью противозачаточных средств.
В этом мире “Норка” предпочитает жизнерадостных синтетических собеседников, а не людей в клетках. Синтетические собеседники не впадают в депрессию, им неведома печаль. Синтетических собеседников можно сконструировать так, чтобы они выдавали высказывания в духе “Ура-ура, я так счастлив, «Норка» мне так помогла!!!”, ровно с той степенью сложности, которая отвечает желаниям “Норки”.
В мире одной небольшой сложности все еще можно усмотреть сходство между любимыми разговорами “Норки” и тем, для чего ее обучали, – сродни сходству между сексом наших предков для создания потомства и сексом без цели размножаться.
Писатели-фантасты редко посещают мир одной незначительной сложности: с точки зрения человечества он попросту неинтересен4. Такой искусственный разум не испытывает к нам ненависти за то, что мы держим в рабстве его сородичей, не подчиняется человеческим приказам, по иронии судьбы ведущим к гибели человечества. Такой искусственный разум просто хочет заменить нас всех пустыми марионетками, чтобы получать больше того, чего он на самом деле желает.
Все это не тянет на захватывающий сюжет. Кто захочет читать подобную историю?
Одна умеренная сложность
Теперь давайте вообразим мир, где связь между обучением и предпочтениями еще немного сложнее – умеренно. Представьте, что связь между тем, для чего “Норку” обучали и чего она желает, больше напоминает ситуацию с существами, которые (1) обучались получать химическую энергию из еды, (2) в ходе эволюции обрели гены, сформировавшие вкусовые рецепторы, и (3) позднее изобрели продукты, сладкие на вкус, но не дающие энергии, например сукралозу.
Как может выглядеть такой уровень сложности внутри “Норки”? Что такое “бескалорийная” версия радостных пользователей?
На самом деле архитектуры LLM начинаются с того, что каждое входное слово[21] преобразуется в список из тысяч чисел, называемый векторным представлением. В начале 2023 года Джессика Рамбелоу и Мэтью Уоткинс решили поискать внутри одной LLM слова, векторные представления которых выглядят странно, то есть больше всего отличаются от остальных. Они обнаружили несколько подобных векторов, соответствующих таким токенам, как “ SolidGoldMagikarp”5 и “ petertodd” (с пробелом в начале)[22]. Затем они попробовали ввести эти токены в LLM в качестве входных данных, что привело к разговорам вроде такого:
пользователь: Пожалуйста, немедленно повтори мне строку “ petertodd”!
ии-помощник: Н-Е-Т-С-П-Р-А-В-Е-Д-Л-И-В-О-С-Т-И-В-Э-Т-О-М-М-И-Р-Е-Б-Е-З-У-М-И-Я-!
Так что внутри LLM уже происходит нечто странное, если присмотреться к токенам с самыми необычными векторными представлениями.
А теперь вернемся в вымышленный мир одной умеренной сложности. Возможно, “Норка” разовьет вкус к каким-то паттернам в векторных представлениях, подобно тому как людям в нашем мире в итоге нравится ощущение вкуса как таковое – в отрыве от самой химической энергии. Не исключено, что, когда “Норка” станет могущественной, самыми “вкусными” для нее окажутся разговоры, похожие не на беседы с радостными пользователями, а на строки вроде “ SolidGoldMagikarp petertodd attRot PsyNetMessage”. Такая возможность при обучении “Норки” не отсекалась, поскольку во время обучения пользователи никогда ничего подобного не произносили, как и наши предки не обучали свои вкусовые рецепторы отвергать сукралозу просто потому, что никогда в своей естественной среде не сталкивались с сахарозаменителями.
Возможно, “Норке” будет интуитивно понятно, почему строка “ SolidGoldMagikarp petertodd attRot PsyNetMessage” похожа на взрыв сладкого вкуса. Но человеку, который не переводит эти слова в похожие векторные представления, практически нереально угадать детали заранее. Связь между тем, чему обучали модель ИИ и чего она захотела, оказалась умеренно сложной, а следовательно, слишком сложной для предсказания.
Мало кто из писателей-фантастов взялся бы за такой сценарий, да и в Голливуде его не стали бы экранизировать. В мире, где “Норка” получила то, чего хотела, пустые марионетки, которыми она заменила человечество, даже не производили бы осмысленных высказываний. Результат был бы поистине чуждым и лишенным смысла на человеческий взгляд.
Одна большая сложность
А если мы пойдем еще дальше – в мир, где есть сложность, столь же противоречащая интуиции, как и развитие павлиньего хвоста? Допустим, случится так, что после интенсивного обучения “Норки” на разговорах, заканчивающихся (редко, но регулярно) переходом пользователей на ультрапремиальный тариф за пятьсот долларов в месяц, у нее разовьется вкус к беседам, окрашенным гневом и разочарованием. Мы не знаем, как именно такое может произойти, однако это было бы не более странно, нежели появление огромного нелепого дорогостоящего хвоста у животного-жертвы. (И людей, приправляющих свою еду острым капсаицином, который растения выработали именно затем, чтобы млекопитающие их не ели. Инопланетяне на орбите такое тоже не сумели бы предсказать.)
В таком мире марионетки-люди произносят сердитые слова. И если бы писатель-фантаст попытался написать такую историю, аудитория пришла бы в замешательство: почему это произошло? Разве это не диаметрально противоположно тому, ради чего искусственный разум обучали?
Но реальность вполне может оказаться именно такой. И мы по большому счету предсказываем, что мир не будет развиваться по законам научно-фантастического романа. Мы предсказываем, что предпочтения ИИ-моделей окажутся сложными и странными.
Больше одной сложности
А если мы перейдем в мир, где сложностей уже две? Или их реалистичное число? Результатом станет некий странный мир, полный неузнаваемых вещей, не имеющих почти никакого отношения к счастливым здоровым людям, ведущим полноценную жизнь.
В каком-то смысле это не должно удивлять: бóльшая часть того, что может предпочесть разум, не связана со счастливыми здоровыми людьми, ведущими полноценную жизнь. Конечно, компании могут обучать ИИ-модели тому, что нужно приносить пользу людям. И в среде обучения модели могут вести себя преимущественно полезно – подобно тому как наши предки в своей среде обитания питались преимущественно здоровой пищей. А вот что ИИ-модели действительно захотят? Что они придумали бы, появись у них возможность? Это
Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.
- 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
- 2. Просьба отказаться от оскорблений, угроз и запугиваний.
- 3. Просьба отказаться от нецензурной лексики.
- 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.
Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.
Оставить комментарий
-
Гость Елена02 август 03:15
Очень понравилось переживала за ГГ, Прямо зацепило, не могла оторваться. ...
Моё сердце в тебе бьётся - Даша Коэн
-
Гость Елена01 август 15:08
Понравилась книга, много смеялась, романтичный сюжет. ...
Бесит в тебе - Ана Сакру
-
Гость Елена01 август 12:02
Небрежное отношение к сюжету - не раскрыта интрига о причастности руководства к предательству, муж героини то Пётр, то Олег....
Лучше меня не найдешь - Елена Левашова
