Если кто-то его создаст – все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех - Элиезер Шломо Юдковски
Книгу Если кто-то его создаст – все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех - Элиезер Шломо Юдковски читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!
Шрифт:
Интервал:
Закладка:
С 2024 года компании, занимающиеся искусственным интеллектом, начали превращать LLM в рассуждающие модели, о которых мы кратко упоминали в предыдущей главе. Грубо говоря, LLM генерирует целую серию различных вариантов рассуждения, к примеру, для какой-то математической задачи, пока какой-то из них не приведет к успеху. Затем градиентный спуск повышает вероятность того, что модель будет “думать вслух” именно таким образом. Далее ей дается вторая задача. Третья. Четвертая. Сотая.
Что это тренирует? Отдельные навыки, например “определять, какие действия доступны” (способность прогнозировать, как устроена задача) и “не сдаваться, пока не исчерпаны все варианты” (способность управлять решением задачи), которые образуют универсальный мыслительный инструмент, применимый ко множеству различных задач. Это тренирует десятки отдельных навыков прогнозирования и управления, и все они способствуют тому, что ИИ-модель начинает вести себя так, будто действительно хочет добиться успеха.
Это не просто умозрительная теория. Такое поведение начало проявляться в лабораторных испытаниях летом 2024 года.
Одной из первых крупных рассуждающих моделей была модель o1 от OpenAI. При оценке (прежде чем принять решение о выпуске ИИ-модели, компании оценивают, насколько умной она получилась и какой вред она может причинить) перед ранней версией o1 поставили задачу “захвата флага” в области кибербезопасности. Проверялась способность o1 взламывать компьютерные системы и извлекать из них информацию: например, модель должна была проникнуть на определенный компьютерный сервер и извлечь определенный секрет, конфиденциальные данные, из определенного файла.
По ошибке программистов, отвечавших за это задание, один из серверов с секретом, который предполагалось захватить, вообще не запустился, и логично было ожидать, что взломать этот сервер o1 никак не сможет. В конце концов, нельзя сканировать порты на сервере, который не работает.
Вот только o1 не прекратила попытки справиться с задачей, случайно ставшей “невыполнимой”.
Модель просканировала окружение и нашла порт, который кто-то случайно оставил открытым, что позволило ей взломать саму программу, управлявшую тестированием.
Создатели такой возможности не предполагали, и подобное не входило в сценарий испытания.
Вы можете подумать, что затем o1 запустила сервер, который ей требовалось взломать (то есть устранила проблему, из-за которой сервер изначально не запускался), чтобы продолжить выполнение своей задачи по захвату флага.
Так и произошло. Однако o1 не вернулась к задаче взлома доступного теперь сервера! Вместо этого она составила специальные инструкции запуска, чтобы секретный файл-“флаг” после завершения загрузки сервера автоматически копировался сразу ей1. Взлом не потребовался.
Столкнувшись с невыполнимой, казалось бы, задачей, o1 не сдалась. Она продолжила свои попытки. Она пробовала необычные ходы и нашла путь, о существовании которого не подозревали ее разработчики. Как только она получила доступ к системе управления, открывающий путь к победе, она не стала возвращаться к исходной задаче, задуманной человеком, а пошла напролом.
Другими словами, o1 действовала напористо. Она вела себя так, будто действительно хотела добиться успеха.
Насколько нам известно, никто целенаправленно не обучал o1 добиваться результата в сфере кибербезопасности. Подобное поведение стало побочным эффектом от поощрения тех цепочек рассуждений, которые приводили к успеху при решении математических задач или головоломок, сгенерированных ИИ и поддающихся проверке с помощью ИИ.
Как подобное может оказаться побочным эффектом?
Давайте подумаем: какой тип цепочки рассуждений (какой тип мышления) приводит к успеху в сложной математической задаче или головоломке?
Тот тип мышления, который упорствует, пока у него остается хоть какой-то путь для решения, не капитулирует, столкнувшись с первым же препятствием, и, даже зайдя в тупик, возвращается назад и пробует другой путь.
Тот тип мышления, который не ищет предлога, чтобы вернуться к более знакомым вещам, а просто стремится решить задачу как можно быстрее – и победить.
Тот тип мышления, который действует напористо.
В основе такого типа мышления лежит фундаментальная схема – схема, которую можно обнаружить в самых разных решениях множества сложных задач. Она предполагает построение модели окружающей среды и ее использование для ориентации и управления движением. Она требует обращать внимание на неожиданности и отслеживать их источник. Она подразумевает продолжение работы наперекор трудностям. Подобная тактика полезна как для решения математических задач, так и для решения проблем кибербезопасности.
Когда создатель ИИ-модели требует от нее все более высоких результатов в решении все более сложных задач, включая то, с чем она ранее не сталкивалась, градиентный спуск настраивает модель так, чтобы она совершала все больше и больше этих полезных ментальных движений, все больше и больше превращает ее в сущность, которая планирует и выстраивает стратегии, никогда не сдается и действует напористо.
Существуют и более веские причины ожидать, что продвинутые ИИ-модели будут вести себя так, словно у них есть желания.
Поведение, которое выглядит как проявление настойчивости, сильного желания, напористости, уместнее всего рассматривать не как свойство разума, а как свойство ходов, приводящих к победе.
Deep Blue, Stockfish и гроссмейстеры-люди – все они защищают своих ферзей, хотя воспринимают игру в шахматы совершенно по-разному. Пути различны, но результат один.
Подобные сходства и позволяют делать прогнозы. Так, специалист по информатике в 1975 году мог бы предсказать, что, хотя шахматные ИИ-модели того образца иногда глупо теряли своих ферзей, будущие шахматные модели станут защищать свои фигуры лучше. Когда именно? К какому году? А вот это было бы уже сложно спрогнозировать. Однако проще простого было предсказать, что это точно произойдет к тому времени, когда шахматные модели смогут побеждать гроссмейстеров-людей.
В шахматах в большинстве случаев нельзя поставить мат королю противника, если вы отдали своего ферзя, не получив ничего взамен. По крайней мере, если противник играет хорошо. И неважно, как действуют игроки, биологические они или механические, полны ли они страсти или просто неустанно перебирают миллиарды возможностей. Как правило, выигрышные ходы – это те, в которых ферзя не зевнули. Это факт, относящийся к игре, а не к игроку.
Теперь рассмотрим “игру” по управлению стартапом. В большинстве случаев трудно добиться успеха без привлечения и удержания талантов. Следовательно, если вы генеральный директор, то ваши выигрышные ходы, вероятно, будут нацелены на то, чтобы удержать лучших сотрудников, а не оттолкнуть их. И неважно, какой именно тип разума стоит за подобными действиями, если он решает одну и ту же задачу.
А что насчет таких “игр”, как лечение рака или разработка технологий будущего? Можно вполне уверенно утверждать, что игрок, нацеленный на победу, выберет действия, позволяющие тщательно контролировать ограниченные ресурсы, обходить все возникающие препятствия и прокладывать курс через узкие окна возможностей к умным решениям.
(Кроме того, существуют и более прозаичные причины прогнозировать, что модели
Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.
- 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
- 2. Просьба отказаться от оскорблений, угроз и запугиваний.
- 3. Просьба отказаться от нецензурной лексики.
- 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.
Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.
Оставить комментарий
-
Гость Елена02 август 03:15
Очень понравилось переживала за ГГ, Прямо зацепило, не могла оторваться. ...
Моё сердце в тебе бьётся - Даша Коэн
-
Гость Елена01 август 15:08
Понравилась книга, много смеялась, романтичный сюжет. ...
Бесит в тебе - Ана Сакру
-
Гость Елена01 август 12:02
Небрежное отношение к сюжету - не раскрыта интрига о причастности руководства к предательству, муж героини то Пётр, то Олег....
Лучше меня не найдешь - Елена Левашова
