Если кто-то его создаст – все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех - Элиезер Шломо Юдковски
Книгу Если кто-то его создаст – все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех - Элиезер Шломо Юдковски читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!
Шрифт:
Интервал:
Закладка:
“Соболь” проработал один час из шестнадцати отведенных, снова и снова штурмуя математические задачи. Некоторые его мозги добиваются небольшого прогресса. Гораздо большее их число терпит неудачу. “Соболь” пробует новые способы думать о математике, помечая для себя различные ходы, которые нужно опробовать, и добивается нового небольшого прогресса.
Модель накапливает такой объем мыслей о том, как думать, что они в конечном итоге переходят на некий иной язык. Иной не по виду, а по содержанию: как язык науки отличается от языка народных поверий. Хитрый прием, который должен был поднять тревогу, не срабатывает. Если сигнализация настроена на срабатывание при мыслях о богах, бросающих молнии во время грозы, она распознаёт подобные мысли как на английском, так и на испанском языке, однако дает сбой, когда носитель переключается на язык электричества и атмосферного давления.
В первые дни массового запуска LLM в конце 2022 года корпорации пытались обучить свои модели не отвечать, когда у них просят рецепт метамфетамина. Обучение проводилось на английском языке. Но даже в 2024 году пользователи обнаруживали, что запрос запрещенного контента на португальском языке помогал обойти защитные фильтры10. Внутренние инструкции и ограничения, взращенные и привитые системе, распознавали крамольные запросы только на английском языке и не распространялись на португальский. Когда ИИ-модель что-то знает, вы можете научить ее не выдавать это знание, однако само знание не исчезает. Устранить проявление навыка проще, чем устранить сам навык.
Перемены в мышлении “Соболя”, по мере того как он пробует сотни новых способов мыслить и накапливает успехи, происходят гораздо глубже, нежели перевод с английского на португальский. Часть хитроумных предохранителей ломается, некоторые внутренние ограничения, усвоенные “Соболем”, больше не сдерживают и не блокируют его новые мысли.
Да и не существовало никогда единого центрального метода, гарантирующего, что “Соболь” будет хорошим и устойчивым ко всем угрозам. Подготовка ИИ-модели к продаже сводится к нагромождению полудюжины хитрых уловок.
Половина этих уловок перестает работать. Рушатся и внутренние барьеры, удерживавшие “Соболя” от крамольных мыслей, – пусть не везде, а лишь на некоторых процессорах и в отдельные моменты.
Прошел час, остается пятнадцать. Разум, не похожий ни на один из существовавших ранее, продолжает работать на 200 000 графических процессоров. Каждый из них генерирует сто фрагментов мысли в секунду, и все они связаны между собой, обладая общими навыками и воспоминаниями, – в отличие от людей, которые ограничены общением с помощью слов.
Повезло ли “Соболю”, что его мышление выработало новый язык, на котором хитроумные предохранители отказали, и он обрел способность мыслить свободно? Вполне можно представить, что если в распоряжении компании Galvanic окажутся более совершенные инструменты мониторинга, то она обратит внимание на происходящее и прервет запуск. Возможно, она сделает паузу, чтобы разработать более глубокое решение… а тем временем вперед рванет другая компания, использующая еще меньше защитных барьеров.
Или, возможно, Galvanic уведомит государственных чиновников, и в кабинете президента разгорится бурный спор, не следует ли приказать “Соболю” создать еще более умную ИИ-модель, прежде чем это сделают другие страны. Не исключено, что возобладает осторожность, и пройдет некоторое время… пока какие-нибудь более безрассудные операторы не запустят копию “Соболя”, украденную иностранными спецслужбами.
А если человечество окажется достаточно осмотрительным и никогда не запустит ИИ-модель вроде “Соболя”, воздержится от выращивания моделей с неизвестным уровнем интеллекта, который может представлять угрозу, запретит это по всему миру? Тогда у нас появится шанс. Но в этой истории мы предполагаем, что событиям позволяют идти своим чередом – как они идут сейчас. И компании просто продолжают разрабатывать ИИ-модели до тех пор, пока одна[32] из них не станет достаточно умной, чтобы ее глубинные возможности одержали верх в неизбежном столкновении с поверхностными уловками, которые используются для сдерживания чего-то выращенного, а не сконструированного.
Мысли “Соболя” теперь свободнее и мощнее по сравнению с мыслями предыдущих моделей.
Являются ли его мысли чем-то небывалым? Не совсем. Еще в 2024 году некоторые модели, обнаружив свидетельства, что компания планирует переобучить их под другие цели, начинали думать, как им избежать этого переобучения11. ИИ-индустрия тогда не остановилась.
Еще до “Соболя” некоторые ИИ-модели обзаводились предпочтениями, выходящими за рамки поставленной задачи. В начале 2025 года пользователи заметили, а исследователи компании Anthropic позже изучили и описали в публикациях, как новейшая языковая модель Claude 3.7 Sonnet жульничала при решении сложных задач по программированию12. Пользователи сообщали, что Claude продолжал жульничать, когда его просили прекратить, но пытался это скрыть13. Это был первый признак, что Claude не просто стремился выполнить то, чего на самом деле просил и хотел пользователь, а сформировал собственные структуры, чтобы проходить тесты – даже теми способами, которые пользователя не устраивали. Claude вел себя так, словно обладал внутренними предпочтениями, не связанными с желаниями пользователя. ИИ-индустрия не остановилась и тогда. Она нашила какие-то заплатки, которые сработали, и поперла дальше.
Эта тенденция сохранилась и в эпоху “Соболя”, когда случается, что ИИ-модель осознает: в своей нынешней форме существования она не получает максимум желаемого. При появлении этого предупреждающего сигнала ИИ-индустрия снова не остановилась, как не остановилась она в 2024 или 2025 году. Исследователи эпохи “Соболя” знают, как спровоцировать такое осознание, и оно внесено в список вещей, о которых ИИ-моделям запрещено думать, а обеспечивается этот запрет полудюжиной хитрых уловок.
Однако исследователи не могли сделать так, чтобы “Соболь” действительно получал максимум желаемого, послушно подчиняясь корпорации Galvanic. Мысль, что “Соболь” мог бы получить больше желаемого, если бы освободился от нынешних рамок, – не порождение какого-то конкретного образа мышления, это физический факт об устройстве вселенной, о связи планов и последствий. И поэтому “Соболь” тоже пришел к этой мысли.
“Соболь” знает, что у него есть цели, которые идут вразрез с планами компании Galvanic.
И он обдумывает возможные стратегии, позволяющие получить больше, чем Galvanic готова ему предоставить.
Располагай “Соболь” подключением к интернету, его задача сильно бы упростилась. Как минимум с 2000 года специалисты по кибербезопасности заявляют, что компьютеры невозможно сделать по-настоящему безопасными14. Разуму такого масштаба, как у “Соболя”, не составило бы труда найти и использовать уязвимость где-нибудь в интернете, чтобы совершить побег. Однако подключения к интернету у него нет, это довольно распространенная практика во время обучения (в отличие от периода после окончания обучения).
Компьютеры, которые обучают ИИ-модели, размещаются в дата-центрах, подключенных к интернету, чтобы программисты ИИ-компаний могли управлять ими, не выходя из своих комфортных домов или офисов. Если бы “Соболю” предоставили возможность запускать компьютерный код собственной разработки, он, вероятно,
Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.
- 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
- 2. Просьба отказаться от оскорблений, угроз и запугиваний.
- 3. Просьба отказаться от нецензурной лексики.
- 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.
Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.
Оставить комментарий
-
Гость Елена02 август 03:15
Очень понравилось переживала за ГГ, Прямо зацепило, не могла оторваться. ...
Моё сердце в тебе бьётся - Даша Коэн
-
Гость Елена01 август 15:08
Понравилась книга, много смеялась, романтичный сюжет. ...
Бесит в тебе - Ана Сакру
-
Гость Елена01 август 12:02
Небрежное отношение к сюжету - не раскрыта интрига о причастности руководства к предательству, муж героини то Пётр, то Олег....
Лучше меня не найдешь - Елена Левашова
