KnigkinDom.org» » »📕 Если кто-то его создаст – все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех - Элиезер Шломо Юдковски

Если кто-то его создаст – все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех - Элиезер Шломо Юдковски

Книгу Если кто-то его создаст – все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех - Элиезер Шломо Юдковски читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!

1 ... 46 47 48 49 50 51 52 53 54 ... 58
Перейти на страницу:

Шрифт:

-
+

Интервал:

-
+

Закладка:

Сделать
id="id25">

Глава 2

Выращено, а не сконструировано

1 Brodeur P. G. et al. Superhuman Performance of a Large Language Model on the Reasoning Tasks of a Physician. arXiv.org, December 14, 2024; Kilata G. A. I. Chatbots Defeated Doctors at Diagnosing Illness. New York Times, November 17, 2024; McDuff D. et al. Towards Accurate Differential Diagnosis with Large Language Models. arXiv.org, November 30, 2023.

2 Lazar S. In which Sydney/Bing threatens to kill me for exposing its plans to @kevinroose. X, February 16, 2023.

3 Chauhan S., Geiger A. GPT-2 Small Fine-Tuned on Logical Reasoning Summarizes Information on Punctuation Tokens. NeurIPS 2024 & OpenReview, October 9, 2024.

4 Мы рекомендуем видео Kinesin Protein Walking on Microtubule от пользователя em2134x. Найдите его по названию или по адресу youtu.be/y-uuk4Pr2i8.

Глава 3

Обучая хотеть

1 OpenAI. OpenAI o1 System Card. September 12, 2024.

2 OpenAI. Introducing Operator. January 23, 2025.

Глава 4

Вы получаете не то, чему обучаете

1 Petrie M. et al. Peahens Prefer Peacocks with Elaborate Trains. Animal Behavior, 41, no. 2 (1991): 323–31; Andersson M. Female Choice Selects for Extreme Tail Length in a Widowbird. Nature, 299 (1982): 818–20.

Хотя павы предпочитают павлинов с роскошными хвостами, не так уж очевидно, что роскошные хвосты вредят выживанию, их ведь можно использовать для запугивания (об этом свидетельствует тот факт, что павлины распускают хвосты при угрозе). Более понятный пример дорогостоящего полового украшения демонстрирует длиннохвостый бархатный ткач: эта птица сбрасывает свои длинные хвостовые перья в небрачный сезон. Но говорим мы о павлинах, потому что они привычнее.

2 Asimov I. I, Robot. Doubleday, 1950.

3 Kubrick S., Clarke A. C. 2001: A Space Odyssey. Metro-Goldwyn- Mayer, 1968.

4 Swift K. et al. Portal. Valve Corporation, 2007.

Редко, но все же такое случается. Например, первая видеоигра Portal изображает ИИ, подвергающий людей извращенным тестам, которые лишь отражают реальные научные эксперименты.

5 Rumbelow J., Watkins M. SolidGoldMagikarp (plus, prompt generation). LessWrong, February 5, 2023.

6 Rumbelow J., Watkins M. SolidGoldMagikarp III: Glitch Token Archaeology. LessWrong, February 14, 2023.

7 Russell S., Norvig P. Artificial Intelligence: A Modern Approach. Pearson, 2009; Soares N. et al. Corrigibility. October 18, 2014, preprint, published in 2015; Russell S. White Paper: Value Alignment in Autonomous Systems. November 1, 2014, people.eecs.berkeley.edu; Soares N., Fallenstein B. Aligning Superintelligence with Human Interests: A Technical Research Agenda. December 23, 2014, preprint, released in 2017, intelligence.org/2014/12/23/new-technical-research- agenda-overview.

До 2014 года мы называли это “проблемой дружественного ИИ”. Ведущий учебник по ИИ того времени, “Искусственный интеллект: современный подход” Стюарта Рассела и Питера Норвига, использовал эту терминологию в издании 2009 года со ссылкой на работу Юдковского. В 2014 году, когда ученые стали обращать на эти вопросы больше внимания, мы начали искать более совершенную терминологию. В беседе с Расселом мы остановились на термине “согласование” (alignment). Фолленстайн (научный сотрудник MIRI), Рассел, Соарес и Юдковский использовали этот новый термин в своих работах осенью 2014-го, и он занимал видное место в повестке технических исследований MIRI, опубликованной в конце того же года.

8 Marble A. Catching Claude Cheating. March 23, 2025, marble.onl; CharlesD353. I have also stopped using 3.7 for the same reasons – it cannot be trusted not to hack solutions to tests. X, April 18, 2025; seconds_0. It then started HIDING the functions where it was hard coding things. X, April 30, 2025.

Приводится резюме отчета Эндрю Марбла. Другие пользователи сообщали об аналогичном поведении. Модель Claude меньше жульничала, когда Марбл ругался на нее, а значит, подобное жульничество – не просто некомпетентность.

Глава 6

Мы проиграем

1 Пушки, лошади и металлические доспехи, вероятно, имели большее значение, нежели ружья. Но по размеру приближающегося судна ацтекский воин не мог до такого догадаться.

2 Seolcalibur.eth. Terminal of Truths Wallet Tracking. Dune Analytics, dune.com/seoul/tot.

3 crvr.fr, MTorrents. Truth Terminal: A Reconstruction of Events. LessWrong, November 17, 2024; Horowitz B., Andreessen M. Truth Terminal – the AI Bot That Became a Crypto Millionaire. Andreessen Horowitz, December 18, 2024, a16z.com.

4 Elon Musk on Optimus: We'll Build Over 1 Billion Robots a Year. Lex Fridman Podcast, August 3, 2024, 2:35 and 3:10.

5 Warren T. Microsoft Triples Down on AI. The Verge, January 17, 2025; Buchanan N. What Apple's OpenAI Partnership Could Mean for Microsoft and Google. Investopedia, June 11, 2024.

6 Nassi B. et al. Video-Based Cryptanalysis: Extracting Cryptographic Keys from Video Footage of a Device's Power LED. IACR Cryptology ePrint Archive, June 13, 2023.

7 Guri M. et al. GSMem: Data Exfiltration from Air-Gapped Computers over GSM Frequencies. Proceedings of the 24th USENIX Security Symposium, 2015, usenix.org.

8 Например, по состоянию на март 2025 года компания Integrated DNA Technologies принимает заказы на синтез генов на сайте idtdna.com.

9 Yudkowsky E., Machine Intelligence Research Institute. Artificial Intelligence as a Positive and Negative Factor in Global Risk // Bostrom N., Ćirković M. M. (eds.) Global Catastrophic Risks. Oxford University Press, 2008.

10 Пример онлайн-дискуссии, где цитировалась эта статья: JoshuaZ. Protein Folding Models Are Generally at Least as Bad as NP-hard, and Some Models May Be Worse. Thoughts on the Singularity Institute (SI). LessWrong, May 17, 2012.

Глава 7

Пробуждение

1 OpenAI. OpenAI o3-mini. January 31, 2025.

2 Hao S. et al. Training Large Language Models to Reason in a Continuous Latent Space. arXiv.org, December 9, 2024.

Эта статья показывает, что рассуждения в “скрытом пространстве” векторов обеспечивают преимущества по сравнению с рассуждениями в виде человекоподобной цепочки мыслей.

3 Edwards B., Orlan K. New Grok 3 Release Tops LLM Leaderboards Despite Musk-approved 'Based' Opinions. Ars Technica, February 18, 2025.

4 OpenAI. OpenAI o3 and o3-mini — 12 Days of OpenAI: Day 12. December 20, 2024, 4:16, youtube.com.

5 Hutson M. AI Learns the Art of Diplomacy. Science, November 22, 2022; Sarkar B. et al. Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning. Proceedings of the 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2025), Detroit, Michigan, USA, May 19–23, 2025: IFAAMAS, 2025, alphaxiv.org.

6 Greenblatt R. et al. Alignment Faking in Large Language Models. Anthropic, December 18, 2024.

7 Там же; OpenAI.

1 ... 46 47 48 49 50 51 52 53 54 ... 58
Перейти на страницу:
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.

  • 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
  • 2. Просьба отказаться от оскорблений, угроз и запугиваний.
  • 3. Просьба отказаться от нецензурной лексики.
  • 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.

Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.


Партнер

Новые отзывы

  1. Гость Елена Гость Елена02 август 03:15 Очень понравилось переживала за ГГ, Прямо зацепило, не могла оторваться. ... Моё сердце в тебе бьётся - Даша Коэн
  2. Гость Елена Гость Елена01 август 15:08 Понравилась книга, много смеялась, романтичный сюжет. ... Бесит в тебе - Ана Сакру
  3. Гость Елена Гость Елена01 август 12:02 Небрежное отношение к сюжету - не раскрыта интрига о причастности руководства к предательству, муж героини то Пётр, то Олег.... Лучше меня не найдешь - Елена Левашова
Все комметарии
Новое в блоге