KnigkinDom.org» » »📕 Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд

Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд

Книгу Рождение разума: Как интеллект зарождается в людях и нейросетях - Джей Макклелланд читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!

1 ... 48 49 50 51 52 53 54 55 56 ... 78
Перейти на страницу:

Шрифт:

-
+

Интервал:

-
+

Закладка:

Сделать
идущие от единственного входного элемента, назначенного для этого слова, к слою нейроноподобных элементов, который служит входом для первого блока трансформера. Эти веса связей настраиваются в процессе обучения для минимизации ошибок предсказания следующего слова. Веса связей, выученные путем коррекции ошибок предсказания следующего слова, также используются для генерации паттернов запросов, ключей и значений на каждом уровне стека трансформеров. Обработка в модулях прямого распространения также опирается на веса связей, выученные через исправление ошибок предсказания. Таким образом, модель использует выученные веса связей для представления контекстно независимых значений слов, их контекстуализации и формирования полезных предсказаний, опираясь на выученные паттерны запросов, ключей и значений.

От предсказания слов к мастерству в сложных задачах

Надеемся, наш рассказ о контекстуализации значений слов и предсказании следующего слова приоткрыл завесу над работой механизма внимания в LLM и прояснил, как они используют информацию из предшествующего контекста для улучшения предсказаний. Однако остается вопрос: что наделяет их способностью вести осмысленный диалог, порой поразительно похожий на разговор между людьми, демонстрировать человеческий уровень выполнения задач, которым их специально не обучали, и становиться все более искусными в таких сложных областях, как решение математических задач и логические рассуждения? Хотя точного ответа не знает никто, полезно рассмотреть следующую идею: чтобы научиться (через исправление ошибок) превосходно предсказывать следующее слово на огромном корпусе текстов, модель вынуждена освоить невероятно широкий спектр задач. Эта простая идея стала ключевым ориентиром для Ильи Суцкевера, которого по праву считают визионером ИИ, стоящим за появлением ChatGPT.

Суцкевер выдвинул гипотезу: если просто обучить модель хорошо предсказывать следующее слово, она неизбежно обретет тот тип универсального интеллекта, который мы приписываем выдающимся мыслителям. Он был убежден, что обучение через исправление ошибок само найдет решение. И действительно, при наличии достаточного объема обучающих данных и достаточно большой нейронной сети эта стратегия в целом оправдала себя.

Научившись качественно предсказывать следующее слово, языковые модели обретают способность опираться на знания о мире и конкретную контекстную информацию для формирования обоснованных выводов. Эти выводы выражаются словами, но несут в себе релевантную фактическую информацию. Рассмотрим пример:

Джону 17 лет, а Биллу 23. Тот, кто по закону пока не может покупать алкоголь, – это _____.

Чтобы дать правильный ответ, нужно знать минимальный возраст для покупки алкоголя и помнить, какое число относится к возрасту Джона, а какое – к возрасту Билла. Раньше считалось, что для отслеживания таких связей требуется специальный механизм и нейронные сети никогда не смогут этому научиться. LLM во многом справились с этой задачей, хотя при слишком большом количестве элементов для запоминания они могут (как и люди!) их путать.

Как же LLM отслеживает соответствие между именами и возрастом, а затем правильно отвечает на вопрос? Полной ясности нет, но исследователи ИИ изучили детали процесса в схожих ситуациях и пришли к выводу, что механизм выглядит примерно так. При обработке фразы «Джону 17» модель помещает паттерн, соответствующий имени Джон, в вектор значения, связанный с числом 17, а паттерн, представляющий само число (возраст человека), – в соответствующий ключ. Этот процесс называют связыванием, поскольку он объединяет атрибуты одного объекта. Такая операция может играть ключевую роль в успехе языковых моделей. Когнитивисты и исследователи из Anthropic – компании, создавшей чат-бота Claude, – полагают, что способность выполнять операции связывания и затем использовать их результаты для извлечения отдаленной информации критически важна для работы больших языковых моделей.

В нашем примере процесс связывания повторяется при чтении «Биллу 23»: паттерн для Билл становится значением, связанным с ключом-паттерном числа 23. Когда модель обрабатывает фразу «Тот, кто слишком молод, чтобы покупать алкоголь, это», она может выдать правильный ответ, сформировав запрос на поиск человека младше 21 года. Этот запрос совпадает с ключом для 17, и в результате возвращается значение Джон.

Если задуматься, становится очевидно, что каждый из описанных шагов в процессе вывода имени Джон, вероятно, опирается на механизм внимания на основе запросов. Например, запрос от 17 для поиска соответствующего имени был бы одним из этапов копирования паттерна Джон в вектор значения, связанный с возрастом 17. Поистине удивительно, что все эти операции внимания, включая возникновение связывания, и все паттерны, которые они переносят из одного места в другое, формируются исключительно через настройку весов связей для минимизации ошибок предсказания следующего слова.

Похож ли наш мозг на большие языковые модели?

LLM построены как нейронные сети, но насколько они похожи на нейросетевые модели человеческого мозга? В частности, схоже ли их «мышление» с процессами, которые происходят в нашем мозге? На наш взгляд, мыслительные процессы в LLM в чем-то напоминают человеческие, а в чем-то отличаются.

Начнем с ключевых сходств. Как мы показывали на протяжении всей книги, мышление человека возникает из опыта и опирается на активацию простых вычислительных элементов, связи между этими элементами (сила которых меняется в процессе обучения) и распределенные представления. LLM используют те же базовые принципы. Подобно тому как человеческая мысль возникает как эмерджентное свойство распределенного интерактивного процесса активации в биологической нейронной сети, возможности LLM являются эмерджентным следствием аналогичного процесса в искусственной нейронной сети.

Способности этих моделей выполнять широкий спектр задач эмерджентны в том смысле, что возникают исключительно в результате настройки связей для повышения точности единственной задачи – предсказания следующего слова. При всей простоте и механистичности этого процесса он позволяет моделям реагировать на языковые запросы поразительно человечным образом. Они справляются с множеством задач без специального программирования для каждой из них, часто достигают уровня человеческих когнитивных способностей или превосходят его и демонстрируют характерные для людей успехи и промахи (подробнее об этом в главе 10).

Так что да, «мышление» LLM действительно имеет важные общие черты с человеческим мышлением.

Это наблюдение влечет за собой важные выводы. Оно ставит под сомнение устоявшееся представление о том, что человеческий мозг нуждается в особом, специализированном механизме – некоторые называли его механизмом символьной обработки – для обеспечения наших высших когнитивных способностей. Вместо этого стоит рассмотреть возможность того, что для возникновения продвинутых когнитивных способностей решающее значение имеет сочетание обширного опыта и масштаба – при наличии правильной универсальной архитектуры.

И действительно, по мере увеличения масштаба языковых моделей – с ростом числа блоков трансформеров, количества весов связей в каждом блоке и размера контекстных окон для сохранения предшествующего контекста – они все эффективнее используют растущие объемы обучающих данных и становятся все более искусными. При этом начинают проявляться способности, которых не было при меньших масштабах.

На рисунке 8.3 представлена типичная закономерность, которую демонстрируют модели ИИ при решении различных задач. В таких областях, как арифметика, восстановление слов из перемешанных букв, правильные ответы

1 ... 48 49 50 51 52 53 54 55 56 ... 78
Перейти на страницу:
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.

  • 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
  • 2. Просьба отказаться от оскорблений, угроз и запугиваний.
  • 3. Просьба отказаться от нецензурной лексики.
  • 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.

Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.


Партнер

Новые отзывы

  1. Гость Елена Гость Елена02 август 03:15 Очень понравилось переживала за ГГ, Прямо зацепило, не могла оторваться. ... Моё сердце в тебе бьётся - Даша Коэн
  2. Гость Елена Гость Елена01 август 15:08 Понравилась книга, много смеялась, романтичный сюжет. ... Бесит в тебе - Ана Сакру
  3. Гость Елена Гость Елена01 август 12:02 Небрежное отношение к сюжету - не раскрыта интрига о причастности руководства к предательству, муж героини то Пётр, то Олег.... Лучше меня не найдешь - Елена Левашова
Все комметарии
Новое в блоге