KnigkinDom.org» » »📕 Главное про AI - Вадим Жартун

Главное про AI - Вадим Жартун

Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!

1 2 3 ... 101
Перейти на страницу:

Шрифт:

-
+

Интервал:

-
+

Закладка:

Сделать
пример. В предложении «он взял ключ, потому что дверь была закрыта» слово «он» при обученном механизме получает высокий вес связи с тем существительным, к которому относится это местоимение, а «ключ» — с «дверь». RNN утрамбовывала весь смысл в одно скрытое состояние. Трансформер каждый раз заново смотрит на весь контекст.

Операция повторяется не один, а 8–16 раз параллельно с немного разными матрицами. Это называется многоголовым вниманием (по-английски — multi-head attention). Каждая «голова» учится решать свою задачу: одна ловит грамматические связи — какое слово является подлежащим, другая — смысловые: о каком предмете речь, третья — кто к кому относится в длинном предложении. Головы склеиваются — получается вектор, который пойдёт в следующий слой сети. Никакой магии: умножение матриц, выполняемое параллельно на тысячах ядер видеокарты.

ПОЧЕМУ ТРАНСФОРМЕР СТАЛ СТАНДАРТОМ

Трансформер победил не потому, что он единственный возможный, а потому что совпали три свойства, которые инженеры ценят больше красоты решения.

Масштабируемость через железо. Когда загрузка видеокарты поднялась с десятков процентов до почти полной, дальше работала обычная инженерная логика: что работает, то повторяем в большем масштабе. И оказалось: чем больше параметров и данных, тем предсказуемо лучше модель работает. Эту закономерность в 2020 году закрепили в OpenAI, а в 2022-м DeepMind уточнил рецепт (разберём подробно в разделе про то, почему модели появились именно сейчас).

Качество обобщения. Механизм внутреннего внимания работает не только на коротких предложениях, но и на длинных текстах, коде, таблицах — везде, где есть отношение «этот элемент зависит от того».

Универсальность. Один и тот же блок self-attention пригодился не только для текста: его используют для картинок, разбитых на куски, для звука, для белковых последовательностей. Подход не застрял в NLP — он стал общим языком современного AI.

Следующий раздел — о том, что именно модель предсказывает и как из цепочки предсказанных токенов складывается связный ответ.

ИГРА В УГАДЫВАНИЕ ТОКЕНА: ЧЕМ НА САМОМ ДЕЛЕ ЗАНЯТА МОДЕЛЬ

Представьте, что вы печатаете в чате «Премьер-министр Великобритании…». Модель выберет то слово, которое статистически чаще встречалось в похожем контексте в обучающих текстах. «Заявил», «встретился» или «подал в отставку» — не магия и не мышление, а статистика такого объёма, который ни один человек не способен охватить. Что такое токен, разберём в отдельном разделе ниже, пока запомните его как «фрагмент текста, на который модель разбивает входные данные». CSET, Центр безопасности и новых технологий Джорджтаунского университета, формулирует это так: «правильный входной запрос превращает машину для предсказания следующего слова в машину для ответа на вопросы». Именно это и происходит в каждом чате: вы формулируете задачу — модель продолжает текст так, как, по её подсчётам, должно следовать дальше в этом контексте.

Себастьян Рашка (Sebastian Raschka), автор книги «Собрать большую языковую модель с нуля», описывает механизм детальнее. Во время обучения модель обрабатывает последовательность токенов и на каждой позиции выдаёт вектор оценок для всего словаря. Вектор превращается в распределение вероятностей, и модель «штрафуется», когда приписывает низкую вероятность настоящему следующему токену. За миллионы пакетов данных и миллионы документов она учится не правилу «какое слово следующее», а тому, какие продолжения в каком контексте чаще встречаются. Постепенно усваивает синтаксис, смысл, стиль, факты и длинные языковые закономерности. «Выучить язык» в техническом смысле — это не «понять правила», а «выучить, какие слова в каких контекстах идут друг за другом».

Понимает ли модель то, что говорит, или только очень хорошо угадывает следующее слово? Модель не «понимает» намерение пользователя как человек и не знает, какой токен «правильный», — только какой вероятный в её статистике. Пять вещей, которые она не делает «сама по себе», важно знать заранее — иначе вы будете ждать от неё того, чего она не умеет:

1: Не проверяет факты. Модель продолжает текст по статистике, а не исходя из реальности.

2: Не обращается к базам данных без подключённого внешнего инструмента — её «знание о мире» заморожено на дате отсечки обучающего корпуса.

3: Не возвращается назад, чтобы отредактировать уже написанное, — каждый токен добавляется к предыдущим, всё сказанное остаётся как было.

4: Не планирует ответ заранее — она генерирует по одному токену, и каждый следующий токен зависит от уже написанного.

5: Не останавливается «сама по себе» — стоп-сигнал задаётся извне: по лимиту длины, по специальному токену или по команде пользователя.

Почему модель так уверенно врёт и при чём тут отсутствие внутреннего «детектора правды»? Понимание этого пригодится вам каждый раз, когда модель выдаст уверенный, но неправильный ответ. Модель не «забыла», не «ошиблась», не «решила вас обмануть»: она выбрала токен, который статистически подходил лучше всего, и ей было не на что опереться, кроме вероятностей. Уверенный тон — не признак точности. Чем выше вероятность следующего слова в обучающих текстах, тем увереннее модель его произносит.

В 2023 году в США на судебном процессе Mata v. Avianca выяснилось, что юрист Стивен Шварц (Steven Schwartz), использовавший ChatGPT для подготовки иска, подал в суд шесть несуществующих судебных прецедентов и подкрепил их цитатами, которых не было в источниках. Судья оштрафовал его. Этот случай показал то, что статистическая природа делает неизбежным: модель не отличает правду от правдоподобия и на любой запрос выдаст ответ, который звучит правильно, даже если за ним ничего не стоит. Это не баг, который исправят в следующей версии. Это системное свойство всех современных языковых моделей.

С этим утверждением спорят. Джеффри Хинтон (Geoffrey Hinton), лауреат Нобелевской премии 2024 года за работы в области нейросетей (формально — премия по физике, совместно с Джоном Хопфилдом (John Hopfield)), считает иначе: «чтобы точно предсказывать следующее слово, нужно понимать предложение» (оригинал: To predict the next word accurately, you have to understand the sentence). По Хинтону, при достаточном масштабе статистика порождает понимание как попутный эффект, и спор идёт не о том, статистическая ли модель, а о том, считать ли возникающие при масштабе способности пониманием.

Это контраргумент к метафоре «стохастического попугая» — так называют модель, которая воспроизводит услышанное, не понимая смысла; метафору в 2020 году ввели Тимнит Гебру (Timnit Gebru), Эмили Бендер (Emily Bender) вместе с коллегами. Все позиции сходятся в том, что модель статистическая, и разница только в том, считаем ли мы возникающие при масштабе способности пониманием. Спор философский — и не мешает использовать LLM как инструмент.

КОНТЕКСТНОЕ ОКНО: ГРАНИЦЫ И «ПОТЕРЯННАЯ СЕРЕДИНА»

У модели нет памяти в человеческом смысле. Есть контекстное окно — ограниченный «карман», в

1 2 3 ... 101
Перейти на страницу:
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.

  • 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
  • 2. Просьба отказаться от оскорблений, угроз и запугиваний.
  • 3. Просьба отказаться от нецензурной лексики.
  • 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.

Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.


Партнер

Новые отзывы

  1. Гость Наталья Гость Наталья07 сентябрь 16:09 Хорошо. Старое дело, будет раскрыто.Прочитала с удовольствием. Люблю эту серию. ... Забытое дело Калевалы - Анна Князева
  2. Р.Д.У. Р.Д.У.22 август 02:17 ...мне тоже понравился этот русский вестерн. И озвучено неплохо. Советую.... Силантьев Вадим – Засада
  3. Гость Любовь Гость Любовь21 август 20:01 Прочитала залпом.... интересный сюжет, история захватывает, плакала вместе с героями. спасибо автору за интересное... Вернуть жену. Без права на прощение? - Ира Орлова
Все комметарии
Новое в блоге