KnigkinDom.org» » »📕 Главное про AI - Вадим Жартун

Главное про AI - Вадим Жартун

Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!

1 2 3 ... 101
Перейти на страницу:

Шрифт:

-
+

Интервал:

-
+

Закладка:

Сделать
отдельно, и для редких слов просто не хватит места. Токенизатор нарезает текст на кусочки промежуточного размера: целые слова, если они частые, и куски слов, если слово редкое или длинное.

У токенизатора есть фиксированный словарь — набор кусочков, которые он умеет распознавать. Словарь составляется один раз, на этапе обучения, и в нём столько русских кусочков, сколько их было в обучающих текстах. По данным OpenAI (GPT-3.5/4 tokenizer release notes), у GPT-3.5 и GPT-4 словарь — около ста тысяч кусочков, из них кириллических меньше пятисот. У GPT-4o словарь расширили до двухсот тысяч, и кириллических стало около четырёх с половиной тысяч — в десять раз больше (по анонсу OpenAI 2024 года). В OpenAI осознали проблему и вложились в неё деньгами, но и четыре с половиной тысячи на двухсоттысячный словарь — это всё ещё два процента, а не половина.

Чтобы почувствовать разницу на цифрах, возьмём простую фразу «Я встретил огромную собаку» и её английский перевод «I met a huge dog». Английский вариант превращается примерно в 5–6 токенов, русский — в 12–14. У моделей с латинским алфавитом в словаре больше целых английских слов, и они реже режут текст на части; у кириллических слов словарь беднее, и токенизатор рубит слово на куски. Точные цифры зависят от модели, но порядок сохраняется у большинства современных LLM.

Что это означает для офисного работника на практике:

1: Скорость ответа падает. Модель генерирует токены последовательно, и чем их больше, тем дольше идёт ответ.

2: Качество падает на сложной лексике. Юридические, медицинские и финансовые термины русского языка часто режутся на нерегулярные куски, и модель хуже «понимает», что перед ней.

Вопросы цены и размера окна для русского текста мы разобрали в предыдущем разделе, поэтому здесь остановимся только на этих двух следствиях.

Зачем нужны модели с поддержкой кириллицы на уровне токенизатора и что это даёт на практике?

GigaChat, YandexGPT, Qwen, DeepSeek появились с одной и той же мыслью: словарь нужно наполнить кусками тех языков, на которых модели будут работать, и не наполнять его кусками тех, на которых не будут. Для русскоязычной задачи кириллическая модель часто оказывается дешевле и быстрее западной, и это не «преимущество российской инженерии», а математический факт: у неё больше кириллических токенов в словаре, и она меньше тратит их на одну и ту же фразу. К 2026 году выбор стал конкретнее: YandexGPT 5 Pro встроен в Алису и закрывает офисные задачи на русском в формате подписки — платите фиксированно, без отдельной оплаты за токены, GigaChat 2 Max доступен в варианте локальной установки (on-prem, на серверах компании) под ФЗ-152 (Федеральный закон «О персональных данных»), а Llama 4 (выпущенная в апреле 2025 года) русского в списке языков дообучения не содержит — и для русскоязычной задачи это явный сигнал смотреть в сторону кириллических моделей. Миф «кириллица работает хуже, потому что модель обучена на английском» — неверен: проблема в токенизации, не в качестве обучения, и решается она не переходом на западную, которая выглядит «лучше» в маркетинговых таблицах, а выбором кириллической модели с собственным словарём.

АВТОРЕГРЕССИЯ, ДИФФУЗИЯ, ГИБРИДЫ: ТРИ СЕМЕЙСТВА МОДЕЛЕЙ

Внутри категории «большая языковая модель» работают три семейства, и по названию сервиса уже можно прикинуть, чего от него ждать. Для офисного текстового чата вам нужны авторегрессивные модели — GPT, Claude, Gemini, GigaChat и YandexGPT; остальные два семейства для чистого текста почти не используются.

Чтобы сравнить три семейства бок о бок, соберём ключевые признаки в таблицу.

Таблица показывает разницу в скорости и задачах: авторегрессия — секунды-минуты для текста, диффузия — минуты для картинки и часы для видео, гибрид — зависит от того, какую часть задействуете. Для чисто текстовой работы гибрид избыточен и часто медленнее, а диффузионная модель для текста в 2026 году всё ещё экзотика.

Авторегрессия объясняет три вещи, которые вы видите каждый день в чате:

1: Потоковый вывод. Ответ появляется токен за токеном, и вы видите, как модель «печатает» в реальном времени.

2: Невозможность «отмотать назад». Модель не может вернуться к началу ответа и поправить его — каждый токен добавляется к предыдущим.

3: Цепочка рассуждений (chain-of-thought). На длинных задачах модель использует «думание вслух» — каждый шаг рассуждения опирается на предыдущий.

Диффузионные модели решают принципиально другую задачу. Они не «пишут» текст или картинку, а учатся убирать шум из хаоса. Это та же механика, по которой проявляется фотография в тёмной комнате: берётся поле случайных пикселей, и за двадцать-тридцать аккуратных проходов из шума «проступает» изображение. Диффузия плохо работала с текстом до 2025 года, но почти все генераторы картинок — Midjourney, DALL-E 3, Stable Diffusion 3, Kandinsky 5.0 — это диффузионные модели. В 2025 году появились первые коммерческие диффузионные LLM — Mercury от Inception Labs (калифорнийский стартап, специализирующийся на диффузионных языковых моделях), которые выдают текст в 5–10 раз быстрее авторегрессии. Для офисного работника в 2026 году это всё ещё экзотика, а не рабочий инструмент. Полезно знать о них не ради выбора, а ради того, чтобы понимать, почему картинки в чате рисуются почти мгновенно, а текст — посимвольно: у них физически разная архитектура.

Гибридные (мультимодальные) модели — для офисного работника это самый заметный сдвиг последних двух лет. GPT-4o, Gemini 2.x, Claude 4, Llama 4 — все они в одном и том же окне принимают и выдают текст, картинки, аудио и видео. Архитектурно это «склейка»: авторегрессионная часть генерирует токены изображения, диффузионный декодер превращает их в пиксели. Для офисного работника теперь не нужно формулировать «запрос для художника» отдельно, можно просто продолжить разговор. Когда сервис принимает картинку в сообщении и описывает, что на ней, — это распознавание картинки на входе (по-английски — vision-in). Когда сервис рисует картинку прямо в чате без отдельного сервиса — это генерация картинки на выходе (по-английски — image-out), и это почти всегда гибрид.

По названию сервиса можно прикинуть, к какому типу он относится: текстовый чат с рассуждениями — авторегрессия, генератор картинок — диффузия, «всё в одном» — гибрид. Для смешанных задач (объяснить схему, перевести вывеску, сделать презентацию) гибрид единственный, кто работает без склеек.

Имея в голове эти три семейства, посмотрим, почему они вообще появились и смогли развиться до рабочих инструментов за последние годы.

ПОЧЕМУ ВСЁ ЭТО СЛУЧИЛОСЬ ИМЕННО СЕЙЧАС

Современная языковая модель — не одно изобретение и не одно озарение, а совпадение

1 2 3 ... 101
Перейти на страницу:
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.

  • 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
  • 2. Просьба отказаться от оскорблений, угроз и запугиваний.
  • 3. Просьба отказаться от нецензурной лексики.
  • 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.

Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.


Партнер

Новые отзывы

  1. Гость Наталья Гость Наталья07 сентябрь 16:09 Хорошо. Старое дело, будет раскрыто.Прочитала с удовольствием. Люблю эту серию. ... Забытое дело Калевалы - Анна Князева
  2. Р.Д.У. Р.Д.У.22 август 02:17 ...мне тоже понравился этот русский вестерн. И озвучено неплохо. Советую.... Силантьев Вадим – Засада
  3. Гость Любовь Гость Любовь21 август 20:01 Прочитала залпом.... интересный сюжет, история захватывает, плакала вместе с героями. спасибо автору за интересное... Вернуть жену. Без права на прощение? - Ира Орлова
Все комметарии
Новое в блоге