KnigkinDom.org» » »📕 Главное про AI - Вадим Жартун

Главное про AI - Вадим Жартун

Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!

1 ... 17 18 19 20 21 22 23 24 25 ... 101
Перейти на страницу:

Шрифт:

-
+

Интервал:

-
+

Закладка:

Сделать
экономику кириллицы в конкретных моделях 2026 года, про стратегии против переплаты и про то, как читать русскоязычные бенчмарки. Эта часть опирается на те же термины: токен (смысловой фрагмент слова, на которые модель «режет» текст перед обработкой), словарь модели (набор всех токенов, которые она знает), BPE (алгоритм разбиения слов на части, Byte Pair Encoding), и предполагает, что они понятны.

Русский язык работает в LLM иначе по трём причинам.

1: Другая токенизация: английский текст токенизируется по 4 символа на токен в среднем (BPE-словарь), русский — по 2,5 символа, и это значит, что русский текст обходится в 1,5–2 раза дороже, а в контекстное окно помещается меньше.

2: Качество корпуса: большая часть обучающих данных — английский, китайский, испанский, и русскоязычный корпус меньше, и качество его ниже (больше шума, меньше размеченных данных).

3: Отсутствие специализированного предобучения: большинство моделей обучаются на универсальном корпусе без отдельного этапа «русский язык», и только несколько моделей выделяются — YandexGPT 5.1 Pro, GigaChat 2 Max, Alice AI LLM, Qwen3, DeepSeek.

«Налог на кириллицу» — это бухгалтерия, не метафора. Когда пользователь отправляет в модель английский текст, токенизатор GPT-4o (o200k_base, словарь около 200 000) режет его в среднем на 1,3 токена на слово, а когда тот же пользователь шлёт русский — токенов становится примерно 2,5–3,3 на слово.

Слово «налогоплательщик» в GPT-4 уезжает на 4–5 токенов, в Qwen3 — на 1–2. На маленьком письме разница незаметна. На 50-страничном договоре — десятки тысяч лишних токенов. Один и тот же русскоязычный документ через OpenAI API стоит в 1,5–3 раза дороже, чем его английский перевод. Плюс в контекстное окно GPT-4o 128k на русском помещается примерно 12 000 слов вместо 26 000 на английском — почти в два раза меньше содержания за те же деньги.

Ключевой вывод из этой таблицы: проблема — в словарном запасе модели, не в «русском как таковом». Где кириллических токенов больше 4 000 (GPT-4o), русский стоит в 1,3–1,5 раза дороже английского; где 435 (GPT-4) — в 2,5–3 раза. Расширение словаря — техническая задача, и некоторые провайдеры её решают сознательно. Qwen3 (235B-A22B — MoE) и DeepSeek V3/R1 тренируются на больших многоязычных корпусах, где русский занимает заметную долю, и их словари изначально включают тысячи кириллических токенов, что даёт лучший баланс цена/качество для русского при работе через API или локально. Российские системы (YandexGPT 5.1 Pro, GigaChat 2 Max, Alice AI LLM) оптимизированы под русский «по определению» — обучающий корпус собран преимущественно из русскоязычных источников, тестирование ведётся на MERA и RussianSuperGLUE, плюс они «знают» ГК РФ, НК РФ, ФЗ-152, ГОСТы и региональную специфику.

Три рабочих стратегии для тех, кто устал платить «налог на кириллицу».

1: Сменить модель: для чисто русскоязычных задач взять YandexGPT 5.1 Pro или GigaChat 2 Max, у которых кириллица в словаре изначально. По данным Яндекса, YandexGPT 5.1 Pro превосходит предыдущее поколение в 58% случаев. Яндекс также заявляет превосходство над GPT-4.1 в 56% случаев, но независимого подтверждения этого заявления нет — это маркетинговая цифра, а не измеренная.

2: Взять модель с открытым кодом с большим кириллическим словарём: Qwen3 (235B-A22B) или DeepSeek R1; обе модели можно запустить локально или через API. Стоимость токена в 5–10 раз ниже, чем у западных конкурентов.

3: Дообучить tokenizer: взять открытую модель с крепкой архитектурой и заменить ей словарь на расширенный кириллический. Это сложно, дорого и подходит только для команд, у которых есть свои серверы и data-инженер.

Самая частая ошибка — попытка «просто перевести на английский» перед отправкой в западную модель. Это работает для технических текстов, но не работает для юридических: формулировки на русском — часть юридической силы документа. Перевод договора — это другой договор, а не тот же.

Что меряет и чего не меряет ruMMLU. ruMMLU — это переведённый на русский MMLU, тест на «общую эрудицию» из 57 предметов: от философии и права до клинической медицины. Создатели ruMMLU честно предупреждают, что результаты на русском и английском напрямую несравнимы: тест переводили через GPT-3.5, и в переводе потерялась часть нюансов. Это и есть «налог на кириллицу» на уровне бенчмарка: даже тест, по которому судят о русскоязычных моделях, сделан через западный переводчик. MERA закрывает часть этих дыр: 21 задача, среди которых ruMMLU, ruEthics, SimpleAr (арифметика на русском), CheGeKa (вопросы из «Что? Где? Когда?»), работа с длинным контекстом, код и падежная морфология. GigaChat 2 Max в марте 2025-го на MERA обходит иностранных конкурентов. YandexGPT с Alice AI LLM держатся в лидерах SLAVA-бенчмарка. Всё это доказывает не то, что российские модели «умнее», а то, что для русскоязычной работы у них другая точка отсчёта. И другая тренировочная программа.

РОССИЙСКИЕ МОДЕЛИ НА КАРТЕ РЫНКА

КОММЕРЧЕСКИЕ СЕМЕЙСТВА МОДЕЛЕЙ

GigaChat — семейство моделей Сбера (LLM, большая языковая модель), вышедшее в публичный доступ в 2023 году. К 2026-му оно доросло до линейки GigaChat 2 (Lite, Pro, Max) и нового флагмана GigaChat Ultra. Lite — быстрые ответы на простые вопросы, черновики писем, саммари, чат-боты. Pro — баланс скорости и качества, маркетинговые тексты, инструкции, рерайт. Max — тяжёлые задачи: аналитика, работа с большими документами (контекст 128 000 токенов, это примерно 200 страниц A4), глубокая работа с данными. GigaChat Ultra (по сообщению Сбера от марта 2026) — отдельный класс. Это первый релиз Сбера с режимом рассуждения (Ultra Thinking), где модель показывает цепочку рассуждений, а потом даёт ответ.

По внутренним тестам Сбера на 32 управленческих сценариях (методология не опубликована) режим рассуждения ухудшил результат на 3,3% — с 3,26 до 3,15 балла. Для точных данных и расчётов длинная цепочка рассуждений только мешает. На задачах со множеством факторов (стейкхолдер-анализ, подготовка к переговорам) режим помогает. На «посчитай 4,3% от 17 миллионов» — вредит. Важная деталь: режим рассуждения — не серебряная пуля.

YandexGPT и Alice AI — это разные семейства моделей, и в 2026 году Яндекс их разделяет осознанно. YandexGPT — рабочая лошадка для API, для встраивания в бизнес-процессы, для интеграции в Yandex Cloud AI Studio. Alice AI LLM — ядро для диалоговых и ассистентских сценариев, в первую очередь для Алисы. YandexGPT 5.1 Pro (август 2025): контекст 128 000 токенов (рост с 32 000 в предыдущем поколении), инференс в 2,5 раза быстрее YandexGPT 4 Pro, режим chain-of-reasoning, второе место в SLAVA-бенчмарке после Alice AI LLM. YandexGPT Lite — облегчённые модели для быстрых

1 ... 17 18 19 20 21 22 23 24 25 ... 101
Перейти на страницу:
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.

  • 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
  • 2. Просьба отказаться от оскорблений, угроз и запугиваний.
  • 3. Просьба отказаться от нецензурной лексики.
  • 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.

Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.


Партнер

Новые отзывы

  1. Гость Наталья Гость Наталья07 сентябрь 16:09 Хорошо. Старое дело, будет раскрыто.Прочитала с удовольствием. Люблю эту серию. ... Забытое дело Калевалы - Анна Князева
  2. Р.Д.У. Р.Д.У.22 август 02:17 ...мне тоже понравился этот русский вестерн. И озвучено неплохо. Советую.... Силантьев Вадим – Засада
  3. Гость Любовь Гость Любовь21 август 20:01 Прочитала залпом.... интересный сюжет, история захватывает, плакала вместе с героями. спасибо автору за интересное... Вернуть жену. Без права на прощение? - Ира Орлова
Все комметарии
Новое в блоге