Главное про AI - Вадим Жартун
Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!
Шрифт:
Интервал:
Закладка:
Русский язык работает в LLM иначе по трём причинам.
1: Другая токенизация: английский текст токенизируется по 4 символа на токен в среднем (BPE-словарь), русский — по 2,5 символа, и это значит, что русский текст обходится в 1,5–2 раза дороже, а в контекстное окно помещается меньше.
2: Качество корпуса: большая часть обучающих данных — английский, китайский, испанский, и русскоязычный корпус меньше, и качество его ниже (больше шума, меньше размеченных данных).
3: Отсутствие специализированного предобучения: большинство моделей обучаются на универсальном корпусе без отдельного этапа «русский язык», и только несколько моделей выделяются — YandexGPT 5.1 Pro, GigaChat 2 Max, Alice AI LLM, Qwen3, DeepSeek.
«Налог на кириллицу» — это бухгалтерия, не метафора. Когда пользователь отправляет в модель английский текст, токенизатор GPT-4o (o200k_base, словарь около 200 000) режет его в среднем на 1,3 токена на слово, а когда тот же пользователь шлёт русский — токенов становится примерно 2,5–3,3 на слово.
Слово «налогоплательщик» в GPT-4 уезжает на 4–5 токенов, в Qwen3 — на 1–2. На маленьком письме разница незаметна. На 50-страничном договоре — десятки тысяч лишних токенов. Один и тот же русскоязычный документ через OpenAI API стоит в 1,5–3 раза дороже, чем его английский перевод. Плюс в контекстное окно GPT-4o 128k на русском помещается примерно 12 000 слов вместо 26 000 на английском — почти в два раза меньше содержания за те же деньги.
Ключевой вывод из этой таблицы: проблема — в словарном запасе модели, не в «русском как таковом». Где кириллических токенов больше 4 000 (GPT-4o), русский стоит в 1,3–1,5 раза дороже английского; где 435 (GPT-4) — в 2,5–3 раза. Расширение словаря — техническая задача, и некоторые провайдеры её решают сознательно. Qwen3 (235B-A22B — MoE) и DeepSeek V3/R1 тренируются на больших многоязычных корпусах, где русский занимает заметную долю, и их словари изначально включают тысячи кириллических токенов, что даёт лучший баланс цена/качество для русского при работе через API или локально. Российские системы (YandexGPT 5.1 Pro, GigaChat 2 Max, Alice AI LLM) оптимизированы под русский «по определению» — обучающий корпус собран преимущественно из русскоязычных источников, тестирование ведётся на MERA и RussianSuperGLUE, плюс они «знают» ГК РФ, НК РФ, ФЗ-152, ГОСТы и региональную специфику.
Три рабочих стратегии для тех, кто устал платить «налог на кириллицу».
1: Сменить модель: для чисто русскоязычных задач взять YandexGPT 5.1 Pro или GigaChat 2 Max, у которых кириллица в словаре изначально. По данным Яндекса, YandexGPT 5.1 Pro превосходит предыдущее поколение в 58% случаев. Яндекс также заявляет превосходство над GPT-4.1 в 56% случаев, но независимого подтверждения этого заявления нет — это маркетинговая цифра, а не измеренная.
2: Взять модель с открытым кодом с большим кириллическим словарём: Qwen3 (235B-A22B) или DeepSeek R1; обе модели можно запустить локально или через API. Стоимость токена в 5–10 раз ниже, чем у западных конкурентов.
3: Дообучить tokenizer: взять открытую модель с крепкой архитектурой и заменить ей словарь на расширенный кириллический. Это сложно, дорого и подходит только для команд, у которых есть свои серверы и data-инженер.
Самая частая ошибка — попытка «просто перевести на английский» перед отправкой в западную модель. Это работает для технических текстов, но не работает для юридических: формулировки на русском — часть юридической силы документа. Перевод договора — это другой договор, а не тот же.
Что меряет и чего не меряет ruMMLU. ruMMLU — это переведённый на русский MMLU, тест на «общую эрудицию» из 57 предметов: от философии и права до клинической медицины. Создатели ruMMLU честно предупреждают, что результаты на русском и английском напрямую несравнимы: тест переводили через GPT-3.5, и в переводе потерялась часть нюансов. Это и есть «налог на кириллицу» на уровне бенчмарка: даже тест, по которому судят о русскоязычных моделях, сделан через западный переводчик. MERA закрывает часть этих дыр: 21 задача, среди которых ruMMLU, ruEthics, SimpleAr (арифметика на русском), CheGeKa (вопросы из «Что? Где? Когда?»), работа с длинным контекстом, код и падежная морфология. GigaChat 2 Max в марте 2025-го на MERA обходит иностранных конкурентов. YandexGPT с Alice AI LLM держатся в лидерах SLAVA-бенчмарка. Всё это доказывает не то, что российские модели «умнее», а то, что для русскоязычной работы у них другая точка отсчёта. И другая тренировочная программа.
РОССИЙСКИЕ МОДЕЛИ НА КАРТЕ РЫНКА
КОММЕРЧЕСКИЕ СЕМЕЙСТВА МОДЕЛЕЙ
GigaChat — семейство моделей Сбера (LLM, большая языковая модель), вышедшее в публичный доступ в 2023 году. К 2026-му оно доросло до линейки GigaChat 2 (Lite, Pro, Max) и нового флагмана GigaChat Ultra. Lite — быстрые ответы на простые вопросы, черновики писем, саммари, чат-боты. Pro — баланс скорости и качества, маркетинговые тексты, инструкции, рерайт. Max — тяжёлые задачи: аналитика, работа с большими документами (контекст 128 000 токенов, это примерно 200 страниц A4), глубокая работа с данными. GigaChat Ultra (по сообщению Сбера от марта 2026) — отдельный класс. Это первый релиз Сбера с режимом рассуждения (Ultra Thinking), где модель показывает цепочку рассуждений, а потом даёт ответ.
По внутренним тестам Сбера на 32 управленческих сценариях (методология не опубликована) режим рассуждения ухудшил результат на 3,3% — с 3,26 до 3,15 балла. Для точных данных и расчётов длинная цепочка рассуждений только мешает. На задачах со множеством факторов (стейкхолдер-анализ, подготовка к переговорам) режим помогает. На «посчитай 4,3% от 17 миллионов» — вредит. Важная деталь: режим рассуждения — не серебряная пуля.
YandexGPT и Alice AI — это разные семейства моделей, и в 2026 году Яндекс их разделяет осознанно. YandexGPT — рабочая лошадка для API, для встраивания в бизнес-процессы, для интеграции в Yandex Cloud AI Studio. Alice AI LLM — ядро для диалоговых и ассистентских сценариев, в первую очередь для Алисы. YandexGPT 5.1 Pro (август 2025): контекст 128 000 токенов (рост с 32 000 в предыдущем поколении), инференс в 2,5 раза быстрее YandexGPT 4 Pro, режим chain-of-reasoning, второе место в SLAVA-бенчмарке после Alice AI LLM. YandexGPT Lite — облегчённые модели для быстрых
Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.
- 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
- 2. Просьба отказаться от оскорблений, угроз и запугиваний.
- 3. Просьба отказаться от нецензурной лексики.
- 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.
Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.
Оставить комментарий
-
Гость Наталья07 сентябрь 16:09
Хорошо. Старое дело, будет раскрыто.Прочитала с удовольствием. Люблю эту серию. ...
Забытое дело Калевалы - Анна Князева
-
Р.Д.У.22 август 02:17
...мне тоже понравился этот русский вестерн. И озвучено неплохо. Советую....
Силантьев Вадим – Засада
-
Гость Любовь21 август 20:01
Прочитала залпом.... интересный сюжет, история захватывает, плакала вместе с героями. спасибо автору за интересное...
Вернуть жену. Без права на прощение? - Ира Орлова
