Главное про AI - Вадим Жартун
Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!
Шрифт:
Интервал:
Закладка:
4: Устойчивость к инъекции промптов. Способность модели не поддаться на манипуляцию в тексте запроса — отдельный класс проверок. Результаты сильно зависят от того, какие именно инъекции проверялись.
Цифра в бенчмарке — статичная. Ваша задача меняется каждый квартал, и разрыв между цифрой и реальностью растёт. Бенчмарк не отличает «модель облажалась в безвредном месте» от «модель облажалась в критичном для бизнеса месте». Оба раза это минус один процент к accuracy.
Я рекомендую компаниям собрать свой оценочный набор из 50–100 реальных задач — тех, которые они решают каждый день. Шаблонные письма, отчёты, первичный анализ контрагентов, классификация входящих запросов. На этом наборе прогоняются 3–5 отобранных моделей, и сравнивается не абстрактная «точность», а процент задач, где результат пригоден для отправки клиенту или руководителю. День-два работы одного человека экономят месяцы разочарований и десятки тысяч рублей на ненужной подписке.
Что измерять в AI-решении, чтобы понимать, работает ли оно. Три класса метрик:
1: Метрики конвейера — скорость, стоимость, процент ошибок инфраструктуры (модель не отвечает, таймаут, сбой). Это метрики работы системы как таковой, без оценки качества ответа.
2: Метрики качества ответа — точность на своём оценочном наборе, процент пригодных для отправки, экспертная оценка по 5-балльной шкале. Это метрики того, насколько результат применим в реальной работе.
3: Метрики влияния на процесс — время выполнения задачи до и после AI, NPS (индекс лояльности клиентов, Net Promoter Score), процент переделанных результатов. Это метрики того, улучшает ли AI реальный результат, а не только оценку.
Без измерений внедрение AI превращается в веру. Менеджер объявляет «мы внедряем AI», но не определяет, как он узнает, что внедрение работает. Через несколько месяцев нет данных — только ощущение, что «что-то работает». Через полгода компания платит за AI-сервис десятки тысяч долларов в месяц и не может ответить на вопрос «а что мы за это получили». Через год проект закрывают или масштабируют. Оба решения одинаково безответственны.
Кейс Klarna — учебник по провалу измерений. Разбор был в предыдущей главе, здесь зафиксируем только то, что относится к теме главы: компания оптимизировала то, что легко измерить, и не измеряла то, что важно для бизнеса. По материалу Fortune (2024), бот был «ограниченным» — не плохим, просто ограниченным метриками.
Кейс Shopify — другой урок. По материалу Slator о мемо генерального директора (CEO) Shopify Тобиаса Лютке (Tobias Lütke) от апреля 2025: «An internal memo published by Shopify CEO Tobias Lütke mandates AI use throughout the company; the app has already sped up translation 100x» — в переводе: «внутреннее мемо CEO Shopify Тобиаса Лютке предписывает использовать AI во всей компании; приложение уже ускорило перевод в 100 раз». Shopify измерила эффект: переводы ускорились в 100 раз — конкретная метрика. Мемо «сначала докажи, что AI не может» — управленческое решение, основанное на данных, а не декларация. Бенчмарки таких данных не дают. Но и не мешают их собирать.
СВОДНАЯ ТАБЛИЦА МОДЕЛЕЙ: ИНСТРУКЦИЯ ПО ЧТЕНИЮ
Сводная таблица моделей — это попытка уместить десятки параметров в один экран. Искушение выбрать модель по одной цифре («Intelligence Index» — сводный индекс «интеллекта» от Artificial Analysis) сильно. Именно на нём держится маркетинг лидербордов. Под одной цифрой скрывается десяток разных метрик, и у каждой модели свой профиль: одна лучше в рассуждении, другая — в коде, третья — в диалоге на естественном языке, четвёртая — в работе с длинным контекстом. Универсального победителя нет. Кто говорит обратное — продаёт.
При чтении порядок такой.
1: Первая колонка — не «MMLU», а «цена и контекст», потому что если модель не влезает в ваш бюджет или в ваш документ, дальше можно не смотреть.
2: Вторая — задача: что вы реально будете делать (код, рассуждение, перевод).
3: Третья — точность на релевантном бенчмарке.
4: Четвёртая — бенчмарк на нужном языке (русский отдельно от английского).
5: Пятая — скорость и формат API (программного интерфейса, через который ваше приложение отправляет запросы модели).
Принцип простой. Смотрите не на «общую оценку», а на параметр под ваш аппетит, задачу и бюджет.
Очередной миф: «OpenAI / Claude / Gemini лучше всех остальных». Зависит от задачи и языка. Для русского, для агентских задач, для маленьких моделей на локальной машине — лидер другой, и миф поддерживается маркетингом западных лабораторий и игнорированием китайских и российских альтернатив.
OpenAI и Anthropic конкурируют в зоне топовых рассуждающих моделей (reasoning-моделей, моделей с пошаговым рассуждением) с длинным контекстом. Google делает ставку на мультимодальность (текст, картинки, видео, аудио в одной модели). DeepSeek, Qwen — китайские open-weight альтернативы (модели с открытыми весами — можно скачать и запустить у себя), активно догоняющие западные аналоги по бенчмаркам при цене в 5–10 раз ниже. Mistral — европейский open-source (с открытым исходным кодом) с акцентом на развёртывание на своих серверах (on-premise — на своей инфраструктуре) и защиту данных (privacy — приватность). Это не чёрно-белое «хорошие против плохих», а разные ниши с разной экономикой.
Короткий срез лидеров на 1 мая 2026 — в таблице ниже. Среди open-weight в 2026 году отдельная лига: DeepSeek V4 Preview (архитектура MoE — смесь экспертов: 1,6 триллиона параметров всего, 49 миллиардов активны на каждом запросе) и Llama 4 Scout с заявленным контекстом 10M токенов, Qwen 3.5 Medium (35B-A3B) — GPT-5-mini-класс за долю стоимости. Разрыв между «топом» и «средним» в абсолютных цифрах меньше, чем кажется: на Artificial Analysis Intelligence Index даже «лучшая модель мира» набирает 61, а не 100, и разница между первым и пятым местом — это 3–5 процентных пунктов. «Топ-1» в этой реальности — переходящий кубок: в каждой номинации свой обладатель.
Какая модель лучше для русскоязычных задач в 2026 году? Прямого ответа нет, и любой, кто его даёт, — продаёт. Сравнивать нужно на своём оценочном наборе. Это единственный честный способ.
Топ-1 в рейтинге — победитель марафона, не лучший бегун для вашего забега. Если победитель марафона бежит 42 км за 2:10, это не значит, что он выиграет спринт на 100 метров у вашего офисного курьера. Модель, топовая на SWE-bench Verified (сложный код), может быть средней в маркетинговых текстах. Модель, лидирующая в HumanEval (короткий код), может проигрывать в многошаговом агенте.
КИРИЛЛИЦА И ТОКЕНИЗАЦИЯ: СТРАТЕГИИ ПРОТИВ ПЕРЕПЛАТЫ
Токенизация разобрана в первой главе. Здесь — про
Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.
- 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
- 2. Просьба отказаться от оскорблений, угроз и запугиваний.
- 3. Просьба отказаться от нецензурной лексики.
- 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.
Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.
Оставить комментарий
-
Гость Наталья07 сентябрь 16:09
Хорошо. Старое дело, будет раскрыто.Прочитала с удовольствием. Люблю эту серию. ...
Забытое дело Калевалы - Анна Князева
-
Р.Д.У.22 август 02:17
...мне тоже понравился этот русский вестерн. И озвучено неплохо. Советую....
Силантьев Вадим – Засада
-
Гость Любовь21 август 20:01
Прочитала залпом.... интересный сюжет, история захватывает, плакала вместе с героями. спасибо автору за интересное...
Вернуть жену. Без права на прощение? - Ира Орлова
