KnigkinDom.org» » »📕 Главное про AI - Вадим Жартун

Главное про AI - Вадим Жартун

Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!

1 ... 15 16 17 18 19 20 21 22 23 ... 101
Перейти на страницу:

Шрифт:

-
+

Интервал:

-
+

Закладка:

Сделать
перевода — отдельный навык, и все перечисленные бенчмарки англоцентричны и text-only.

6: Разобрать входящий PDF и вытащить сущности — MMLU как прокси на понимание текста и свой оценочный набор, потому что нужна комбинация OCR (распознавания текста с картинки) и рассуждения, и ни один из четырёх не покрывает это напрямую.

Эти шесть пунктов показывают суть: для большинства офисных задач ни один публичный бенчмарк не даёт прямого ответа. Свой набор закрывает разрыв. Только он.

ДОВЕРИЕ К БЕНЧМАРКУ: УСЛОВИЯ И ОГОВОРКИ

Бенчмарк предсказывает ваш результат, если одновременно выполнены четыре условия:

1: Задачи в бенчмарке похожи на ваш случай по структуре — формат, длина контекста, тип ответа — и метрика считает то, что вам важно. Не «доля правильных ответов в тестах с выбором ответа» (MCQ, multiple choice question), а «процент задач, где результат пригоден для отправки клиенту».

2: Тестовый набор чист от контаминации.

3: Бенчмарк ещё не насыщен (разница между лидерами статистически значима, а не «91% против 92%») и регулярно обновляется. Иначе модели учат его наизусть.

4: Метрика измеряет то, что связано с вашей задачей, а не постороннюю способность.

Хотя бы одно условие не выполнено — бенчмарк показывает красивую цифру без всякого отношения к вашему офису.

Четыре признака «мёртвого» бенчмарка.

1: Топ-5 моделей выдают результаты в диапазоне 1–2 процентных пункта — разница не различима за пределами шума.

2: Бенчмарк не обновлялся 2+ года — за это время его вопросы попали в обучающие данные всех крупных моделей.

3: Метрика измеряет то, что не связано с реальной задачей (например, тест с выбором ответа по праву для ассистента, который должен переписываться с клиентом).

4: Публичные результаты расходятся с числами, которые вендор заявляет сам, на 5+ пунктов в одну или другую сторону.

Если вы видите хотя бы два признака из четырёх, бенчмарку доверять нельзя. Ориентиром становится свой оценочный набор.

Что показывает Chatbot Arena, а что — нет. Chatbot Arena (от LMSYS, Lab for Machine Learning and Systems at UC Berkeley — лаборатория Беркли) — самый цитируемый лидерборд по «человеческому рейтингу», где пользователи в слепом сравнении голосуют за ответ А или Б, а рейтинг считается через систему Эло по сумме миллионов диалогов.

Показывает Arena общую «человеческую» привлекательность ответа — тон, структуру, полноту. Не показывает точность в задачах с единственным правильным ответом (арифметика, код, юридические ссылки), устойчивость к граничным случаям (edge case, нестандартным входным данным, на которых модели часто ломаются), устойчивость к попыткам взлома через запрос (jailbreak) и стабильность на длинном контексте.

В 2025 году опубликована работа, показывающая, что рейтинг можно сместить целенаправленным голосованием. Это последний аргумент в пользу собственного оценочного набора: чужие цифры можно исказить, свои — сложнее.

Классы задач, которые не покрывает ни один популярный бенчмарк.

1: Работа с таблицами и числами из вашей корпоративной базы (нужен RAG — поиск ответов модели по вашей базе документов — и свой оценочный набор).

2: Генерация длинных связных документов на 10+ страниц (бенчмарки смотрят на короткие ответы).

3: Следование вашему внутреннему тону голоса бренда и шаблонам (бенчмарки не знают ваш стиль).

4: Соблюдение ваших нормативных ограничений — юридических, отраслевых, внутренних.

5: Многошаговые agent-сценарии, где модель должна планировать, вызывать инструменты и откатываться.

Прежде чем доверять бенчмарку, проверьте семь вещей.

1: Дата сбора датасета и дата обучения модели — пересекаются ли (если да, контаминация почти гарантирована).

2: Тип оценки: multiple choice, генерация, человеческий Эло, LLM-as-a-Judge — разные шкалы нельзя сравнивать напрямую.

3: Размер выборки: 164 задачи (HumanEval) — это статистически хрупко, 8 500 (GSM8K) — плотнее.

4: Метод подсчёта: pass@1, pass@k, accuracy, F1, Brier — не путать.

5: Self-reported против независимого замера: разница в 5+ пунктов — красный флаг.

6: Способ подачи запроса: ввод без примеров, с примерами в самом запросе, с просьбой рассуждать по шагам, с системным запросом или без — меняет результат радикально.

7: Стоимость прогона: на дорогих моделях один прогон может стоить сотни долларов.

Модель, которая отлично сдала MMLU, HumanEval и GSM8K, доказала только одно: она умеет решать задачи этого типа «в вакууме» — короткие, с чётким форматом и эталонным ответом. Это ничего не говорит о том, как она поведёт себя в реальном офисе — с грязными данными, неполным контекстом, прерванным разговором, нечёткой постановкой задачи. Если нанять по результатам единого госэкзамена, можно получить отличника, который не умеет вести переговоры. Высокий балл на бенчмарке — пропуск в следующий тур отбора. Не гарантия работы.

Насыщенный бенчмарк — линейка с делением только до 90 сантиметров. Когда 99% моделей набирают больше 90% на GSM8K, разница между «отличной» и «средней» моделью становится невидимой, как рост человека выше 190 см на линейке, где последнее деление — 90. Линейка не врёт, но она больше не различает. MMLU, HumanEval и GSM8K к 2026 году превратились в инструмент «отсева слабых моделей», а не ранжирования сильных. Для сравнения топ-моделей нужны более длинные линейки — SWE-bench Verified, GPQA Diamond, Humanity’s Last Exam.

СЛЕПЫЕ ЗОНЫ БЕНЧМАРКОВ И ЦЕННОСТЬ СОБСТВЕННЫХ МЕТРИК

Бенчмарки измеряют то, что легко автоматизировать: наличие правильного ответа, скорость работы, объём памяти. Не измеряют то, что в офисной работе критично: тон, стиль, уместность, этические границы, устойчивость к необычному запросу.

Эмили Бендер (Emily M. Bender) с соавторами в работе 2021 года «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?» поставила вопрос жёстко: риски LLM смягчаются, если заранее заложить бюджет на курирование и документацию и не создавать датасеты больше, чем можно качественно поддерживать. Бенчмарки измеряют, насколько хорошо модель имитирует «правильные ответы» в выборке, на которой она обучалась. Это не то же самое, что понимание. Stochastic parrots — термин из этой работы, ставший символом критического взгляда на метрики LLM.

Четыре области, которые остаются за пределами стандартных метрик.

1: Креативность. Способность сгенерировать неожиданный, но релевантный ответ не измеряется ни одним публичным бенчмарком. Модель может набрать 95% на MMLU и выдавать пресные тексты — при обучении её оптимизировали на правдоподобие, а не на оригинальность.

2: Этика. Стремление отказаться от этически сомнительного (по мнению создателей модели) запроса — неизмеримая метрика. Универсального теста на «хорошее поведение» нет. Есть только наборы сценариев, которые вендор сам выбирает.

3: Актуальность знаний. Бенчмарк фиксирует знания на момент сбора датасета. Если модель обучена на данных до 2023 года, она не ответит на вопрос

1 ... 15 16 17 18 19 20 21 22 23 ... 101
Перейти на страницу:
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.

  • 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
  • 2. Просьба отказаться от оскорблений, угроз и запугиваний.
  • 3. Просьба отказаться от нецензурной лексики.
  • 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.

Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.


Партнер

Новые отзывы

  1. Гость Елена Гость Елена05 октябрь 16:41 Скучно, занудно. Еле до конца добралась. Верится с трудом, что молодые парни на заре организации своего бизнеса с такой... Босс, ваше алиби – я - Алекс Скай
  2. Гость Елена Гость Елена05 октябрь 16:28 Сумбур сплошной, сначала сообщается о беременности тройней, затем выясняется о невозможности забеременеть без обряда слияния и... Развод с генералом драконов. Ты не достоин быть отцом тройни - Леона Браун
  3. Гость Наталья Гость Наталья18 сентябрь 10:23 Очень сумбурно, просто поток мыслей и много диалогов, персонажи картонные. Не понравилась книга. ... Не убивай меня больше - Екатерина Николаевна Островская
Все комметарии
Новое в блоге