KnigkinDom.org» » »📕 Главное про AI - Вадим Жартун

Главное про AI - Вадим Жартун

Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!

1 ... 20 21 22 23 24 25 26 27 28 ... 101
Перейти на страницу:

Шрифт:

-
+

Интервал:

-
+

Закладка:

Сделать
региону (region-based routing): если вы в Азии — Qwen-Plus в режиме без рассуждения (non-thinking) за $0,115/$0,688 вместо Claude Haiku 4.5 за $1/$5 для не-критичных задач; с учётом времени отклика (latency) экономия может быть и в деньгах, и во времени.

6: Оптимизация токенов (token optimization): сжимайте системные запросы, удаляйте шаблонный boilerplate (повторяющийся служебный текст), используйте структурированный вывод вместо свободной формы — экономит выходные токены в 2–5 раз.

7: Предварительная фильтрация запросов (pre-filter, по заявлениям вендоров и независимым тестам — лёгкая модель Ministral 3B / Qwen 9B решает 60–80% типовых задач за $0,04/1M, и только сложные 20% уходят в GPT-5.5 / Opus 4.7; средний blended cost падает в 3–5 раз).

РЕЗЮМЕ

Бенчмарк измеряет одну способность, а не работу модели в целом. MMLU, HumanEval, GSM8K — это тесты с эталонным ответом, не прокси для офисной задачи. К 2026 году они стали инструментом отсева слабых, а не ранжирования сильных.

Свой оценочный набор из реальных задач надёжнее публичного рейтинга. Пятьдесят-сто задач, прогнанных через топ-3 модели, дают ответ за день. Для оценки нужны три класса метрик: конвейера, качества ответа, влияния на процесс.

Для русскоязычных задач есть модели с расширенным словарём. Для работы с персональными данными и в критической инфраструктуре — отечественные решения, включённые в реестр. Российские модели сильнее западных в бытовом русском и нормативной базе, уступают в универсальных задачах и экосистеме.

Лидер рейтинга — не лучшая модель для конкретной задачи. Универсального победителя нет, есть лидеры под сценарий. Модель, лидирующая в одном бенчмарке, может проигрывать в другом.

Рынок моделей меняется раз в квартал. Решение о выборе стоит пересматривать регулярно.

Когда модель выбрана и её цифры на вашем оценочном наборе совпали с вашими ожиданиями, остаётся открытым вопрос: на чьих серверах ей работать. У облака и у локального запуска своя экономика, своя регуляторная рамка и свои риски для данных. В 2026 году граница между ними проходит не по тарифу, а по тому, какие документы и персональные данные вы готовы отдать наружу. Следующая глава разберёт эти варианты в деталях — со стоимостью владения, инженерными требованиями и конкретными ситуациями, в которых локальный запуск окупается, а в которых нет.

Глава 5. Облачные или локальные модели

В мае 2026 года команда разработчиков из небольшой российской компании описала на Хабре сюжет, который мне потом приходилось слышать в разных вариациях ещё несколько раз. Их корпоративный AI-ассистент работал на Google Gemini API. Однажды в чат-бот пришло сообщение: «Меня зовут Дмитрий, наша компания ООО Ромашка, телефон +7 903 123-45-67». Сообщение ушло на серверы Google в США — в точности в таком виде.

Персональные данные гражданина России, обработанные за рубежом, без уведомления Роскомнадзора и без отдельного согласия субъекта. Формально — нарушение статьи 12 Федерального закона № 152-ФЗ «О персональных данных». Штрафы по ней начинаются от трёх миллионов рублей.

Справедливости ради: штраф они не заплатили. Обратили внимание раньше проверки и успели перевести ассистента на локальный режим. Но сам сюжет не единичный — он ставит читателя в ту самую точку, где оказывается любой офис, впервые задумавшийся, где физически живёт его языковая модель.

Я начинаю с этой истории, потому что она отвечает на вопрос, который встанет перед читателем после глав 1–4: «окей, я разобрался, что такое LLM (большая языковая модель) и что она умеет, — но на чьём сервере ей работать?». В 2026 году у этого вопроса нет одного ответа. Формула простая: облачные API (программные интерфейсы, через которые приложения общаются с моделью) дают доступ к самым сильным моделям сегодняшнего дня — ценой отправки данных провайдеру на его серверы. Локальный запуск даёт контроль над данными и предсказуемость расходов — ценой железа и инженерного времени. В этой главе я разберу, когда что выбирать, и дам пять рабочих рекомендаций, каждая опирается на факты.

ОБЛАКО ПРОТИВ ЛОКАЛЬНОЙ МОДЕЛИ: ЛОГИКА ВЫБОРА

Когда я спрашиваю знакомых руководителей «почему вы в облаке», самый частый ответ — «потому что так быстрее запустить». Пять минут на получение ключа API — и у вас работает GPT-5, Claude Opus 4.8 или Gemini 3 Pro. Когда спрашиваю «почему вы на локальном запуске», самый частый ответ — «потому что данные не должны уходить из компании». Оба ответа правильные, но оба неполные.

За каждым стоит набор технических, экономических и регуляторных факторов. Разберём их по очереди в следующих четырёх подразделах: скорость локальной модели, выбор инструмента, экономическая точка безубыточности и регуляторная рамка. Четыре угла — один и тот же вопрос, заданный с разных сторон.

ПРОПУСКНАЯ СПОСОБНОСТЬ ПАМЯТИ ВАЖНЕЕ ОБЪЁМА VRAM

Первое и самое важное: скорость локальной модели определяет не объём VRAM (видеопамяти GPU), а пропускная способность памяти. На одной RTX 5090 пропускная способность памяти — 1 792 ГБ/с, на Mac Studio M4 Max — 546 ГБ/с, на Mac mini M4 Pro — 273 ГБ/с. Разница в 3,3 и 6,6 раза — и она решает, сколько токенов в секунду вы получите на одной и той же квантованной модели.

Когда компания покупает железо «под локальную LLM», она покупает не ядра CUDA и не терафлопсы. Она покупает ширину шоссе, по которому веса модели едут к GPU. Bizon Tech (поставщик AI-рабочих станций) формулирует это в начале 2026 года коротко: «Представьте шоссе: объём памяти — это парковка в конце, а пропускная способность — число полос».

Аналогия с шоссе объясняет неожиданный разворот: Mac Studio с 192 ГБ унифицированной памяти тянет Qwen 3.5 235B-A22B в Q4, но выдаёт всего четыре токена в секунду. А RTX 5090 с 32 ГБ на скромной модели 8B выдаёт 50+ токенов в секунду. Почему?

У шоссе с четырьмя полосами (RTX 5090) — высокая пропускная способность при ограниченной ёмкости. У шоссе с двумя полосами и большой парковкой (Mac Studio) — наоборот. Выбор железа — это выбор дистанции, на которую модель поедет с приемлемой скоростью.

СТЕК ИНСТРУМЕНТОВ: OLLAMA, VLLM И LLAMA.CPP

Второе: стек инструментов для запуска локальной модели складывается из трёх архитектурно разных решений, и выбор между ними диктует сценарий нагрузки, а не личные предпочтения.

Ollama — обёртка вокруг llama.cpp, ставится одной командой ollama run llama3.1:8b. vLLM — production-grade решение на Python с PagedAttention, и это позволяет держать в памяти сотни одновременных сессий. На одной H100 vLLM выдаёт 1 450 токенов в секунду при 32 одновременных запросах, Ollama на той же нагрузке

1 ... 20 21 22 23 24 25 26 27 28 ... 101
Перейти на страницу:
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.

  • 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
  • 2. Просьба отказаться от оскорблений, угроз и запугиваний.
  • 3. Просьба отказаться от нецензурной лексики.
  • 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.

Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.


Партнер

Новые отзывы

  1. Гость Наталья Гость Наталья07 сентябрь 16:09 Хорошо. Старое дело, будет раскрыто.Прочитала с удовольствием. Люблю эту серию. ... Забытое дело Калевалы - Анна Князева
  2. Р.Д.У. Р.Д.У.22 август 02:17 ...мне тоже понравился этот русский вестерн. И озвучено неплохо. Советую.... Силантьев Вадим – Засада
  3. Гость Любовь Гость Любовь21 август 20:01 Прочитала залпом.... интересный сюжет, история захватывает, плакала вместе с героями. спасибо автору за интересное... Вернуть жену. Без права на прощение? - Ира Орлова
Все комметарии
Новое в блоге