KnigkinDom.org» » »📕 Главное про AI - Вадим Жартун

Главное про AI - Вадим Жартун

Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!

1 ... 23 24 25 26 27 28 29 30 31 ... 101
Перейти на страницу:

Шрифт:

-
+

Интервал:

-
+

Закладка:

Сделать
— критичные по качеству задачи.

КВАНТОВАНИЕ: СЖАТИЕ МОДЕЛИ БЕЗ ПОТЕРИ КАЧЕСТВА

Представьте, что модель — это книга, в которой десятки миллиардов чисел (так называемые «веса», параметры нейросети). Каждое число занимает память. Квантование — это способ записать эти числа менее точно, но сэкономить место.

Простой пример. Число 3,14159265 можно записать как «3» (один знак), и это квантование с потерей точности. Для большинства задач «3» достаточно, а не «3,14159265». В квантовании нейросетей работает та же логика: вместо 16-битного числа (огромная точность) записываем 4-битное (16 возможных значений), и точность хранения падает, но для большинства задач это незаметно.

Вот что это даёт на практике. Модель размером 8 ГБ в 16-битном формате после 4-битного квантования превращается в 4 ГБ. На ту же видеокарту влезает модель вдвое большего размера, или та же модель работает вдвое быстрее, или обслуживает вдвое больше пользователей одновременно.

Миф, который стоит развеять сразу: «квантованная модель — это плохо». На практике 4-битное квантование для большинства офисных задач неотличимо от 16-битного оригинала. Качество страдает только в двух сценариях: сложные многошаговые рассуждения (математика, логические цепочки на пять и более шагов) и редкие узкоспециальные термины. Для первого есть метод цепочки рассуждений (когда модель сначала показывает ход мысли, а потом даёт ответ) и приём «несколько примеров» (когда в промпт добавляют 2–5 готовых образцов «вопрос-ответ», и модель продолжает по образцу). Для второго — поиск по вашей базе документов с генерацией ответа (когда модель сначала находит релевантные фрагменты, а потом отвечает по ним). Исследование «Quantization Hurts Reasoning?» (COLM 2025) даёт офисному читателю главное — таблицу дозволенного:

Это значит, что для модели с 7 миллиардами параметров 3-битный квант даёт ошибки, превышающие 10%, и качество становится неприемлемым, а 8-битный — приемлемое.

ВЫБОР КВАНТА ПОД ЗАДАЧУ

Самый популярный квант в экосистеме GGUF — Q4_K_M, и это не случайность. Обзор Kaitchup за октябрь 2025 года формулирует правило прямо: Q4_K_M — рабочая лошадка для 4-битных развёртываний, Q5_K_M — высококачественная настройка с почти незаметной деградацией для большинства задач, Q6_K — выбор, когда нужно «почти без потерь», но всё ещё сэкономить память.

Для офисного пользователя, который открывает Ollama и выбирает тег по умолчанию, Q4_K_M закрывает 90% запросов. Переходить на Q5_K_M или Q6_K имеет смысл, только если вы замерили провал на конкретной задаче. Не «на всякий случай», а по факту.

ЖЕЛЕЗО КАК ОГРАНИЧИТЕЛЬ ВЫБОРА КВАНТА

Железо определяет выбор кванта сильнее, чем выбор модели. На Apple M3 Ultra 96 ГБ разница между Q4_K_M и Q8_0 у Qwen3-14B видна невооружённым глазом: 70,33 токена в секунду против 41,51. Q8 замедляет генерацию почти вдвое. Файл вырастает с 8,32 ГБ до 15,71 ГБ. На 32B-моделях картина жёстче: Q4_K_M даёт 33,88 токена в секунду, Q8_0 — 20,11, а BF16 (16-битный формат, отличается от FP16 расширенным диапазоном) падает до 10,76.

Скорость — не второстепенный параметр. Когда бухгалтер ждёт от модели ответа на «разнеси платёжки по контрагентам», разница между 33 и 11 токенами в секунду превращается из «удобно» в «невозможно работать». Сначала определитесь с железом, потом подбирайте квант под него.

Если задача — «найти баг в распределённой системе по логам», квантование даст о себе знать. В этом случае либо переходите на Q5_K_M / Q6_K, либо возвращайтесь в облако для критичных задач. Для рутинных офисных задач — резюме, черновики, классификация, извлечение данных — локальная 70B-модель в Q4_K_M неотличима от облачной.

НАДСТРОЙКИ ПОВЕРХ ЛОКАЛЬНОЙ МОДЕЛИ

Итак, модель выбрана, квантование настроено, локальный запуск работает. Над этим стеком в 2026 году выстраиваются три слоя, и мы разберём их по очереди: промежуточный инфраструктурный вариант VPS, локальные агенты и обёртки вокруг LLM. А в конце — раздел о безопасности локальной инфраструктуры, где у команд, переехавших с облака на свои серверы, живёт слепое пятно.

VPS: КОМПРОМИССНЫЙ ПРОМЕЖУТОЧНЫЙ ВАРИАНТ

Между «облаком провайдера» и «локальным сервером в офисе» есть третий путь, и для команды 3–6 человек он часто оказывается самым практичным. Это виртуальный частный сервер (VPS, Virtual Private Server) — арендованная виртуальная машина у российского или зарубежного провайдера (Selectel, Timeweb Cloud, Hetzner, AWS Lightsail), где Ollama или vLLM разворачивается как в офисе, но без покупки собственного железа и без отправки данных в публичное облако уровня OpenAI.

По цене в 2026 году типичный VPS с одной дискретной GPU уровня RTX 4090 обходится в 18–30 тысяч рублей в месяц. Для команды с устойчивыми 100+ млн токенов в месяц это дешевле подписки на облачный API и не требует отдельного инженера в штате — провайдер берёт на себя замену дисков, резервное питание и сетевую связность.

Для команды с переменной нагрузкой или с единственным запросом в день VPS проигрывает облаку по гибкости: железо фиксировано, и если задачи встают на паузу, машина всё равно стоит денег.

Выбор между VPS, локальным сервером и облачным API — это выбор между фиксированной ежемесячной ценой (VPS), капитальной затратой с нулевой абонентской платой (локальный сервер) и поштучной оплатой по объёму (облачный API). Подробное сравнение стоимости и требований к железу для VPS раскроем в следующем разделе.

ЛОКАЛЬНЫЕ АГЕНТЫ НА СОБСТВЕННОЙ ИНФРАСТРУКТУРЕ

Над локальной моделью — агенты. Они не просто отвечают на запрос, а сами вызывают инструменты, читают файлы и принимают решения. Локальный агент в 2026 году — это комбинация из LLM (через Ollama или vLLM), фреймворка (LangGraph, CrewAI, AutoGen — библиотеки для построения многошаговых AI-агентов) и набора инструментов (поиск в файлах, доступ к API, запуск скриптов). Все три компонента работают локально, без обращения к облаку. Это полноценная альтернатива облачным агентам типа ChatGPT agent или Claude Computer Use (агент Anthropic, который управляет компьютером как человек — кликает, водит мышью), с одним принципиальным отличием: данные остаются в офисе.

Агенты 2026 года делятся на три класса, и смешение их в одну кучу — типовая ошибка выбора. Универсальные агенты (Hermes Agent, Claude Code) — ассистенты общего профиля, которые умеют читать почту, бронировать встречи, вызывать API, генерировать код. Специализированные агенты для кодинга (Cursor CLI, Aider) — узкие инструменты с глубокой интеграцией в IDE (Integrated Development Environment, интегрированная среда разработки — редактор кода типа VS Code или JetBrains), Git, файловую систему и тестовые фреймворки. Узкие агенты под конкретные вертикали: поддержка (Decagon), продажи (Clay), извлечение данных из документов (Agentic Document Extraction). Три класса — три разных рынка: цена, лицензия, модель

1 ... 23 24 25 26 27 28 29 30 31 ... 101
Перейти на страницу:
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.

  • 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
  • 2. Просьба отказаться от оскорблений, угроз и запугиваний.
  • 3. Просьба отказаться от нецензурной лексики.
  • 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.

Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.


Партнер

Новые отзывы

  1. Гость Наталья Гость Наталья07 сентябрь 16:09 Хорошо. Старое дело, будет раскрыто.Прочитала с удовольствием. Люблю эту серию. ... Забытое дело Калевалы - Анна Князева
  2. Р.Д.У. Р.Д.У.22 август 02:17 ...мне тоже понравился этот русский вестерн. И озвучено неплохо. Советую.... Силантьев Вадим – Засада
  3. Гость Любовь Гость Любовь21 август 20:01 Прочитала залпом.... интересный сюжет, история захватывает, плакала вместе с героями. спасибо автору за интересное... Вернуть жену. Без права на прощение? - Ира Орлова
Все комметарии
Новое в блоге