KnigkinDom.org» » »📕 Главное про AI - Вадим Жартун

Главное про AI - Вадим Жартун

Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!

1 ... 19 20 21 22 23 24 25 26 27 ... 101
Перейти на страницу:

Шрифт:

-
+

Интервал:

-
+

Закладка:

Сделать
TTFT и TPS — типичная ошибка. Модель с TTFT 0,5 с и TPS 30 t/s — «отвечает быстро, но медленно пишет». Она подходит для коротких ответов в чате. Модель с TTFT 2 с и TPS 200 t/s — «долго думает, зато строчит». Она подходит для генерации больших документов. Выбор между ними — выбор сценария, и здесь встроена ловушка: «быстрая модель = лучшая модель». Скорость и качество — два разных измерения. Для бизнеса критично понимать, когда важно первое, когда второе, и как они упираются в цену.

Что реально тормозит. Скорость ответа складывается из трёх фаз. Prefill — модель «читает» промпт и строит KV-cache (кэш ключ-значение, структура в памяти GPU — графического процессора, на котором считаются нейросети), и это параллелизуемая фаза: на GPU она занимает десятки-сотни миллисекунд для коротких промптов и секунды для длинных (100K+ токенов). Decode — модель генерирует ответ по одному токену, последовательно, и это узкое место: каждый токен зависит от предыдущего, параллелизация ограничена. Post-processing — сериализация, передача по сети, рендеринг.

Длина промпта решает всё. По данным NVIDIA, TTFT растёт почти линейно с длиной префилла. Для промпта в 100 000 токенов даже быстрые модели показывают 1,5–3 секунды TTFT против 0,3 с для промпта в 1 000 токенов. Для длинного контекста (анализ длинного договора, разбор большого отчёта) это становится узким местом. Пользователь ждёт не ответа, а «загрузки».

Пакетная обработка и интерактив — разные модели поведения.

Пакетная обработка — это когда компания вечером ставит 100 000 договоров в очередь и к утру получает саммари. Здесь TPS и цена решают всё, а TTFT неважна (пользователь не ждёт у экрана). Лучший выбор — дешёвая модель с высоким TPS: Gemini 2.0 Flash, Nova Micro, Gemma 3 27B. Рассуждающие модели (Claude Opus 4.x, GPT-5.5) сюда не подходят: они и медленнее, и дороже, и часто «передумывают» то, что в простой задаче не требует рассуждений.

Интерактив — это когда оператор в банке общается с клиентом и AI помогает подсказывать ответы. Здесь TTFT решает всё, а TPS и цена второстепенны (запросов немного, платит компания, а не клиент). Лучший выбор — модель с TTFT ниже 0,5 с: Nova Micro, Gemini 2.0 Flash, маленькие локальные модели на своём железе. Рассуждающие модели снова мимо: 1,5 секунды тишины в живом диалоге — провал.

Гибрид — это когда есть и пакетная, и интерактивная нагрузка. Типовое решение — бытовая интерактивная модель на каждый день, тяжёлая рассуждающая модель для «ночных» задач. YandexGPT 5.1 Pro закрывает оба сценария (быстрый для интерактива через Lite, мощный для пакетной аналитики через Pro с chain-of-reasoning), и GigaChat — аналогично (Lite для чат-ботов, Max для больших документов, Ultra Thinking для задач со множеством факторов).

Как токенизация русского удлиняет и удорожает каждый сценарий. Русский текст режется на больше токенов, чем английский. Для одной и той же задачи «саммари 50-страничного договора» русский запрос содержит 60 000–80 000 токенов вместо 30 000–40 000 для английского. Время обработки и цена растут пропорционально объёму. Если TTFT на 100K-промптах и так 2–3 секунды, то для русского она становится 3–5 секунд. На конкретных цифрах: GigaChat 2 Max — 0,65 токенов на слово, контекст 128 000; для русского договора в 200 страниц (около 80 000 слов) — 52 000 токенов, умещается в окно с запасом, TTFT умеренный. T-pro 2.0 — 0,45 токенов на слово, тот же договор уходит в 36 000 токенов, окно почти не напрягается. GPT-4o — 2,0–2,5 токенов на русское слово, тот же договор занимает 160 000–200 000 токенов, не влезает в 128K, нужно либо резать, либо брать модель с большим контекстом (400K у GPT-5.5 или 1M у Gemini 3.1 Pro). Для пакетной обработки разница в токенизации 0,45 против 2,5 — это разница в 5,5 раза по стоимости инференса. На 100 000 договоров в месяц это миллионы рублей.

Цена — скрытая ось выбора. Цена API у LLM устроена сложнее, чем кажется по заголовку «$5 / $25».

1: Вход и выход: по тарифам Anthropic, OpenAI и Google выход обычно в 3–6 раз дороже входа, потому что генерация токенов нагружает GPU сильнее, чем чтение контекста.

2: Кэшированный вход (со скидкой 10% от цены входа) и продление кэша (в 1,25× или 2× от цены входа, в зависимости от TTL — времени жизни кэша в часах): если в проекте идёт многократная переработка одного и того же системного запроса, кэш окупается за 1–2 чтения.

3: Пакетное и отложенное API со скидкой 50%: ответ приходит в течение 24 часов, не годится для работы в реальном времени.

4: Доплата за длинный контекст: OpenAI ввёл двойную цену для запросов больше 200K токенов, Google применяет 2× на вход и 1,5× на выход.

Называть просто «Claude Opus 4.7 стоит $5/$25» — это как говорить «бензин стоит 65 рублей», не уточняя, что на заправке премиум-95 плюс 12 рублей за литр. Конкретная цифра здесь — для примера, она устаревает каждый квартал. Важно в ней только то, что она иллюстрирует разрыв между «заголовком» и «реальностью». Для расчёта реальной стоимости используйте средневзвешенную цену = (входные токены × цена входа + выходные токены × цена выхода) / общее число токенов. Скрытая статья расхода, которую не видно в рекламной цене (так называемая headline-цена — цена «с витрины», без учёта реального потребления), — стоимость перепроверки человеком: обычно 30–60% от времени оператора (по отраслевым наблюдениям). Без её замера экономика проекта не сходится.

Семь способов уменьшить счёт за счёт правильной работы с API.

1: Кэширование запросов (prompt caching, по тарифу Anthropic — попадание в кэш даёт скидку 10% от базовой цены входа; стандартный сценарий с системным запросом на 4 тысячи токенов и перепиской на 50 тысяч токенов (K = тысяча, англ. thousand) даёт 80% попаданий и экономию в 4× на входе).

2: Пакетное API (batch API, по условиям OpenAI, Anthropic, xAI и Google — 50% скидка при готовности ждать до 24 часов; подходит для ETL (пакетной загрузки и преобразования данных) и RAG-индексации).

3: Маршрутизация (routing, OpenRouter и Martian автоматически направляют запросы на самую дешёвую модель, способную решить задачу, экономия до 80% в смешанных нагрузках).

4: Квантизация (сжатие модели за счёт снижения точности весов) и дистилляция (обучение компактной модели на ответах большой) — DeepSeek-R1-distill-Qwen-32B стоит в 4–5 раз дешевле полного R1 на управляемом инференсе (запуск модели на арендованном железе) при приемлемом качестве.

5: Маршрутизация по

1 ... 19 20 21 22 23 24 25 26 27 ... 101
Перейти на страницу:
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.

  • 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
  • 2. Просьба отказаться от оскорблений, угроз и запугиваний.
  • 3. Просьба отказаться от нецензурной лексики.
  • 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.

Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.


Партнер

Новые отзывы

  1. Гость Наталья Гость Наталья07 сентябрь 16:09 Хорошо. Старое дело, будет раскрыто.Прочитала с удовольствием. Люблю эту серию. ... Забытое дело Калевалы - Анна Князева
  2. Р.Д.У. Р.Д.У.22 август 02:17 ...мне тоже понравился этот русский вестерн. И озвучено неплохо. Советую.... Силантьев Вадим – Засада
  3. Гость Любовь Гость Любовь21 август 20:01 Прочитала залпом.... интересный сюжет, история захватывает, плакала вместе с героями. спасибо автору за интересное... Вернуть жену. Без права на прощение? - Ира Орлова
Все комметарии
Новое в блоге