Главное про AI - Вадим Жартун
Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!
Шрифт:
Интервал:
Закладка:
Парадокс стоков в 2026 году: цены упали, выбор вырос, лицензии упростились, а AI-генерация в ряде сценариев обходится дороже, чем покупка готового кадра. Unsplash, Pexels, Pixabay по-прежнему дают бесплатные изображения под permissive-лицензией. Shutterstock, Adobe Stock, Getty Images продают премиум-контент от $5 до $50 за кадр, с прозрачной коммерческой лицензией. AI-генерация стоит $0.01–0.12 за картинку, плюс время человека на промпт, отбор и доводку результата.
Дальше срабатывает простая арифметика. Задача «нужна одна хорошая иллюстрация к статье» — почти всегда за стоком: вы получаете лицензию сразу, без промпт-инжиниринга и без правового риска. Задача «нужна серия из пятидесяти кадров в едином стиле с возможностью быстрой перегенерации» — за генерацией: пятьдесят кадров по десять долларов в стоке — это пятьсот, плюс переписка с дизайнером про единство стиля. AI-генерация обходится в $0.05 за кадр, плюс день работы дизайнера с LoRA — и выходит дешевле.
Разовая картинка — сток. Серия в стиле — генерация. Спорный объект (лицо конкретного человека, логотип) — всегда сток или профессиональная съёмка.
КОНСИСТЕНТНОСТЬ ПЕРСОНАЖЕЙ НА СЕРИИ ИЗОБРАЖЕНИЙ
«Один и тот же персонаж на десяти картинках» — открытая задача 2026 года. Готового решения нет. Есть три техники, у каждой свои ограничения, и пять приёмов, которые работают в продакшне.
Именно на этом держится второй миф этой главы: «Консистентность персонажей решена». Она не решена. Тот, кто заходит в проект с этим ожиданием, на четвёртой-пятой картинке серии получает размытые лица и вынужден пересобирать пайплайн с нуля.
LoRA (Low-Rank Adaptation) — дообучение модели на тридцати–пятидесяти изображениях одного персонажа. Модель учит «это конкретное лицо» как отдельный токен в словаре. Качество высокое (90+ процентов совпадения), но требуется графический процессор (GPU) и два-четыре часа на обучение, и работает это только с моделями с открытыми весами (Stable Diffusion 3.5, FLUX 2). LoRA — единственная техника, которая даёт устойчивый результат на серии из двадцати и более изображений.
IP-Adapter (Image Prompt Adapter) — модель берёт референсное изображение и переносит его «суть» в новые генерации. Дообучения не нужно, но совпадение ниже (60–70 процентов), и работает это в рамках одной сессии или в пайплайне с фиксированным seed. IP-Adapter — рабочий инструмент для коротких серий из трёх–пяти изображений.
Character Reference (Midjourney V8, GPT Image 2) — встроенная функция сервиса, которая принимает референс и генерирует новое изображение «в том же персонаже». Самая простая в использовании (одна кнопка), но наименее контролируемая: модель сама решает, что именно сохранять — лицо, одежду, позу, — и результат может «плыть» на длинных сериях.
Почему задача остаётся открытой? Модели обучены на парах «текст — картинка», а не на трёхмерном представлении объекта. При смене ракурса лицо перестраивается. Одежда и аксессуары «плывут»: серёжки, родинки, шрамы — модель игнорирует детали, которые человек помнит. Стиль референса не переносится чисто: реалистичный референс плюс промпт «аниме» даёт лицо, которое сохранится плохо.
Пять приёмов работы с серией в продакшне:
1: Фиксировать стартовое число (seed) при генерации. Одно стартовое число, один промпт, разные позы — лицо сохраняется в 80 процентах случаев вместо 50 без фиксации. Приём работает только в пайплайнах с открытым кодом (ComfyUI, Automatic1111).
2: Обучать LoRA на своём наборе (см. выше раздел про техники). Лучший баланс между качеством и стоимостью для серии от двадцати кадров.
3: Использовать IP-Adapter для коротких серий. До пяти изображений IP-Adapter держит персонажа на 70 процентов, дальше деградирует.
4: Генерировать в одном сервисе с фиксированными настройками. Смена сервиса (Midjourney → FLUX) ломает лицо, даже если промпт тот же. Для серии из десяти и более картинок выбирайте один сервис и придерживайтесь его.
5: Ретушировать в Photoshop или GIMP. Когда восемь из десяти изображений «почти» одинаковые, ручная доводка двух проблемных — дешевле, чем перегенерация всей серии. Для коммерческой работы ручная ретушь — стандарт.
Что работает для стилистической серии и что — для повторяющегося героя, это разные задачи с разными инструментами. Стилистическая серия строится через ControlNet плюс промпт-anchor, повторяющийся герой — через LoRA, брендовый стиль — через Recraft V4.1.
РАСПОЗНАВАНИЕ И СИНТЕЗ РЕЧИ: ДВА ПОЛЮСА ГОЛОСОВОГО AI
РАСПОЗНАВАНИЕ РЕЧИ: ОТ ЗВУКА К ТЕКСТУ
(Все цифры WER ниже — доля неверно распознанных слов: чем меньше, тем лучше.)
Распознавание речи в 2026 году — решённая задача для русского и английского на чистой записи. Whisper Large-v3 (OpenAI, ноябрь 2023, открытая модель) показывает Word Error Rate (WER, доля неверно распознанных слов) 2.1–2.7 процента на чистом английском аудио и 7–10 процентов на чистом русском. Дообученная на русском версия (whisper-large-v3-russian) снижает WER до 6.4 процента — улучшение примерно на 35 процентов относительно базовой модели.
GigaAM-v3 (Сбер, открытый код в ноябре 2025) — фундаментальная модель на архитектуре Conformer, двести двадцать–двести сорок миллионов параметров, предобученная на больших объёмах русской речи. По заявлению Сбера, GigaAM превосходит Whisper на русском, и это не маркетинг: модель обучена на русскоязычных данных, что даёт ей преимущество в распознавании редукции гласных, русской просодии и имён собственных. Лицензия MIT, запуск — локально или через API SaluteSpeech.
Если вам нужно расшифровать встречу в московском офисе, GigaAM-v3 — лучший выбор, чем Whisper: точнее на русских именах, устойчивее к разговорной речи, и аудио не уходит за рубеж. Silero — компактная модель для устройств на краю сети (edge-устройств), четыре-семь процентов WER на русском, работает на центральном процессоре (CPU). Vosk — старая, но всё ещё рабочая альтернатива для офлайн-распознавания.
Для шумной записи (кафе, улица, конференц-зал) WER вырастает до пятнадцати–двадцати пяти процентов — об этом подробнее в блоке «Где AI в речи не работает» ниже.
СИНТЕЗ РЕЧИ: ОТ ТЕКСТА К ГОЛОСУ
Синтез речи в 2026 году — почти решённая задача для типовых сценариев. ElevenLabs v3 (июнь 2025, коммерческий сервис) даёт «живую» речь с эмоциями, паузами, интонациями, и отличить её от речи живого человека можно только в специальных тестах. Сервис поддерживает семьдесят с лишним языков, аудиотеги (теги звука: шёпот, смех, паузы, эмоции) и режим диалога. На русском языке качество ElevenLabs заметно ниже, чем на английском: произношение бывает с «иностранным» акцентом, ударения иногда сбиваются.
Для русского в 2026 году локальные решения выигрывают: Yandex SpeechKit Brand Voice
Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.
- 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
- 2. Просьба отказаться от оскорблений, угроз и запугиваний.
- 3. Просьба отказаться от нецензурной лексики.
- 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.
Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.
Оставить комментарий
-
Гость Наталья07 сентябрь 16:09
Хорошо. Старое дело, будет раскрыто.Прочитала с удовольствием. Люблю эту серию. ...
Забытое дело Калевалы - Анна Князева
-
Р.Д.У.22 август 02:17
...мне тоже понравился этот русский вестерн. И озвучено неплохо. Советую....
Силантьев Вадим – Засада
-
Гость Любовь21 август 20:01
Прочитала залпом.... интересный сюжет, история захватывает, плакала вместе с героями. спасибо автору за интересное...
Вернуть жену. Без права на прощение? - Ира Орлова
