KnigkinDom.org» » »📕 Главное про AI - Вадим Жартун

Главное про AI - Вадим Жартун

Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!

1 ... 51 52 53 54 55 56 57 58 59 ... 101
Перейти на страницу:

Шрифт:

-
+

Интервал:

-
+

Закладка:

Сделать
освещения, настроек. В России Гражданский кодекс (статья 1229, 1259) защищает произведения, «созданные творческим трудом автора», и устойчивой судебной практики по AI-картинкам пока нет. Практический вывод, если вы публикуете в блоге московской компании: держитесь американской линии «человек принимает решения, AI генерирует» и фиксируйте, что именно решал человек.

Парадокс стоков в 2026 году: цены упали, выбор вырос, лицензии упростились, а AI-генерация в ряде сценариев обходится дороже, чем покупка готового кадра. Unsplash, Pexels, Pixabay по-прежнему дают бесплатные изображения под permissive-лицензией. Shutterstock, Adobe Stock, Getty Images продают премиум-контент от $5 до $50 за кадр, с прозрачной коммерческой лицензией. AI-генерация стоит $0.01–0.12 за картинку, плюс время человека на промпт, отбор и доводку результата.

Дальше срабатывает простая арифметика. Задача «нужна одна хорошая иллюстрация к статье» — почти всегда за стоком: вы получаете лицензию сразу, без промпт-инжиниринга и без правового риска. Задача «нужна серия из пятидесяти кадров в едином стиле с возможностью быстрой перегенерации» — за генерацией: пятьдесят кадров по десять долларов в стоке — это пятьсот, плюс переписка с дизайнером про единство стиля. AI-генерация обходится в $0.05 за кадр, плюс день работы дизайнера с LoRA — и выходит дешевле.

Разовая картинка — сток. Серия в стиле — генерация. Спорный объект (лицо конкретного человека, логотип) — всегда сток или профессиональная съёмка.

КОНСИСТЕНТНОСТЬ ПЕРСОНАЖЕЙ НА СЕРИИ ИЗОБРАЖЕНИЙ

«Один и тот же персонаж на десяти картинках» — открытая задача 2026 года. Готового решения нет. Есть три техники, у каждой свои ограничения, и пять приёмов, которые работают в продакшне.

Именно на этом держится второй миф этой главы: «Консистентность персонажей решена». Она не решена. Тот, кто заходит в проект с этим ожиданием, на четвёртой-пятой картинке серии получает размытые лица и вынужден пересобирать пайплайн с нуля.

LoRA (Low-Rank Adaptation) — дообучение модели на тридцати–пятидесяти изображениях одного персонажа. Модель учит «это конкретное лицо» как отдельный токен в словаре. Качество высокое (90+ процентов совпадения), но требуется графический процессор (GPU) и два-четыре часа на обучение, и работает это только с моделями с открытыми весами (Stable Diffusion 3.5, FLUX 2). LoRA — единственная техника, которая даёт устойчивый результат на серии из двадцати и более изображений.

IP-Adapter (Image Prompt Adapter) — модель берёт референсное изображение и переносит его «суть» в новые генерации. Дообучения не нужно, но совпадение ниже (60–70 процентов), и работает это в рамках одной сессии или в пайплайне с фиксированным seed. IP-Adapter — рабочий инструмент для коротких серий из трёх–пяти изображений.

Character Reference (Midjourney V8, GPT Image 2) — встроенная функция сервиса, которая принимает референс и генерирует новое изображение «в том же персонаже». Самая простая в использовании (одна кнопка), но наименее контролируемая: модель сама решает, что именно сохранять — лицо, одежду, позу, — и результат может «плыть» на длинных сериях.

Почему задача остаётся открытой? Модели обучены на парах «текст — картинка», а не на трёхмерном представлении объекта. При смене ракурса лицо перестраивается. Одежда и аксессуары «плывут»: серёжки, родинки, шрамы — модель игнорирует детали, которые человек помнит. Стиль референса не переносится чисто: реалистичный референс плюс промпт «аниме» даёт лицо, которое сохранится плохо.

Пять приёмов работы с серией в продакшне:

1: Фиксировать стартовое число (seed) при генерации. Одно стартовое число, один промпт, разные позы — лицо сохраняется в 80 процентах случаев вместо 50 без фиксации. Приём работает только в пайплайнах с открытым кодом (ComfyUI, Automatic1111).

2: Обучать LoRA на своём наборе (см. выше раздел про техники). Лучший баланс между качеством и стоимостью для серии от двадцати кадров.

3: Использовать IP-Adapter для коротких серий. До пяти изображений IP-Adapter держит персонажа на 70 процентов, дальше деградирует.

4: Генерировать в одном сервисе с фиксированными настройками. Смена сервиса (Midjourney → FLUX) ломает лицо, даже если промпт тот же. Для серии из десяти и более картинок выбирайте один сервис и придерживайтесь его.

5: Ретушировать в Photoshop или GIMP. Когда восемь из десяти изображений «почти» одинаковые, ручная доводка двух проблемных — дешевле, чем перегенерация всей серии. Для коммерческой работы ручная ретушь — стандарт.

Что работает для стилистической серии и что — для повторяющегося героя, это разные задачи с разными инструментами. Стилистическая серия строится через ControlNet плюс промпт-anchor, повторяющийся герой — через LoRA, брендовый стиль — через Recraft V4.1.

РАСПОЗНАВАНИЕ И СИНТЕЗ РЕЧИ: ДВА ПОЛЮСА ГОЛОСОВОГО AI

РАСПОЗНАВАНИЕ РЕЧИ: ОТ ЗВУКА К ТЕКСТУ

(Все цифры WER ниже — доля неверно распознанных слов: чем меньше, тем лучше.)

Распознавание речи в 2026 году — решённая задача для русского и английского на чистой записи. Whisper Large-v3 (OpenAI, ноябрь 2023, открытая модель) показывает Word Error Rate (WER, доля неверно распознанных слов) 2.1–2.7 процента на чистом английском аудио и 7–10 процентов на чистом русском. Дообученная на русском версия (whisper-large-v3-russian) снижает WER до 6.4 процента — улучшение примерно на 35 процентов относительно базовой модели.

GigaAM-v3 (Сбер, открытый код в ноябре 2025) — фундаментальная модель на архитектуре Conformer, двести двадцать–двести сорок миллионов параметров, предобученная на больших объёмах русской речи. По заявлению Сбера, GigaAM превосходит Whisper на русском, и это не маркетинг: модель обучена на русскоязычных данных, что даёт ей преимущество в распознавании редукции гласных, русской просодии и имён собственных. Лицензия MIT, запуск — локально или через API SaluteSpeech.

Если вам нужно расшифровать встречу в московском офисе, GigaAM-v3 — лучший выбор, чем Whisper: точнее на русских именах, устойчивее к разговорной речи, и аудио не уходит за рубеж. Silero — компактная модель для устройств на краю сети (edge-устройств), четыре-семь процентов WER на русском, работает на центральном процессоре (CPU). Vosk — старая, но всё ещё рабочая альтернатива для офлайн-распознавания.

Для шумной записи (кафе, улица, конференц-зал) WER вырастает до пятнадцати–двадцати пяти процентов — об этом подробнее в блоке «Где AI в речи не работает» ниже.

СИНТЕЗ РЕЧИ: ОТ ТЕКСТА К ГОЛОСУ

Синтез речи в 2026 году — почти решённая задача для типовых сценариев. ElevenLabs v3 (июнь 2025, коммерческий сервис) даёт «живую» речь с эмоциями, паузами, интонациями, и отличить её от речи живого человека можно только в специальных тестах. Сервис поддерживает семьдесят с лишним языков, аудиотеги (теги звука: шёпот, смех, паузы, эмоции) и режим диалога. На русском языке качество ElevenLabs заметно ниже, чем на английском: произношение бывает с «иностранным» акцентом, ударения иногда сбиваются.

Для русского в 2026 году локальные решения выигрывают: Yandex SpeechKit Brand Voice

1 ... 51 52 53 54 55 56 57 58 59 ... 101
Перейти на страницу:
Отзывы - 0

Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.


Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.

  • 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
  • 2. Просьба отказаться от оскорблений, угроз и запугиваний.
  • 3. Просьба отказаться от нецензурной лексики.
  • 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.

Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.


Партнер

Новые отзывы

  1. Гость Наталья Гость Наталья07 сентябрь 16:09 Хорошо. Старое дело, будет раскрыто.Прочитала с удовольствием. Люблю эту серию. ... Забытое дело Калевалы - Анна Князева
  2. Р.Д.У. Р.Д.У.22 август 02:17 ...мне тоже понравился этот русский вестерн. И озвучено неплохо. Советую.... Силантьев Вадим – Засада
  3. Гость Любовь Гость Любовь21 август 20:01 Прочитала залпом.... интересный сюжет, история захватывает, плакала вместе с героями. спасибо автору за интересное... Вернуть жену. Без права на прощение? - Ира Орлова
Все комметарии
Новое в блоге