Главное про AI - Вадим Жартун
Книгу Главное про AI - Вадим Жартун читаем онлайн бесплатно полную версию! Чтобы начать читать не надо регистрации. Напомним, что читать онлайн вы можете не только на компьютере, но и на андроид (Android), iPhone и iPad. Приятного чтения!
Шрифт:
Интервал:
Закладка:
ЦЕПОЧКА РАССУЖДЕНИЙ: ПОДЛИННОЕ МЫШЛЕНИЕ ПРОТИВ ИМИТАЦИИ
Предвзятость, галлюцинации, RAG и дообучение — это всё про «что» модель выдаёт и «откуда» она это берёт. Отдельный вопрос — «как» она думает.
В январе 2022 года Джейсон Вэй (Jason Wei) и соавторы из Google Brain (ныне часть Google DeepMind) опубликовали работу (Wei et al., arXiv 2201.11903): если попросить модель «рассуждать пошагово» перед финальным ответом, качество на арифметических и логических задачах резко растёт. Технику назвали Chain-of-Thought (CoT, «цепочка рассуждений»). С тех пор прошло четыре года, и индустрия поняла: CoT помогает не всегда, и полезно знать, когда именно.
CoT реально помогает на задачах, которые требуют нескольких логических шагов. Если задача помещается в один шаг (классификация, извлечение одного факта, короткая генерация) — CoT не нужен, он только раздувает ответ. Если задача требует разбить сложное на простые шаги (математика с несколькими действиями, логические цепочки, многошаговые рассуждения) — CoT помогает, потому что каждый шаг становится отдельной задачей, и вероятность ошибки на каждом шаге ниже, чем вероятность ошибки в сквозном рассуждении. К 2026 году ведущие модели (Claude, GPT-4o, Gemini) научились «рассуждать по умолчанию» — то есть CoT встроен в их обычную работу и не требует отдельной просьбы в промпте.
Но есть нюанс, который перевернул расхожую рекомендацию «всегда просите модель думать шагами». В июне 2025 года Wharton Generative AI Labs (исследовательская лаборатория Школы бизнеса Уортон при Пенсильванском университете) опубликовал «Prompting Science Report 2: The Decreasing Value of Chain of Thought in Prompting». На восьми моделях в трёх режимах прогнали 198 задач PhD-уровня. Результат: для reasoning-моделей (o3-mini, o4-mini, Gemini Flash 2.5) CoT даёт прирост всего +2,9%…+3,1% по среднему, а у Flash 2.5 — минус 3,3%, при этом время ответа растёт на 20–80%. Для нерассуждающих моделей эффект больше: Sonnet 3.5 +11,7%, Gemini Flash 2.0 +13,5% по среднему. Но по метрике «100% правильных ответов» Gemini Pro 1.5 теряет 17,2% при добавлении CoT.
Вывод Wharton: для reasoning-моделей CoT стал плацебо с побочным эффектом замедления. Ещё год назад девизом было «проси модель думать вслух», теперь — «дай ей доступ к калькулятору и не мешай». Если вы работаете с o3, o4, Flash 2.5 или подобными моделями, инструкция «давай подумаем шагами» в промпте — пустая трата времени, и часто хуже.
CoT не делает модель «умнее» за счёт добавления новых знаний. Он заставляет её использовать больше вычислительных шагов, и в задачах, где больше шагов — это больше точности, выгода очевидна. В задачах, где больше шагов — это больше пространства для накопления ошибки, выгода исчезает или становится вредом. Та же команда Apple Machine Learning, чью работу GSM-Symbolic мы упоминали в разделе про расчёты, показала в части про CoT: при небольшом изменении условий задачи (замена имён или чисел на эквивалентные) точность модели с CoT падает на 10–30%. Это значит, что значительная часть «рассуждений» модели — это не настоящая логика, а паттерны, выученные из похожих задач. При изменении условий паттерны перестают работать, и рассуждение рассыпается.
У CoT есть и вторая задача — прозрачность. Если модель рассуждает шагами, человек может проверить логику. Это критично для кейсов повышенного риска по EU AI Act: медицинские рекомендации, кредитный скоринг, найм, правовые заключения. CoT — не «серебряная пуля», но единственный дешёвый способ сделать решение модели оспариваемым: в спорном HR-кейсе или в анализе договора вы можете попросить модель «сначала перечисли риски, потом для каждого — рекомендацию, потом общий вывод», и каждое утверждение будет привязано к своему шагу.
Без CoT у вас есть только вывод, и никто точно не сможет сказать, откуда он взялся.
Используйте CoT по типу задачи, а не по привычке. Если задача многошаговая и проверяемая (математика, логика, пошаговый анализ договора или финансового расчёта) — CoT помогает, особенно на обычных (не рассуждающих) моделях. Если задача требует одного простого действия или вы работаете с рассуждающей моделью — CoT лишний, и часто вредит. Не верьте, что длинное «рассуждение» модели в ответе — доказательство её уверенности. Это просто текст, и в нём может быть столько же галлюцинаций, сколько в любом другом ответе.
ЧУДО, ИГРУШКА, ВРАГ: ТРИ ОБРАЗА AI В ГОЛОВЕ ПОЛЬЗОВАТЕЛЯ
Есть ещё один слой, без которого всё это не работает в команде: отношение людей к AI. Из предыдущих разделов видно, что у модели есть границы и системные риски. Как люди реагируют на эти риски — определяет, получится ли внедрение.
У каждой команды, которая впервые сталкивается с AI, проявляется одно из трёх базовых отношений, и каждое мешает эффективному внедрению. Эти отношения редко проговариваются вслух, но именно они определяют, как люди используют инструмент.
Чудо. «AI может всё, мы наконец получили волшебного помощника». Сторонники этого отношения бросают AI на задачи, для которых он не подходит (точный расчёт, юридические ссылки, медицинские рекомендации), и разочаровываются, когда получают выдумки. McKinsey в отчёте 2025 года описал: сотрудники движутся с AI быстрее, чем лидеры, энтузиазм снизу опережает понимание сверху, и компания получает разрыв между тем, что делают сотрудники, и тем, что компания готова поддержать. Slack Workforce Index в 2025 году зафиксировал, что сотрудники, использующие AI, сообщают о росте продуктивности на 64% — и одновременно о росте нагрузки: больше дел, больше писем, больше встреч. Чудо оборачивается перегрузкой.
Игрушка. «AI забавный, но для серьёзных задач не подходит». Сторонники этого отношения используют AI для развлечения (генерация картинок, шутки, болтовня) и не допускают его до рабочих процессов. По данным BCG AI at Work 2025, 60% сотрудников время от времени используют AI, но только 20% компаний имеют формализованную стратегию его внедрения. Разрыв между «попробовал в курилке» и «внедрил в процесс» остаётся гигантским. Игрушечное отношение закрепляет AI как маргинальный инструмент и не даёт компании получить реальный эффект.
Враг. «AI — это угроза моей работе, я не буду его использовать». Это отношение появляется у тех, кто видит в AI конкурента, а не инструмент. Такие сотрудники саботируют внедрение (сознательно или бессознательно), и это дорого обходится компании: исследования McKinsey показывают, что «сопротивление команды» — причина провала AI-проектов после технических проблем. Враг мешает не самой модели, а способности компании увидеть эффект от её работы.
Рабочая позиция — четвёртая. AI — это инструмент с известными границами, и эффективное использование состоит в том, чтобы знать эти границы и работать внутри них. Если вы ловите себя на одном из трёх отношений, остановитесь
Прочитали книгу? Предлагаем вам поделится своим отзывом от прочитанного(прослушанного)! Ваш отзыв будет полезен читателям, которые еще только собираются познакомиться с произведением.
Уважаемые читатели, слушатели и просто посетители нашей библиотеки! Просим Вас придерживаться определенных правил при комментировании литературных произведений.
- 1. Просьба отказаться от дискриминационных высказываний. Мы защищаем право наших читателей свободно выражать свою точку зрения. Вместе с тем мы не терпим агрессии. На сайте запрещено оставлять комментарий, который содержит унизительные высказывания или призывы к насилию по отношению к отдельным лицам или группам людей на основании их расы, этнического происхождения, вероисповедания, недееспособности, пола, возраста, статуса ветерана, касты или сексуальной ориентации.
- 2. Просьба отказаться от оскорблений, угроз и запугиваний.
- 3. Просьба отказаться от нецензурной лексики.
- 4. Просьба вести себя максимально корректно как по отношению к авторам, так и по отношению к другим читателям и их комментариям.
Надеемся на Ваше понимание и благоразумие. С уважением, администратор knigkindom.ru.
Оставить комментарий
-
Гость Наталья07 сентябрь 16:09
Хорошо. Старое дело, будет раскрыто.Прочитала с удовольствием. Люблю эту серию. ...
Забытое дело Калевалы - Анна Князева
-
Р.Д.У.22 август 02:17
...мне тоже понравился этот русский вестерн. И озвучено неплохо. Советую....
Силантьев Вадим – Засада
-
Гость Любовь21 август 20:01
Прочитала залпом.... интересный сюжет, история захватывает, плакала вместе с героями. спасибо автору за интересное...
Вернуть жену. Без права на прощение? - Ира Орлова
