Ещё в 2023 году любой чат с нейросетью работал по одной и той же схеме: вы вводите вопрос, модель почти мгновенно начинает печатать ответ, слово за словом, без пауз. С осени 2024 года у части моделей появилось другое поведение — перед основным ответом на экране некоторое время идёт индикатор «думаю» или разворачивается блок с промежуточными рассуждениями: «рассматриваю вариант A... проверяю, не противоречит ли он условию... пробую другой подход». Только после этого появляется финальный ответ.
Для простого вопроса вроде «сколько будет 15% от 340» такое поведение выглядит избыточным — и часто действительно избыточно. Но для задачи «проверь этот договор на пункты, отличающиеся от типового шаблона, и объясни, чем рискован каждый из них» разница в качестве ответа между моделью, которая отвечает сразу, и моделью, которая сначала прошла по пунктам договора один за другим, может быть очень заметной.
Это не маркетинговая уловка и не косметическая анимация «для солидности». За индикатором «думаю» стоит реальный технический процесс — модель в буквальном смысле генерирует дополнительный текст, который вы чаще всего не видите целиком, и уже на основе этого текста формирует финальный ответ. Именно этот процесс и называют reasoning — рассуждением на этапе вывода ответа (инференса).
К середине 2026 года reasoning-режим перестал быть диковинкой одной лаборатории и стал стандартной опцией почти у всех крупных разработчиков моделей — от OpenAI и Google до Anthropic, xAI, китайских лабораторий и, с некоторым отставанием, российских GigaChat и YandexGPT. Вопрос «включать reasoning или нет» стал таким же практическим вопросом при работе с ИИ, как раньше был вопрос «какую модель выбрать» — и именно поэтому стоит разобраться, что это такое на самом деле, а не полагаться на маркетинговые формулировки вроде «более умная модель».
Чтобы понять reasoning-модели, полезно вспомнить, как работает обычная нейросеть без режима рассуждений. Она предсказывает следующее слово (точнее, токен) на основе всего, что было написано до него, — и делает это сразу для финального ответа. Если задача простая, этого достаточно: модель «видела» на обучении миллионы похожих примеров и с высокой вероятностью подберёт верное продолжение. Если задача требует нескольких логических шагов, а верный ответ не лежит на поверхности, модель, отвечающая «с ходу», чаще ошибается — она как бы обязана выдать финальный текст сразу, без права на черновик.
Reasoning-модель устроена иначе: прежде чем сформировать видимый пользователю ответ, она генерирует последовательность промежуточных токенов — так называемую цепочку рассуждений (chain-of-thought). В этой цепочке модель раскладывает задачу на шаги, проговаривает промежуточные вычисления, проверяет один вариант решения, отбрасывает его, если он не сходится, и пробует другой. Только когда эта внутренняя работа завершена, модель формирует итоговый, видимый ответ — уже опираясь на весь пройденный путь рассуждения как на дополнительный контекст.
Удобная (хотя и не полностью точная) бытовая аналогия — разница между устным счётом в уме и решением задачи на черновике. Устно вы иногда ошибаетесь на сложных числах, потому что промежуточные результаты не зафиксированы и легко теряются. На черновике вы записываете каждый шаг, видите его перед глазами и можете сверить с предыдущим — вероятность ошибки в длинной цепочке вычислений падает. Reasoning-режим — это, по сути, право модели «взять черновик» перед тем, как дать окончательный ответ.
Важно понимать, откуда у модели вообще берётся умение рассуждать таким образом — оно не «зашито» вручную. Reasoning-модели обучают через reinforcement learning (обучение с подкреплением) поверх базовой языковой модели: модели дают задачи с проверяемым правильным ответом (математика, программирование, логические головоломки), и она получает награду за цепочки рассуждений, которые приводят к верному результату. За тысячи и миллионы таких попыток модель постепенно вырабатывает полезные паттерны рассуждения — проверку промежуточных шагов, разбиение сложной задачи на подзадачи, возврат назад при обнаружении противоречия — потому что именно такие паттерны чаще приводят к награде.
Отсюда важное уточнение, которое пригодится дальше по тексту: фраза «модель думает» — это метафора, а не описание буквального когнитивного процесса. Модель не обладает намерениями, не осознаёт себя и не «понимает» задачу в человеческом смысле слова. Она генерирует статистически вероятное продолжение текста, обученное так, чтобы это продолжение чаще совпадало с правильным решением проверяемых задач. Различие кажется философским, но у него есть практическое следствие, о котором — в разделе про частые заблуждения.
Есть и более техническое название у всего этого явления — масштабирование вычислений на этапе вывода ответа (test-time compute scaling). Раньше единственным способом сделать модель умнее было увеличивать её саму на этапе обучения — больше параметров, больше данных, больше вычислительных мощностей на тренировку. Reasoning-подход добавил вторую, независимую ось масштабирования: одну и ту же по размеру модель можно сделать точнее на конкретной задаче, просто выделив ей больше вычислений в момент ответа — то есть позволив генерировать более длинную цепочку рассуждений. Это открытие оказалось значимым для всей индустрии, потому что предложило более дешёвый и предсказуемый способ повышать качество ответа именно там, где это нужно, вместо того чтобы каждый раз обучать новую, более крупную и дорогую модель.
Массовый старт этому направлению дала OpenAI, выпустив в сентябре 2024 года модель o1 — первую широко доступную модель, обученную именно так, чтобы «думать» перед ответом. Разница на сложных задачах оказалась не косметической: на математическом соревновании AIME o1 показала около 74% правильных решений против примерно 12% у обычной на тот момент флагманской модели GPT-4o — качественно другой уровень, а не небольшое улучшение. Позже вышла ещё более мощная o3, установившая рекорды на бенчмарках по программированию (Codeforces, SWE-bench) и показавшая результат golden-медали на международной математической олимпиаде.
Настоящий перелом для всего рынка случился в январе 2025 года, когда китайская лаборатория DeepSeek выпустила модель R1 — reasoning-модель с открытыми весами, сопоставимую по качеству рассуждений с закрытыми западными моделями, но с заявленно значительно меньшими затратами на обучение и заметно более дешёвым доступом через API. Эффект вышел далеко за пределы технической новости: на опасениях, что дорогостоящие вычислительные мощности для обучения ИИ переоценены, если сопоставимого результата можно добиться дешевле, акции Nvidia потеряли около 593 млрд $ капитализации за один торговый день — крупнейшее однодневное падение в истории компании на тот момент.
Для рынка нейросетей DeepSeek R1 сыграл роль спускового крючка по двум причинам сразу. Во-первых, он доказал, что reasoning-подход воспроизводим не только у OpenAI с их вычислительными ресурсами. Во-вторых, открытые веса модели дали разработчикам по всему миру возможность запускать и дообучать reasoning-модель самостоятельно, без подписки на закрытый API, — это резко ускорило распространение технологии за пределы одной лаборатории.
После этого reasoning-режим за считаные месяцы стал ожидаемой опцией у всех крупных игроков. Google встроила «думающий» режим в линейку Gemini (Thinking, а затем и более тяжёлый Deep Think для особенно сложных научных задач). Anthropic добавила extended thinking в модели семейства Claude, начиная с Claude 3.7 Sonnet, с возможностью настраивать «бюджет на размышление» под конкретную задачу. xAI выделила reasoning в отдельный, явно промаркированный режим Thinking у моделей Grok, который на отдельных математических бенчмарках (например, AIME 2025) стал показывать одни из самых высоких результатов среди всех проверенных моделей.
К 2026 году reasoning перестал быть отдельным дорогим продуктом «для избранных задач» и превратился в стандартную настройку внутри большинства флагманских моделей — с возможностью выбрать глубину рассуждения (иногда называемую reasoning effort) под конкретный запрос, а не только включить или выключить режим целиком.
Разрыв между обычной и reasoning-моделью не одинаков на любых задачах — он максимален там, где правильный ответ требует нескольких проверяемых логических шагов, и минимален (а иногда отрицателен) там, где задача решается в одно действие. Самый наглядный пример — математические олимпиадные задачи, где reasoning-модели, как показано выше, поднимают долю верных решений в разы.
Похожая картина — в программировании и отладке кода: на бенчмарках вроде SWE-bench (реальные баг-репорты из открытых проектов) и Codeforces (соревновательное программирование) reasoning-модели заметно опережают обычные, потому что отладка кода — это по сути пошаговый процесс выдвижения и проверки гипотез («если ошибка здесь — значит, при таком входе должно быть вот так; проверяю; не сходится; значит, дело не в этом месте»). Ровно тот тип задачи, где польза от возможности «взять черновик» максимальна.
Третья категория — научные и наукоёмкие вопросы уровня выше стандартного: на бенчмарке GPQA, где вопросы составлены так, чтобы быть сложными даже для специалиста без профильного образования в конкретной узкой области, reasoning-модели показывают результат, сопоставимый с ответами людей с PhD в соответствующей дисциплине, тогда как обычные модели заметно отстают.
Четвёртая категория — прикладная для бизнеса и особенно интересна в контексте этого гайда: многошаговый юридический и финансовый анализ. Здесь задача не сводится к одному правильному числу, как в математике, но так же требует последовательного прохода по нескольким условиям, которые нужно удержать в голове одновременно и сопоставить друг с другом.
А вот там, где задача решается в одно действие или сводится к воспроизведению уже известного факта или шаблона — короткий рерайт текста, ответ на простой фактический вопрос, генерация поста для соцсетей по понятному брифу, — разрыв между обычной и reasoning-моделью практически исчезает. Обе справляются одинаково хорошо, но одна делает это в разы быстрее и дешевле.
У reasoning-режима есть прямая и не всегда очевидная цена, которую стоит понимать до того, как включать его «на всякий случай» для всех задач подряд. Она складывается из двух эффектов, которые умножаются друг на друга.
Первый эффект — более высокая цена за токен. У ранних reasoning-моделей вроде o1 цена за токен была в несколько раз выше, чем у обычных моделей того же поколения: там, где базовая модель могла стоить порядка 2-3 $ за миллион токенов, у o1 расценки доходили примерно до 15 $ за миллион входных и 60 $ за миллион выходных токенов — разница в 5-6 раз по чистой цене токена.
Второй эффект — сама цепочка рассуждений тоже состоит из токенов, и притом их много: по разным оценкам, reasoning-модель может сгенерировать в 8-20 раз больше токенов на один запрос, чем обычная модель, отвечающая сразу, — большая часть этого объёма приходится на невидимые пользователю промежуточные рассуждения, но провайдер выставляет счёт и за них, поскольку генерация токена стоит вычислительных ресурсов вне зависимости от того, видит его пользователь или нет.
Когда оба эффекта складываются, итоговая разница в стоимости решения одной и той же сложной задачи может быть очень значительной — по независимым замерам на комплексных задачах решение с помощью reasoning-модели обходилось примерно в 25 раз дороже, чем решение той же задачи обычной моделью того же поколения. На простых задачах разрыв в стоимости конкретного запроса тоже сохраняется — по некоторым оценкам, до 30 раз, — просто в абсолютных цифрах это может быть разница между долями цента и несколькими центами, поэтому незаметно на глаз, пока объём запросов не вырастет до промышленного масштаба.
Помимо денег есть и временная цена. Обычная модель начинает отвечать почти мгновенно. Reasoning-модель сначала проходит фазу рассуждения — на несложных задачах это может быть несколько секунд, но на действительно сложных, с длинной цепочкой промежуточных шагов, ответ может формироваться десятки секунд, а в отдельных случаях — несколько минут. Для чат-бота поддержки, где клиент ждёт ответа в реальном времени, разница между «мгновенно» и «через минуту» — это не мелочь, а фактор, напрямую влияющий на удовлетворённость клиента и, если поддержка это оплачивает по количеству диалогов в час, на экономику всего процесса.
Отсюда практический вывод: reasoning-режим оправдан там, где цена ошибки выше, чем цена дополнительных денег и времени на рассуждение — сложная аналитика, код, юридические и финансовые задачи с несколькими условиями. Он не оправдан там, где задача простая или где скорость ответа критична, а глубина рассуждения не влияет на качество, — черновики текстов, короткие ответы, повседневная переписка, большая часть маркетингового и клиентского контента.
Резонный вопрос для российского бизнеса — а есть ли что-то подобное у отечественных моделей, или reasoning-режим доступен только через зарубежные сервисы, работа с которыми осложнена вопросами доступа и хранения данных. Ответ по состоянию на 2026 год — «да, но с оговорками, и заметно позже конкурентов».
У GigaChat MAX режим рассуждений официально задокументирован в технической документации разработчиков Сбера: в API можно передать параметр reasoning с настраиваемой глубиной размышления (например, уровень effort), и модель перед финальным ответом формирует внутреннюю цепочку рассуждений — по механике это прямой аналог того, что делает o1 или DeepSeek R1. У YandexGPT 5.1 Pro похожий функционал называется Chain-of-Reasoning и, по заявлению самого Яндекса, ориентирован в первую очередь на многошаговые задачи — разбор юридических документов, сложную многошаговую логику, программирование; в собственных бенчмарках компании модель с этим режимом превосходит GPT-4.1 в 56% задач на русском языке.
Здесь важна честная оговорка, а не маркетинговая формулировка. Оба российских reasoning-режима вышли примерно через полтора-два года после OpenAI o1 (сентябрь 2024) — GigaChat задокументировал функциональность в середине 2026 года, YandexGPT 5.1 Pro с Chain-of-Reasoning вышел ориентировочно в середине 2026 года. Это означает, что российские лаборатории в этом направлении выступают в роли догоняющих, а не пионеров, — что само по себе нормально и ожидаемо для более молодой индустрии с меньшим объёмом вычислительных ресурсов, но не стоит выдавать за паритет с лидерами рынка.
Вторая честная оговорка — независимая проверка. Для o1, o3, DeepSeek R1, моделей Gemini, Claude и Grok есть большой массив независимых бенчмарков (AIME, GPQA, SWE-bench, LiveCodeBench и другие), результаты на которых публикуют не только сами разработчики, но и сторонние исследователи. Для GigaChat MAX и YandexGPT 5.1 Pro в reasoning-режиме такого объёма независимой проверки пока заметно меньше — большая часть опубликованных цифр исходит от самих компаний-разработчиков. Это не значит, что цифры неверны, но означает, что доверять им стоит с поправкой на источник, а качество на конкретной задаче лучше проверять самостоятельно, а не полагаться только на маркетинговые материалы.
Практический вывод для бизнеса, работающего с персональными данными или обязанного хранить данные на территории России: если задача требует reasoning и данные чувствительны, GigaChat MAX или YandexGPT 5.1 Pro — разумная отправная точка именно из-за требований к размещению данных, но стоит закладывать пилотную проверку качества на собственных задачах, а не считать заявленные цифры гарантией. Если данные не чувствительны и приоритет — максимальное качество на сложной задаче, DeepSeek R1 остаётся бюджетным вариантом с открытыми весами и большим объёмом независимой проверки, а o3, Gemini Deep Think или Claude с extended thinking — вариантом для задач, где цена ошибки оправдывает более высокую стоимость запроса.
Вместо того чтобы включать reasoning-режим «на всякий случай» для всех запросов (и незаметно для себя увеличивать счёт в разы), полезно пройти короткую проверку из нескольких вопросов перед конкретной задачей.
Если на большинство из первых трёх вопросов ответ «да», а на два последних — «не критично», reasoning-режим, скорее всего, оправдан. Если задача простая, ответ нужен мгновенно или запросов очень много и они однотипны — вероятно, обычная модель справится не хуже, а обойдётся кратно дешевле.
Направление, в котором быстрее всего меняется рынок reasoning-моделей, — это переход от «включено или выключено» к настраиваемой глубине рассуждения. Уже сейчас у большинства крупных провайдеров можно указать не просто «думай», а «думай на таком-то уровне усилия» — от минимального, почти неотличимого от обычного ответа, до максимального, с длинной многошаговой цепочкой. Следующий логичный шаг, который уже частично реализован у отдельных моделей, — адаптивный reasoning, когда модель сама определяет, насколько сложна конкретная задача, и выделяет на неё ровно столько «раздумий», сколько нужно, без явной настройки со стороны пользователя.
Второй заметный тренд — насыщение классических бенчмарков. Разрыв в 60+ процентных пунктов между обычной и reasoning-моделью, который был так нагляден в 2024 году на AIME, для новых поколений моделей на тех же тестах уже не так показателен — обе категории моделей подтянулись, а верхняя граница результата на многих устоявшихся бенчмарках близка к максимуму. Это подталкивает индустрию к более сложным, специально сконструированным тестам, где reasoning-подход по-прежнему даёт заметное преимущество, — задачи из реальной инженерной практики, длинные цепочки агентных действий, где нужно не просто решить одну задачу, а спланировать и выполнить последовательность из многих шагов, не теряя контекст.
Третий тренд напрямую касается практического применения в бизнесе — растущая роль reasoning в агентных системах, то есть в сценариях, где нейросеть не просто отвечает на один вопрос, а самостоятельно выполняет цепочку действий: находит информацию, проверяет её, принимает решение о следующем шаге, снова проверяет результат. Такие сценарии по своей природе требуют многошагового рассуждения на каждом этапе, поэтому спрос на reasoning-режим будет расти не только там, где пользователь напрямую задаёт сложный вопрос, но и там, где ИИ работает автономно в фоне.
Для российского рынка логичный сценарий на ближайшие один-два года — дальнейшее сокращение отставания GigaChat и YandexGPT в части самой доступности reasoning-режима, но при этом сохраняющийся разрыв в объёме независимой проверки этих режимов по сравнению с западными и китайскими аналогами, пока не появится больше сторонних, не аффилированных с разработчиками бенчмарков на русскоязычных и специфичных для России задачах. Бизнесу, планирующему использовать reasoning-режим на постоянной основе, стоит закладывать периодический пересмотр выбора модели — рынок меняется быстрее, чем успевают устояться однажды принятые решения.
Отдельно стоит следить за тем, как меняется сама экономика reasoning-режима. Цена за токен на «думающие» модели с 2024 года уже заметно снизилась по мере того, как провайдеры оптимизировали инференс и научились генерировать более короткие, но не менее точные цепочки рассуждений — то есть тот же уровень качества сегодня стоит дешевле, чем полтора года назад. Если эта тенденция продолжится, часть сегодняшних ограничений «reasoning — это дорого и медленно» со временем ослабнет, и граница, где имеет смысл включать режим рассуждений, сдвинется в сторону более широкого круга повседневных задач бизнеса, а не только самых сложных и ответственных.