Масштабирование через инференс

Развитие reasoning-моделей, популяризированных OpenAI с выходом o1 и DeepSeek-R1, привело к новому стандарту в индустрии. Основной способ повышения качества решения сложных задач — это масштабирование инференса. В отличие от масштабирования обучения, этот метод предполагает увеличение вычислительных ресурсов непосредственно в момент использования модели для получения более точного ответа.

Одним из способов реализации такого подхода является использование метода self-consistency, когда модель опрашивают несколько раз, а итоговый ответ выбирается путем голосования большинством. Это позволяет повышать точность как у обычных LLM, так и у специализированных reasoning-моделей.

Настройка глубины рассуждений

С выходом семейства моделей GPT-5.6 от OpenAI появилась возможность управлять уровнем усилий при рассуждении (reasoning effort). Для каждой из трех моделей в семействе предусмотрено от пяти до шести настроек сложности. Это позволяет гибко распределять ресурсы: более высокие настройки обеспечивают глубокую проработку задачи, в то время как низкие — ускоряют работу за счет использования нескольких субагентов.

Подобный гибридный подход, позволяющий модели переключаться между режимами обычного ассистента и режима рассуждений, уже тестируется в таких моделях, как Qwen3. В этом случае поведение модели определяется параметром enable_thinking, который может либо активировать процесс генерации промежуточных рассуждений, либо подставлять пустые теги для экономии ресурсов.

Методы обучения: RLVR и роль тегов

Для создания reasoning-моделей часто применяется метод RLVR (reinforcement learning with verifiable rewards) — обучение с подкреплением на проверяемых наградах. В этом случае модель получает сигнал (0 или 1) на основе правильности итогового ответа, который можно проверить автоматически (например, через компилятор кода или математическую систему). При этом промежуточные шаки рассуждений не используются для обновления весов модели, так как это не приносит дополнительной пользы.

Важно понимать, что технические теги, такие как <think> и </>, не являются причиной появления способности к рассуждению. Они служат лишь оформительским инструментом, позволяющим отделить процесс «размышления» от финального ответа. Это позволяет интерфейсам, подобным ChatGPT, скрывать цепочку рассуждений от пользователя, сохраняя структуру ответа.