Волна ИИПодписаться
← Назад
Исследования

Как управлять reasoning effort в LLM: от DeepSeek V4 до Inkling

17.08.2026 · habr.com ↗

Современные LLM предлагают разные способы управления reasoning effort — глубиной и длительностью рассуждений перед ответом. В статье разбираются ключевые подходы: от простых системных промптов до продвинутых техник вроде RLVR (reinforcement learning with verifiable rewards) и on-policy-дистилляции. Особое внимание уделяется штрафам за длину и reasoning budgets, которые позволяют балансировать между качеством и скоростью.

На примерах DeepSeek V4, Nemotron 3 Ultra, Kimi K2.5 и K3, GLM-5, Qwen3 и Inkling показано, как разные модели реализуют эти механизмы. Например, DeepSeek V4 использует комбинацию SFT и RLVR для тонкой настройки, а Kimi K3 внедряет динамические reasoning budgets. Материал будет полезен разработчикам, которые хотят оптимизировать работу LLM под конкретные задачи.

Источник: habr.com
← Все новости AI Wave