Как управлять reasoning effort в LLM: от DeepSeek V4 до Inkling
Современные LLM предлагают разные способы управления reasoning effort — глубиной и длительностью рассуждений перед ответом. В статье разбираются ключевые подходы: от простых системных промптов до продвинутых техник вроде RLVR (reinforcement learning with verifiable rewards) и on-policy-дистилляции. Особое внимание уделяется штрафам за длину и reasoning budgets, которые позволяют балансировать между качеством и скоростью.
На примерах DeepSeek V4, Nemotron 3 Ultra, Kimi K2.5 и K3, GLM-5, Qwen3 и Inkling показано, как разные модели реализуют эти механизмы. Например, DeepSeek V4 использует комбинацию SFT и RLVR для тонкой настройки, а Kimi K3 внедряет динамические reasoning budgets. Материал будет полезен разработчикам, которые хотят оптимизировать работу LLM под конкретные задачи.