Yandex Research научил LLM реагировать на новые данные во время генерации: манипуляции KV-кешем для интерактивных агентов
Обычная LLM работает последовательно: получила запрос — подумала — ответила. Пока она думает, новые данные (следующий кадр с камеры, ответ инструмента, уточнение) остаются за бортом. Для чат-бота это терпимо, но для голосового ассистента, робота или игрового агента — фундаментальное ограничение.
Георгий Якушев из Yandex Research предлагает перестать воспринимать KV-кеш только как ускоритель генерации и начать использовать его как активное состояние агента. Это позволяет модели корректировать план на лету, выдавать промежуточные действия и координировать процессы с разной скоростью (восприятие, рассуждение, речь, работа с инструментами) — без изменения весов обученной модели.
Подход реализуется на уровне инференса и открывает путь к по-настоящему интерактивным ИИ-агентам, которые не застывают в ожидании окончания полного цикла рассуждения. Статья содержит технические детали и примеры манипуляций KV-кешем.