Волна ИИПодписаться
← Назад
Исследования

Yandex Research научил LLM реагировать на новые данные во время генерации: манипуляции KV-кешем для интерактивных агентов

23.09.2026 · habr.com ↗

Обычная LLM работает последовательно: получила запрос — подумала — ответила. Пока она думает, новые данные (следующий кадр с камеры, ответ инструмента, уточнение) остаются за бортом. Для чат-бота это терпимо, но для голосового ассистента, робота или игрового агента — фундаментальное ограничение.

Георгий Якушев из Yandex Research предлагает перестать воспринимать KV-кеш только как ускоритель генерации и начать использовать его как активное состояние агента. Это позволяет модели корректировать план на лету, выдавать промежуточные действия и координировать процессы с разной скоростью (восприятие, рассуждение, речь, работа с инструментами) — без изменения весов обученной модели.

Подход реализуется на уровне инференса и открывает путь к по-настоящему интерактивным ИИ-агентам, которые не застывают в ожидании окончания полного цикла рассуждения. Статья содержит технические детали и примеры манипуляций KV-кешем.

Источник: habr.com
← Все новости AI Wave