Волна ИИПодписаться
← Назад
Исследования

RUMBA: новый бенчмарк для оценки долгосрочной памяти в русскоязычных диалогах

24.07.2026 · habr.com ↗

Память в диалоговых системах становится критически важной: пользователи ждут, что ассистент запомнит их предпочтения, не потеряет нить беседы и вовремя обновит устаревшие данные. Однако встроенной памяти у LLM нет — её добавляют через RAG, профили или агентные схемы. Качество таких решений сильно зависит от архитектуры, а не от самой модели, и до сих пор не было бенчмарка для русского языка, который бы это проверял.

RUMBA (Russian User Memory Benchmark) восполняет этот пробел. Он оценивает, как система извлекает факты, разрешает противоречия, удаляет данные по запросу и использует временной контекст в реалистичных многосессионных диалогах. Бенчмарк призван помочь разработчикам объективно сравнивать подходы к долгосрочной памяти.

Источник: habr.com
← Все новости AI Wave