Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Новый бенчмарк MarathonMemBench: LLM-агент часами общается, а потом сдаёт экзамен на память

05.08.2026 · habr.com ↗

Разработчик представил MarathonMemBench — бенчмарк нового типа для измерения долговременной памяти AI-агентов. В отличие от существующих тестов, он не требует доработки агента: достаточно подключить любого агента с чатом, и платформа сама проведёт многочасовую беседу.

В ходе теста LLM-персонаж общается с агентом: рассказывает факты о своей жизни, меняет решения, путается и поправляется. Когда начало разговора уже вытеснено из контекста, персонаж устраивает экзамен на всё сказанное. Так проверяется, насколько агент действительно помнит информацию, а не просто обрабатывает текущий контекст.

В планах автора — обзор существующих бенчмарков памяти, описание устройства платформы и результаты тестирования open-source-агентов. Предварительные результаты оказались неожиданно сильными, и разработчик собирается провести «вскрытие» памяти агентов после прогонов.

Источник: habr.com
← Все новости AI Wave