Исследования
Google придумала RRSI: ИИ-агенты перестают запоминать тесты и лучше работают на новых задачах
Самообучающиеся ИИ-агенты склонны запоминать конкретные тестовые задачи, а не учиться решать их в принципе. Из-за этого прирост качества на знакомых примерах не переносится на новые — и агент перестаёт улучшаться.
Исследователи Google предложили метод RRSI (Regularized Reinforcement Learning for Self-Improvement), который подавляет эффект запоминания. В тестах на невидимых бенчмарках агенты с RRSI показали прирост до 4,7 пункта, а количество затраченных токенов сократилось примерно на 30% по сравнению с нерегуляризованной версией.
Источник: the-decoder.com