Волна ИИПодписаться
← Назад
Исследования

Perplexity дообучает агента на реальных ошибках: сбои инструментов упали на 21,2%

25.09.2026 · marktechpost.com ↗

Perplexity Research опубликовала исследование по пост-обучению модели внутри Perplexity Computer. Авторы используют не только успешные сессии, но и провальные — с реальными ошибками агента. Метод комбинирует rejection sampling fine-tuning (дообучение на отобранных примерах) с hint-guided self-distillation — дистилляцией с подсказками. В живом A/B-тесте между двумя обученными чекпоинтами доля неудачных вызовов инструментов упала с 2,24% до 1,77%, что авторы называют статистически значимым относительным снижением на 21,2%.

Ключевая идея — не считать сессию целиком хорошей или плохой. Обычный подход имитирует только успешные траектории, но успех не гарантирует, что каждый шаг был верным: агент мог ошибиться и исправиться. Поэтому каждый ход ассистента получает одну из трёх ролей: imitate (имитировать в успешных сессиях), correct (исправлять с помощью проверенной подсказки) или keep as context (оставить в контексте без loss). Подсказка — это короткая корректирующая инструкция, основанная на информации, которая уже была у модели. Применяется on-policy self-distillation: учитель видит подсказку, студент — нет, а loss считается как комбинация кросс-энтропии и KL-дивергенции.

Perplexity также объясняет, как находят источник ошибки. Жалобы пользователей проходят через LLM-судей: три модели определяют ответственный ход, но последний ход перед жалобой — корень причины только в половине случаев. Каждую подсказку проверяют на доступность информации до ошибки, чтобы снизить предвзятость задним числом. Например, пользователь попросил «w3» в Paychex, а модель решила, что это опечатка W-2, и искала не ту форму. Метод пока не развёрнут как готовое решение: веса и код обучения не опубликованы, модель доступна только как опция внутри Perplexity Computer, а базовая GLM 5.2 открыта на Hugging Face.

Источник: marktechpost.com
← Все новости AI Wave