Волна ИИПодписаться
← Назад
Исследования

Meta FAIR представила RPM: ИИ-агенты теперь ранжируют идеи экспериментов до того, как сожгут GPU-часы

06.09.2026 · marktechpost.com ↗

Главная проблема автономных ИИ-исследователей: идеи дешевы, проверка дорога. Агент генерирует сотни кандидатов, но запустить на GPU может лишь единицы. Выбор того, что выполнять, становится ключевым рычагом прогресса. Meta FAIR формализовала этот рычаг как «исследовательское предпочтение» и представила RPM — модель, которая ранжирует ещё не выполненные кандидаты и выбирает одного победителя для запуска.

RPM не предсказывает абсолютную метрику — авторы обнаружили, что LLM плохо предсказывают числовые результаты. Вместо этого модель сравнивает пары кандидатов в нокаут-турнире. Для каждого сравнения собирается контекст из уже исследованного дерева экспериментов. Метод работает в контуре агента AIRA-dojo: эволюционный поиск с жадным выбором родителя и операторами Draft / Improve / Debug. RPM вмешивается только на этапе создания потомка: вместо одного ребёнка генерируется 15 параллельных кандидатов, и только победитель выполняется.

Важно: RPM использует frozen предобученные LLM без дообучения. Scaffold AIRA-dojo и бенчмарк AIRS-Bench — открытый исходный код. Базовая модель — Qwen3.6-27B с открытыми весами. Это делает подход доступным для широкого круга исследователей и может существенно ускорить итерации в AI-лабораториях за счёт сокращения пустых запусков.

Источник: marktechpost.com
← Все новости AI Wave