Новая метрика METR: когда ИИ-агент становится дороже человека в долларах в час
METR (организация, занимающаяся оценкой рисков ИИ) ввела метрику «expenditure horizon» — горизонт расходов. Она считает, сколько долларов стоит поручить задачу ИИ-агенту, и сравнивает эту цифру с зарплатой человека. Идея простая: если агент тратит $100 вычислительных ресурсов на задачу, которую человек сделал бы за $20, то экономически выгоднее человек.
Первые результаты на бенчмарке NanoGPT speedrun (задача — обучить небольшую языковую модель) оказались скромными: агенты быстро перестают быть рентабельными. Однако авторы признают, что метрика не учитывает ряд факторов — например, качество результата, скорость или возможность масштабирования. Кроме того, новые поколения моделей (вроде GPT-5 или Claude 4) могут кардинально изменить расклад, снизив стоимость вычислительных операций.
Несмотря на недостатки, «expenditure horizon» даёт практический инструмент для бизнеса: вместо абстрактных разговоров об автоматизации — конкретные цифры «дороже/дешевле человека». Пока что метрика показывает, что для многих задач ИИ-агенты всё ещё уступают человеку по чистой экономике, но ситуация может быстро меняться по мере удешевления инференса.