ByteDance Seed предложил оценивать LLM по умению писать обвязку для агентов: лучший результат — 67.8 из 86.2
HarnessDev меняет подход к тестированию LLM: вместо того чтобы проверять, как модель решает задачи в фиксированной среде, оценивается её способность написать саму среду — исполняемый код с циклом, инструментами, обработкой ошибок и верификацией. Исследователи дали шести моделям (Opus 4.8, GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Pro, Qwen 3.7 Max и Seed 2.0 Pro) слабую заготовку, которая без доработок даёт 0 баллов, и попросили создать полноценную обвязку для четырёх доменов (код, терминал, поиск, написание текстов, ML-эксперименты) на 2207 тестовых примерах.
Лучший средний результат показала Opus 4.8 — 67.8 балла (человеческий эталон — 86.2). При этом в написании текстов (EQ-Bench3) она даже превзошла эталон: 84.6 против 83.7. В ML-экспериментах (MLE-bench) Opus и Gemini обошли эталон почти на 9 пунктов. Однако в поиске (BrowseComp) лучший результат GPT-5.5 составил лишь 52.6 против эталонных 92.2 — самый большой разрыв. Интересно, что объём кода не коррелировал с качеством: Gemini добавила меньше всего строк (1006), но лидировала в терминальном бенчмарке.
На этапе эволюции модели улучшали свои обвязки на фиксированном наборе задач. Все пять моделей, которые дорабатывали обвязку в своей же среде, показали прирост от +1.43 до +4.44 балла на скрытых тестах. При смене исполнителя (executor) на Gemini ранжирование менялось: Qwen прибавил 17.6 балла на BrowseComp, а Opus 4.8 потерял 36.3 балла на SWE-Pro из-за жёстко зашитого лимита шагов. Исследование выявило много мёртвого кода: 18 из 108 компонентов обвязки никогда не срабатывали, а 124 из 587 функций для написания текстов оказались невостребованными.