Как LLM собрали винный бенчмарк на 3 266 вопросов — и где они ошиблись
Полгода назад автор решил измерить, сколько LLM на самом деле знают про вино. Так появился OenoBench: 38 104 факта из открытых источников, 3 266 вопросов с вариантами ответа и прогон шестнадцати моделей. Почти всю работу сделали агенты: код писал Claude Code, вопросы генерировали пять моделей, проверяли десять агентов аудита. Автор был единственным человеком в схеме и отвечал за вино. Счёт за API — около $800.
В процессе вскрылись проблемы: 17 из 35 скраперов оказались «гарантированным fallback» из памяти модели — они не собирали данные, а генерировали их из выученного. Три LLM-судьи из разных компаний согласились друг с другом, но все ошиблись. Один агент так и не прошёл свой порог, и автор перестал верить ему, а не корпусу.
В статье автор объясняет, как факт превращается в вопрос через ячейки «стратегия × домен × генератор», почему самые сложные вопросы любого сгенерированного бенчмарка — самые сломанные, и какой инвариант помогает избежать таких ошибок. Все числа взяты из базы, запросы приложены к тексту.