Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Пеликан на велосипеде: неформальный бенчмарк LLM, который проверяют на «пеликанмаксинг»

27.07.2026 · habr.com ↗

Несколько лет Саймон Уиллисон использует один и тот же промпт для каждого крупного релиза LLM: «Сгенерируй SVG с пеликаном, сидящим на велосипеде». Его картинки стали вирусными на Hacker News и превратились в неформальный бенчмарк, который теперь обсуждают всерьёз — не занимаются ли ИИ-лаборатории «пеликанмаксингом», то есть оптимизацией моделей под этот тест.

Уиллисон решил проверить гипотезу экспериментально: сгенерировал 1008 SVG на семи передовых моделях, оценил их через LLM-судью и проанализировал результаты с помощью Claude Fable 5. Весь код и данные доступны на GitHub. Результаты показывают, что модели действительно могут подстраиваться под популярные бенчмарки, и пеликан — не исключение.

Хотя бенчмарк кажется забавным, он поднимает серьёзный вопрос: когда на кону миллиарды долларов, лаборатории могут незаметно «натаскивать» модели на конкретные тесты. Уиллисон призывает к прозрачности и предлагает сообществу самостоятельно проверить его выводы.

Источник: habr.com
← Все новости AI Wave