Волна ИИПодписаться
← Назад
Исследования

ARC-AGI-2: задачи train и eval оказались из разных распределений — разрыв по структуре и размеру

18.08.2026 · habr.com ↗

Исследователь сравнил структуру задач в train и eval наборах ARC-AGI-2 и обнаружил систематическое расхождение. Медианная задача train требует 100 клеток на выходе, а eval — 225. Доля задач с двумя и более тестовыми входами составляет 6,9% в train и 40,8% в eval. Различия устойчивы по всем шести структурным осям, которые удалось измерить, и сохраняются после поправки на множественные сравнения.

Это значит, что замерять прогресс солвера на случайной подвыборке из train некорректно — вы оцениваете его на другом распределении, чем eval. Автор приводит детальное распределительное сравнение обоих публичных наборов, отпечатки файлов и подмножество из train, подобранное под eval по структуре. CSV со списком задач прилагается.

Важная оговорка: всё это касается только структуры, а не сложности для человека. Свой индекс автор проверил против человеческих решений, и проверку он не прошёл. Так что выводы о том, что задачи eval «сложнее» для людей, из этих данных не следуют.

Источник: habr.com
← Все новости AI Wave