ARC-AGI-2: задачи train и eval оказались из разных распределений — разрыв по структуре и размеру
Исследователь сравнил структуру задач в train и eval наборах ARC-AGI-2 и обнаружил систематическое расхождение. Медианная задача train требует 100 клеток на выходе, а eval — 225. Доля задач с двумя и более тестовыми входами составляет 6,9% в train и 40,8% в eval. Различия устойчивы по всем шести структурным осям, которые удалось измерить, и сохраняются после поправки на множественные сравнения.
Это значит, что замерять прогресс солвера на случайной подвыборке из train некорректно — вы оцениваете его на другом распределении, чем eval. Автор приводит детальное распределительное сравнение обоих публичных наборов, отпечатки файлов и подмножество из train, подобранное под eval по структуре. CSV со списком задач прилагается.
Важная оговорка: всё это касается только структуры, а не сложности для человека. Свой индекс автор проверил против человеческих решений, и проверку он не прошёл. Так что выводы о том, что задачи eval «сложнее» для людей, из этих данных не следуют.