Две школы генерации изображений: чем отличаются западные и китайские модели GenAI
В статье анализируется опыт работы с шестью популярными моделями генерации изображений: западными (Midjourney, DALL·E 3, FLUX) и китайскими (Hunyuan-DiT, Wanxiang, Seedream). Автор отмечает, что один и тот же запрос даёт принципиально разные результаты, и дело не в стилистике или языковом барьере, а в архитектурных решениях — датасетах, токенизаторах и глубине текстовых энкодеров.
Западные модели, по наблюдениям, лучше следуют инструкциям и точнее расставляют объекты, тогда как китайские выдают более высокую плотность деталей и сложные ракурсы, но могут игнорировать часть описания. Различия объясняются разными приоритетами при оптимизации: скорость/дешевизна/качество — каждая школа выбирает свою пару.
Несмотря на текущие различия, автор прогнозирует сближение подходов: обе школы постепенно заимствуют сильные стороны друг друга, и конвергенция технологий уже видна в новых версиях моделей. Статья предлагает взглянуть на историю развития графических движков и понять, в какие ниши выстраивается эта конвергенция.